הבעיה שזה פותר
כשמשתמשים מדביקים קישור ל-YouTube בעוזר AI, הוא מסרב, ממציא תשובה מתוך הכותרת, או נכשל בסרטונים ארוכים. צוותים שבונים סוכנים למחקר, למכירות או לתמיכה צריכים דרך אמינה להפוך כל סרטון לטקסט שהמודל יכול לחשוב עליו, בלי לתחזק סקרייפרים שנשברים בכל פעם ש-YouTube משתנה.
מה לכלול בגרסה הראשונה
- כלי שהמודל יכול לקרוא לו עם כל כתובת YouTube או מזהה סרטון
- טקסט תמלול נקי ומקטעים עם חותמות זמן לציטוט
- בחירת שפה ותרגום לסרטונים שאינם באנגלית
- חלוקה למקטעים בסרטונים ארוכים כדי שייכנסו לחלון ההקשר של המודל
- שמירה במטמון כדי שאותו סרטון לא יישלף פעמיים
איך לבנות את זה, שלב אחר שלב
- 01
בחרו את סוג האינטגרציה
אם העוזר שלכם תומך ב-Model Context Protocol, חברו את שרת ה-MCP והכלים יופיעו אוטומטית. אחרת, הגדירו כלי פונקציה שקורא ל-/transcribe.
- 02
הגדירו את חוזה הכלי
קבלו כתובת סרטון ושפה אופציונלית. החזירו את טקסט התמלול ורשימת מקטעים עם זמני התחלה.
- 03
טפלו בסרטונים ארוכים
בסרטונים שארוכים מחלון ההקשר, חלקו את המקטעים לנתחים וסכמו כל אחד לפני המענה, או שלפו רק את הנתחים שרלוונטיים לשאלה.
- 04
צטטו את המקור
הנחו את המודל לצטט חותמות זמן מתוך המקטעים, כדי שמשתמשים יוכלו לאמת כל טענה.
קוד התחלתי
הרעיון הזה מבוסס על התבנית "מתכון 1: סרטון אחד נכנס, פלט מובנה יוצא". החליפו בערוצים, בפרומפטים ובאחסון שלכם.
import requests
API = "https://www.youtubetranscript.dev/api/v2"
HEADERS = {"Authorization": "Bearer yt_sk_live_YOUR_KEY"}
res = requests.post(f"{API}/transcribe", headers=HEADERS, json={
"video": "https://www.youtube.com/watch?v=VIDEO_ID",
"format": {"timestamp": True, "paragraphs": True},
}).json()
transcript = res["data"]["transcript"]
print(transcript["text"][:500]) # plain text for your LLM prompt
for seg in transcript["segments"][:3]: # timestamps for deep links
print(seg["start"], seg["text"])למה כדאי לבנות את זה
בדרך כלל זה פיצ'ר ולא מוצר: הוא הופך את העוזר, הבוט או הקופיילוט הקיים שלכם לשימושי הרבה יותר. כמוצר עצמאי, בוט ל-Slack או ל-Discord שעונה על שאלות לגבי סרטונים ששותפו יכול לגבות תשלום לכל סביבת עבודה.
טעויות שכדאי להימנע מהן
- דחיסה של תמלול בן שלוש שעות לפרומפט אחד: במקום זה, שלפו או סכמו בנתחים.
- השמטת חותמות הזמן, מה שהופך את התשובות לבלתי ניתנות לאימות.
- שליפה חוזרת של אותו סרטון פופולרי במקום לשמור תמלולים במטמון.
שאלות על הרעיון הזה
האם ChatGPT או Claude יכולים לקרוא סרטוני YouTube?
לא באופן אמין בעצמם. חיבור של כלי תמלול או שרת MCP מאפשר להם לקרוא את התמלול המלא של כל סרטון ציבורי עם כתוביות.
מה זה שרת MCP?
Model Context Protocol הוא תקן לחיבור כלים לעוזרי AI. שרת ה-MCP שלנו חושף כלי תמלול שעוזרים תואמים יכולים לקרוא להם בלי קוד מותאם אישית.
איך מטפלים בסרטונים ארוכים מאוד?
חלקו את המקטעים עם חותמות הזמן לנתחים, ואז סכמו כל נתח או שלפו רק את הנתחים שרלוונטיים לשאלת המשתמש.