הבעיה שזה פותר
בודקי עובדות יכולים לחפש בפלטפורמות טקסט, אבל וידאו הוא ברובו קופסה שחורה. טענות חוזרות בניסוחים מעט שונים בעשרות ערוצים, ותיעוד ההתפשטות שלהן מחייב צפייה בשעות של חומר. חוקרים צריכים תמלולים שאפשר לחפש בהם, התאמה סמנטית לפרפרזות ותיעוד שניתן לאמת של כל הופעה.
מה לכלול בגרסה הראשונה
- ניטור של קבוצה מוגדרת של ערוצים
- חיפוש סמנטי לפרפרזות של טענה, לא רק לניסוח המדויק
- ציר זמן שמראה את ההופעה הראשונה ואת ההתפשטות
- ציטוטים עם קישורים עם חותמות זמן לאימות
- ראיות שאפשר לייצא לדוחות ולפרסומים
איך לבנות את זה, שלב אחר שלב
- 01
אספו תמלולים
המירו את הערוצים שבתחום המחקר ושלפו במנות את הסרטונים שלהם לחלון הזמן שלכם. המשיכו לנטר העלאות חדשות אם המחקר מתמשך.
- 02
צרו embeddings למקטעים
צרו embeddings לכל פסקה בתמלול כדי שתוכלו למצוא אמירות בעלות משמעות דומה.
- 03
חפשו את הטענה
צרו embeddings לכמה ניסוחים של הטענה, שלפו קטעים דומים, ותנו לבודק אנושי או ל-LLM לאשר אילו מהם באמת טוענים את הטענה.
- 04
בנו את ציר הזמן
סדרו את ההתאמות המאושרות לפי תאריך פרסום וייצאו אותן עם הערוץ, הציטוט והקישור עם חותמת הזמן.
קוד התחלתי
הרעיון הזה מבוסס על התבנית "מתכון 2: מעקב אחרי ערוצים והתראה על העלאות חדשות". החליפו בערוצים, בפרומפטים ובאחסון שלכם.
import requests
API = "https://www.youtubetranscript.dev/api/v2"
HEADERS = {"Authorization": "Bearer yt_sk_live_YOUR_KEY"}
WATCHLIST = ["@somechannel", "@anotherchannel"]
KEYWORDS = ["your brand", "competitor"]
seen = set() # persist this in a database in production
for handle in WATCHLIST:
latest = requests.post(f"{API}/channels/resolve", headers=HEADERS,
json={"handle": handle, "limit": 10}).json()
for video in latest["items"]:
if video["video_id"] in seen:
continue
seen.add(video["video_id"])
t = requests.post(f"{API}/transcribe", headers=HEADERS,
json={"video": video["video_id"]}).json()
text = t.get("data", {}).get("transcript", {}).get("text", "").lower()
hits = [k for k in KEYWORDS if k in text]
if hits:
print(f"ALERT {video['title']}: {hits}")למה כדאי לבנות את זה
ארגוני בדיקת עובדות וקבוצות מחקר מרוויחים מהירות וראיות שניתן לאמת. צוותי אמון ובטיחות וחברות ניטור מדיה ישלמו על כלים שמכסים גם וידאו.
טעויות שכדאי להימנע מהן
- התייחסות להתאמות אוטומטיות כמסקנות: תמיד תנו לאדם לאשר לפני פרסום.
- חיפוש רק של ביטויים מדויקים: טענות משתנות, אז השתמשו בחיפוש סמנטי עם כמה ניסוחים.
- איבוד המקור: שמרו את מזהה הסרטון, חותמת הזמן ותאריך השליפה לכל ציטוט.
שאלות על הרעיון הזה
איך בודקי עובדות מחפשים בסרטוני YouTube?
על ידי תמלול הסרטונים וחיפוש בטקסט. חיפוש סמנטי מוצא פרפרזות שחיפוש לפי מילות מפתח היה מפספס.
אפשר להוכיח מתי טענה נאמרה לראשונה ב-YouTube?
אפשר לתעד את ההופעה המוקדמת ביותר בתוך הערוצים שאתם מנטרים, עם תאריך הפרסום וחותמת הזמן. היקף הכיסוי קובע עד כמה התמונה שלמה.
ומה לגבי סרטונים בלי כתוביות?
הפעילו זיהוי דיבור מבוסס AI, כך שגם סרטונים בלי כתוביות יתומללו ויהיו ניתנים לחיפוש.