מדריך בנייה · חוקרים

איך לבנות כלי למעקב אחרי טענות ומידע כוזב ב-YouTube

טענות כוזבות ומטעות מתפשטות לעיתים קרובות בווידאו מדובר עוד לפני שהן מופיעות בטקסט. כלי מעקב אחרי טענות מחפש בתמלולים של ערוצים רבים כדי להראות מי אמר מה, מתי זה הופיע לראשונה ואיך הניסוח השתנה, עם קישורים לאימות כל ציטוט.

למי זה מתאים
בודקי עובדות, בתי ספר לעיתונאות, חוקרי אמון ובטיחות
זמן פיתוח
1–2 שבועות
נקודות קצה של ה-API
/batch/transcripts/{video_id}

הבעיה שזה פותר

בודקי עובדות יכולים לחפש בפלטפורמות טקסט, אבל וידאו הוא ברובו קופסה שחורה. טענות חוזרות בניסוחים מעט שונים בעשרות ערוצים, ותיעוד ההתפשטות שלהן מחייב צפייה בשעות של חומר. חוקרים צריכים תמלולים שאפשר לחפש בהם, התאמה סמנטית לפרפרזות ותיעוד שניתן לאמת של כל הופעה.

מה לכלול בגרסה הראשונה

  • ניטור של קבוצה מוגדרת של ערוצים
  • חיפוש סמנטי לפרפרזות של טענה, לא רק לניסוח המדויק
  • ציר זמן שמראה את ההופעה הראשונה ואת ההתפשטות
  • ציטוטים עם קישורים עם חותמות זמן לאימות
  • ראיות שאפשר לייצא לדוחות ולפרסומים

איך לבנות את זה, שלב אחר שלב

  1. 01

    אספו תמלולים

    המירו את הערוצים שבתחום המחקר ושלפו במנות את הסרטונים שלהם לחלון הזמן שלכם. המשיכו לנטר העלאות חדשות אם המחקר מתמשך.

  2. 02

    צרו embeddings למקטעים

    צרו embeddings לכל פסקה בתמלול כדי שתוכלו למצוא אמירות בעלות משמעות דומה.

  3. 03

    חפשו את הטענה

    צרו embeddings לכמה ניסוחים של הטענה, שלפו קטעים דומים, ותנו לבודק אנושי או ל-LLM לאשר אילו מהם באמת טוענים את הטענה.

  4. 04

    בנו את ציר הזמן

    סדרו את ההתאמות המאושרות לפי תאריך פרסום וייצאו אותן עם הערוץ, הציטוט והקישור עם חותמת הזמן.

קוד התחלתי

הרעיון הזה מבוסס על התבנית "מתכון 2: מעקב אחרי ערוצים והתראה על העלאות חדשות". החליפו בערוצים, בפרומפטים ובאחסון שלכם.

import requests

API = "https://www.youtubetranscript.dev/api/v2"
HEADERS = {"Authorization": "Bearer yt_sk_live_YOUR_KEY"}

WATCHLIST = ["@somechannel", "@anotherchannel"]
KEYWORDS = ["your brand", "competitor"]
seen = set()  # persist this in a database in production

for handle in WATCHLIST:
    latest = requests.post(f"{API}/channels/resolve", headers=HEADERS,
                           json={"handle": handle, "limit": 10}).json()
    for video in latest["items"]:
        if video["video_id"] in seen:
            continue
        seen.add(video["video_id"])
        t = requests.post(f"{API}/transcribe", headers=HEADERS,
                          json={"video": video["video_id"]}).json()
        text = t.get("data", {}).get("transcript", {}).get("text", "").lower()
        hits = [k for k in KEYWORDS if k in text]
        if hits:
            print(f"ALERT {video['title']}: {hits}")

למה כדאי לבנות את זה

ארגוני בדיקת עובדות וקבוצות מחקר מרוויחים מהירות וראיות שניתן לאמת. צוותי אמון ובטיחות וחברות ניטור מדיה ישלמו על כלים שמכסים גם וידאו.

טעויות שכדאי להימנע מהן

  • התייחסות להתאמות אוטומטיות כמסקנות: תמיד תנו לאדם לאשר לפני פרסום.
  • חיפוש רק של ביטויים מדויקים: טענות משתנות, אז השתמשו בחיפוש סמנטי עם כמה ניסוחים.
  • איבוד המקור: שמרו את מזהה הסרטון, חותמת הזמן ותאריך השליפה לכל ציטוט.

שאלות על הרעיון הזה

איך בודקי עובדות מחפשים בסרטוני YouTube?

על ידי תמלול הסרטונים וחיפוש בטקסט. חיפוש סמנטי מוצא פרפרזות שחיפוש לפי מילות מפתח היה מפספס.

אפשר להוכיח מתי טענה נאמרה לראשונה ב-YouTube?

אפשר לתעד את ההופעה המוקדמת ביותר בתוך הערוצים שאתם מנטרים, עם תאריך הפרסום וחותמת הזמן. היקף הכיסוי קובע עד כמה התמונה שלמה.

ומה לגבי סרטונים בלי כתוביות?

הפעילו זיהוי דיבור מבוסס AI, כך שגם סרטונים בלי כתוביות יתומללו ויהיו ניתנים לחיפוש.

התחילו לבנות עוד היום

10 קרדיטים בחינם בכל חודש. לא צריך כרטיס אשראי.

איך לבנות כלי למעקב אחרי טענות ומידע כוזב ב-YouTube | YouTubeTranscript.dev