Welches Problem es löst
Faktenchecker können Textplattformen durchsuchen, Videos aber bleiben weitgehend undurchsichtig. Behauptungen werden auf Dutzenden Kanälen in leicht abgewandelter Form wiederholt, und ihre Verbreitung zu dokumentieren heißt, stundenlang Material zu sichten. Forschende brauchen durchsuchbare Transkripte, semantischen Abgleich für Umschreibungen und einen überprüfbaren Nachweis jedes Vorkommens.
Was in die erste Version gehört
- Überwachung einer definierten Gruppe von Kanälen
- Semantische Suche nach Umschreibungen einer Behauptung, nicht nur nach dem exakten Wortlaut
- Eine Zeitleiste mit erstem Auftreten und Verbreitung
- Zitate mit zeitgestempelten Links zur Überprüfung
- Exportierbare Belege für Berichte und Veröffentlichungen
Schritt für Schritt bauen
- 01
Transkripte erheben
Lösen Sie die relevanten Kanäle auf und rufen Sie deren Videos für Ihren Zeitraum per Batch ab. Überwachen Sie bei laufenden Studien weiterhin neue Uploads.
- 02
Embeddings für Segmente erzeugen
Erzeugen Sie Embeddings für jeden Transkriptabsatz, damit Sie Aussagen mit ähnlicher Bedeutung finden.
- 03
Nach der Behauptung suchen
Erzeugen Sie Embeddings für mehrere Formulierungen der Behauptung, rufen Sie ähnliche Passagen ab und lassen Sie eine prüfende Person oder ein LLM bestätigen, welche davon die Behauptung tatsächlich aufstellen.
- 04
Zeitleiste erstellen
Sortieren Sie bestätigte Treffer nach Veröffentlichungsdatum und exportieren Sie sie mit Kanal, Zitat und zeitgestempeltem Link.
Starter-Code
Diese Idee basiert auf dem Muster „Rezept 2: Kanäle beobachten und bei neuen Uploads benachrichtigen“. Setzen Sie Ihre eigenen Kanäle, Prompts und Speicherlösungen ein.
import requests
API = "https://www.youtubetranscript.dev/api/v2"
HEADERS = {"Authorization": "Bearer yt_sk_live_YOUR_KEY"}
WATCHLIST = ["@somechannel", "@anotherchannel"]
KEYWORDS = ["your brand", "competitor"]
seen = set() # persist this in a database in production
for handle in WATCHLIST:
latest = requests.post(f"{API}/channels/resolve", headers=HEADERS,
json={"handle": handle, "limit": 10}).json()
for video in latest["items"]:
if video["video_id"] in seen:
continue
seen.add(video["video_id"])
t = requests.post(f"{API}/transcribe", headers=HEADERS,
json={"video": video["video_id"]}).json()
text = t.get("data", {}).get("transcript", {}).get("text", "").lower()
hits = [k for k in KEYWORDS if k in text]
if hits:
print(f"ALERT {video['title']}: {hits}")Warum es sich lohnt
Faktencheck-Organisationen und Forschungsgruppen gewinnen Tempo und überprüfbare Belege. Trust-and-Safety-Teams und Medienbeobachtungsfirmen zahlen für Tools, die auch Videos abdecken.
Fehler, die Sie vermeiden sollten
- Automatische Treffer als Schlussfolgerung behandeln: Lassen Sie vor jeder Veröffentlichung immer einen Menschen bestätigen.
- Nur nach exakten Phrasen suchen: Behauptungen verändern sich, nutzen Sie also semantische Suche mit mehreren Formulierungen.
- Die Herkunft verlieren: Bewahren Sie für jedes Zitat Video-ID, Zeitstempel und Abrufdatum auf.
Fragen zu dieser Idee
Wie durchsuchen Faktenchecker YouTube-Videos?
Indem sie Videos transkribieren und den Text durchsuchen. Semantische Suche findet Umschreibungen, die eine Stichwortsuche übersehen würde.
Kann ich nachweisen, wann eine Behauptung zuerst auf YouTube aufgestellt wurde?
Sie können das früheste Vorkommen innerhalb der überwachten Kanäle mit Veröffentlichungsdatum und Zeitstempel dokumentieren. Wie vollständig dieses Bild ist, hängt von der Abdeckung ab.
Was ist mit Videos ohne Untertitel?
Aktivieren Sie die KI-Spracherkennung, damit auch Videos ohne Untertitel transkribiert und durchsuchbar werden.