Welches Problem es löst
Wenn Nutzer einen YouTube-Link in einen Assistenten einfügen, verweigert dieser die Antwort, halluziniert anhand des Titels oder scheitert an langen Videos. Teams, die Agenten für Recherche, Vertrieb oder Support bauen, brauchen einen verlässlichen Weg, jedes Video in Text zu verwandeln, mit dem das Modell arbeiten kann – ohne Scraper zu pflegen, die bei jeder Änderung an YouTube kaputtgehen.
Was in die erste Version gehört
- Ein Tool, das das Modell mit jeder YouTube-URL oder Video-ID aufrufen kann
- Sauberer Transkripttext plus zeitgestempelte Segmente für Quellenangaben
- Sprachauswahl und Übersetzung für nicht englischsprachige Videos
- Chunking für lange Videos, damit sie in den Kontext des Modells passen
- Caching, damit dasselbe Video nicht zweimal abgerufen wird
Schritt für Schritt bauen
- 01
Integration wählen
Wenn Ihr Assistent das Model Context Protocol unterstützt, binden Sie den MCP-Server an – die Tools erscheinen automatisch. Andernfalls definieren Sie ein Function-Tool, das /transcribe aufruft.
- 02
Tool-Schnittstelle definieren
Nehmen Sie eine Video-URL und optional eine Sprache entgegen. Geben Sie den Transkripttext und eine Liste von Segmenten mit Startzeiten zurück.
- 03
Lange Videos verarbeiten
Bei Videos, die länger als Ihr Kontextfenster sind, teilen Sie die Segmente in Chunks und fassen jeden vor der Antwort zusammen – oder rufen nur die für die Frage relevanten Chunks ab.
- 04
Quelle angeben
Weisen Sie das Modell an, Zeitstempel aus den Segmenten zu zitieren, damit Nutzer jede Aussage überprüfen können.
Starter-Code
Diese Idee basiert auf dem Muster „Rezept 1: Ein Video rein, strukturierte Ausgabe raus“. Setzen Sie Ihre eigenen Kanäle, Prompts und Speicherlösungen ein.
import requests
API = "https://www.youtubetranscript.dev/api/v2"
HEADERS = {"Authorization": "Bearer yt_sk_live_YOUR_KEY"}
res = requests.post(f"{API}/transcribe", headers=HEADERS, json={
"video": "https://www.youtube.com/watch?v=VIDEO_ID",
"format": {"timestamp": True, "paragraphs": True},
}).json()
transcript = res["data"]["transcript"]
print(transcript["text"][:500]) # plain text for your LLM prompt
for seg in transcript["segments"][:3]: # timestamps for deep links
print(seg["start"], seg["text"])Warum es sich lohnt
Meist ist das ein Feature, kein eigenes Produkt: Es macht Ihren bestehenden Assistenten, Bot oder Copiloten spürbar nützlicher. Als eigenständiges Produkt kann ein Slack- oder Discord-Bot, der Fragen zu geteilten Videos beantwortet, pro Workspace abrechnen.
Fehler, die Sie vermeiden sollten
- Ein dreistündiges Transkript in einen einzigen Prompt stopfen: Rufen Sie stattdessen in Chunks ab oder fassen Sie sie zusammen.
- Zeitstempel weglassen – dann lassen sich Antworten nicht überprüfen.
- Dasselbe beliebte Video wiederholt abrufen, statt Transkripte zu cachen.
Fragen zu dieser Idee
Können ChatGPT oder Claude YouTube-Videos lesen?
Allein nicht zuverlässig. Mit einem Transkript-Tool oder MCP-Server können sie das vollständige Transkript jedes öffentlichen Videos mit Untertiteln lesen.
Was ist ein MCP-Server?
Das Model Context Protocol ist ein Standard, um KI-Assistenten Tools bereitzustellen. Unser MCP-Server stellt Transkript-Tools bereit, die kompatible Assistenten ohne eigenen Code aufrufen können.
Wie gehe ich mit sehr langen Videos um?
Teilen Sie die zeitgestempelten Segmente in Chunks auf und fassen Sie dann jeden Chunk zusammen oder rufen Sie nur die Chunks ab, die für die Frage des Nutzers relevant sind.