BAUANLEITUNG · APP-ENTWICKLER

So bringen Sie Ihrem KI-Agenten bei, YouTube-Videos zu verstehen

Sprachmodelle können keine Videos ansehen, und die meisten können YouTube-Transkripte nicht zuverlässig selbst abrufen. Geben Sie ihnen ein Transkript-Tool, und sie können einen Vortrag zusammenfassen, zwei Testberichte vergleichen oder Fragen zu einer Vorlesung beantworten – mit Verweisen auf die Stelle, an der etwas gesagt wurde.

Für wen
Agent-Entwickler, interne Copiloten, Recherche-Assistenten, Slack- und Discord-Bots
Bauzeit
Ein Nachmittag
API-Endpunkte
/transcribeMCP server

Welches Problem es löst

Wenn Nutzer einen YouTube-Link in einen Assistenten einfügen, verweigert dieser die Antwort, halluziniert anhand des Titels oder scheitert an langen Videos. Teams, die Agenten für Recherche, Vertrieb oder Support bauen, brauchen einen verlässlichen Weg, jedes Video in Text zu verwandeln, mit dem das Modell arbeiten kann – ohne Scraper zu pflegen, die bei jeder Änderung an YouTube kaputtgehen.

Was in die erste Version gehört

  • Ein Tool, das das Modell mit jeder YouTube-URL oder Video-ID aufrufen kann
  • Sauberer Transkripttext plus zeitgestempelte Segmente für Quellenangaben
  • Sprachauswahl und Übersetzung für nicht englischsprachige Videos
  • Chunking für lange Videos, damit sie in den Kontext des Modells passen
  • Caching, damit dasselbe Video nicht zweimal abgerufen wird

Schritt für Schritt bauen

  1. 01

    Integration wählen

    Wenn Ihr Assistent das Model Context Protocol unterstützt, binden Sie den MCP-Server an – die Tools erscheinen automatisch. Andernfalls definieren Sie ein Function-Tool, das /transcribe aufruft.

  2. 02

    Tool-Schnittstelle definieren

    Nehmen Sie eine Video-URL und optional eine Sprache entgegen. Geben Sie den Transkripttext und eine Liste von Segmenten mit Startzeiten zurück.

  3. 03

    Lange Videos verarbeiten

    Bei Videos, die länger als Ihr Kontextfenster sind, teilen Sie die Segmente in Chunks und fassen jeden vor der Antwort zusammen – oder rufen nur die für die Frage relevanten Chunks ab.

  4. 04

    Quelle angeben

    Weisen Sie das Modell an, Zeitstempel aus den Segmenten zu zitieren, damit Nutzer jede Aussage überprüfen können.

Starter-Code

Diese Idee basiert auf dem Muster „Rezept 1: Ein Video rein, strukturierte Ausgabe raus“. Setzen Sie Ihre eigenen Kanäle, Prompts und Speicherlösungen ein.

import requests

API = "https://www.youtubetranscript.dev/api/v2"
HEADERS = {"Authorization": "Bearer yt_sk_live_YOUR_KEY"}

res = requests.post(f"{API}/transcribe", headers=HEADERS, json={
    "video": "https://www.youtube.com/watch?v=VIDEO_ID",
    "format": {"timestamp": True, "paragraphs": True},
}).json()

transcript = res["data"]["transcript"]
print(transcript["text"][:500])        # plain text for your LLM prompt
for seg in transcript["segments"][:3]:  # timestamps for deep links
    print(seg["start"], seg["text"])

Warum es sich lohnt

Meist ist das ein Feature, kein eigenes Produkt: Es macht Ihren bestehenden Assistenten, Bot oder Copiloten spürbar nützlicher. Als eigenständiges Produkt kann ein Slack- oder Discord-Bot, der Fragen zu geteilten Videos beantwortet, pro Workspace abrechnen.

Fehler, die Sie vermeiden sollten

  • Ein dreistündiges Transkript in einen einzigen Prompt stopfen: Rufen Sie stattdessen in Chunks ab oder fassen Sie sie zusammen.
  • Zeitstempel weglassen – dann lassen sich Antworten nicht überprüfen.
  • Dasselbe beliebte Video wiederholt abrufen, statt Transkripte zu cachen.

Fragen zu dieser Idee

Können ChatGPT oder Claude YouTube-Videos lesen?

Allein nicht zuverlässig. Mit einem Transkript-Tool oder MCP-Server können sie das vollständige Transkript jedes öffentlichen Videos mit Untertiteln lesen.

Was ist ein MCP-Server?

Das Model Context Protocol ist ein Standard, um KI-Assistenten Tools bereitzustellen. Unser MCP-Server stellt Transkript-Tools bereit, die kompatible Assistenten ohne eigenen Code aufrufen können.

Wie gehe ich mit sehr langen Videos um?

Teilen Sie die zeitgestempelten Segmente in Chunks auf und fassen Sie dann jeden Chunk zusammen oder rufen Sie nur die Chunks ab, die für die Frage des Nutzers relevant sind.

Fangen Sie noch heute an

10 kostenlose Credits pro Monat. Keine Kreditkarte nötig.

KI-Agenten Zugriff auf YouTube-Videos geben (MCP) | YouTubeTranscript.dev