BAUANLEITUNG · FORSCHER

So bauen Sie ein YouTube-Transkript-Korpus für die Diskursanalyse auf

YouTube ist ein zentraler Ort für politische Kommentare, Nachrichten, Bildung und Kultur – doch die Forschung hat die Plattform bisher meist über Titel, Kommentare und Aufrufzahlen untersucht. Mit Transkripten können Sie analysieren, was tatsächlich gesagt wird, in großem Umfang und mit Zeitstempel für jedes Zitat.

Für wen
Forschende in Kommunikations-, Medien-, Politikwissenschaft und Linguistik
Bauzeit
1–2 Wochen
API-Endpunkte
/channels/resolve/batch/transcripts

Welches Problem es löst

Manuelle Transkription beschränkt Studien auf ein paar Dutzend Videos, und improvisierte Scraping-Skripte brechen und sind schwer zu reproduzieren. Forschende brauchen einen verlässlichen Weg, vollständige Transkripte für eine definierte Stichprobe von Kanälen und Zeiträumen zu erheben, sie mit Metadaten zu speichern und ihre Methode so zu dokumentieren, dass andere sie replizieren können.

Was in die erste Version gehört

  • Eine dokumentierte Kanalstichprobe und ein Zeitraum
  • Vollständige Transkripte als Roh-JSON mit Metadaten
  • Untertitelquelle pro Video erfasst (manuell, automatisch oder KI)
  • Export als CSV oder Text für R, Python, NVivo oder ATLAS.ti
  • Ein wiederholt ausführbares Erhebungsskript zur Replikation

Schritt für Schritt bauen

  1. 01

    Stichprobe festlegen

    Listen Sie die Kanäle und den Untersuchungszeitraum auf und halten Sie Ihre Einschlusskriterien für den Methodenteil fest.

  2. 02

    Videolisten auflösen

    Rufen Sie für jeden Kanal /channels/resolve auf und filtern Sie die Ergebnisse nach Veröffentlichungsdatum.

  3. 03

    Transkripte erheben

    Senden Sie Video-IDs an /batch und speichern Sie die vollständige JSON-Antwort, einschließlich Sprache und Untertitelquelle jedes Transkripts.

  4. 04

    Für die Analyse aufbereiten

    Exportieren Sie Transkripte als Text oder CSV mit Video-ID, Kanal, Datum und Zeitstempeln und analysieren Sie sie mit Topic Models, Worthäufigkeiten oder qualitativer Kodierung.

Starter-Code

Diese Idee basiert auf dem Muster „Rezept 3: Eine Playlist gesammelt in eine Wissensdatenbank laden“. Setzen Sie Ihre eigenen Kanäle, Prompts und Speicherlösungen ein.

import requests

API = "https://www.youtubetranscript.dev/api/v2"
HEADERS = {"Authorization": "Bearer yt_sk_live_YOUR_KEY"}

playlist = requests.post(f"{API}/playlists/resolve", headers=HEADERS,
                         json={"playlist_url": "https://www.youtube.com/playlist?list=PLAYLIST_ID",
                               "limit": 100}).json()

ids = [v["video_id"] for v in playlist["items"]]
batch = requests.post(f"{API}/batch", headers=HEADERS, json={
    "video_ids": ids,
    "format": {"timestamp": True, "paragraphs": True},
}).json()

# Large batches run async: poll GET /batch/{batch_id} until status is "completed"
for r in batch.get("results", []):
    if r["status"] == "completed":
        for p in r["data"]["transcript"].get("paragraphs") or []:
            store(video_id=r["video_id"], start=p["start"], text=p["text"])  # your vector DB

Warum es sich lohnt

Für Forschende liegt der Gewinn in einem reproduzierbaren Datensatz zu einem Bruchteil der Kosten und Zeit manueller Transkription. Teams bauen außerdem kostenpflichtige Datensätze oder Analysedienste für Medienbeobachtungsfirmen und Thinktanks.

Fehler, die Sie vermeiden sollten

  • Automatische und menschliche Untertitel vermischen, ohne es zu vermerken: Erfassen Sie die Untertitelquelle, denn die Genauigkeit unterscheidet sich.
  • Rohantworten nicht speichern: Bewahren Sie das Original-JSON auf, damit Ihre Analyse erneut ausgeführt werden kann.
  • Ethikprüfung und Plattformbedingungen ignorieren: Prüfen Sie die Anforderungen Ihrer Einrichtung und die YouTube-Nutzungsbedingungen, bevor Sie Datensätze veröffentlichen.

Fragen zu dieser Idee

Darf ich YouTube-Transkripte für wissenschaftliche Forschung nutzen?

Viele Forschende tun das. Prüfen Sie die Ethikanforderungen Ihrer Einrichtung, die YouTube-Nutzungsbedingungen und das Urheberrecht, besonders bevor Sie einen Datensatz öffentlich teilen.

Wie genau sind automatische YouTube-Untertitel?

Das hängt von Audioqualität, Akzenten und Thema ab. Die API gibt an, ob ein Transkript aus manuellen Untertiteln, automatischen Untertiteln oder KI-Spracherkennung stammt, sodass Sie das berücksichtigen können.

Wie viele Videos kann ich auf einmal erheben?

Eine einzelne Batch-Anfrage akzeptiert im Business-Tarif bis zu 3.000 Video-IDs. Größere Studien können mehrere Batches ausführen.

Fangen Sie noch heute an

10 kostenlose Credits pro Monat. Keine Kreditkarte nötig.

YouTube-Transkript-Korpus für die Forschung aufbauen | YouTubeTranscript.dev