बिल्ड गाइड · रिसर्चर्स

डिस्कोर्स एनालिसिस के लिए YouTube ट्रांसक्रिप्ट कॉर्पस कैसे बनाएं

YouTube राजनीतिक कमेंट्री, न्यूज़, शिक्षा और संस्कृति का मुख्य मंच है, लेकिन रिसर्चर्स ने इसे ज़्यादातर टाइटल, कमेंट और व्यू काउंट के ज़रिए ही पढ़ा है। ट्रांसक्रिप्ट से आप बड़े पैमाने पर एनालाइज़ कर सकते हैं कि असल में क्या कहा गया, हर कोट के टाइमस्टैम्प के साथ।

किसके लिए
कम्युनिकेशन, मीडिया स्टडीज़, राजनीति विज्ञान और भाषाविज्ञान के रिसर्चर
बनाने में समय
1–2 हफ़्ते
API एंडपॉइंट
/channels/resolve/batch/transcripts

यह कौन सी समस्या हल करता है

हाथ से ट्रांसक्रिप्शन अध्ययन को कुछ दर्जन वीडियो तक सीमित कर देता है, और जुगाड़ू स्क्रेपिंग स्क्रिप्ट टूट जाती हैं और उन्हें दोहराना मुश्किल होता है। रिसर्चर्स को चैनलों और तारीखों के तय सैंपल के लिए पूरे ट्रांसक्रिप्ट इकट्ठा करने, उन्हें मेटाडेटा के साथ स्टोर करने, और अपना तरीका शेयर करने का भरोसेमंद ज़रिया चाहिए ताकि दूसरे उसे दोहरा सकें।

पहले वर्ज़न में क्या शामिल करें

  • चैनलों का डॉक्यूमेंटेड सैंपल और तारीख की सीमा
  • मेटाडेटा के साथ कच्चे JSON के रूप में स्टोर किए पूरे ट्रांसक्रिप्ट
  • हर वीडियो के लिए कैप्शन सोर्स का रिकॉर्ड (मैनुअल, ऑटोमैटिक या AI)
  • R, Python, NVivo या ATLAS.ti के लिए CSV या टेक्स्ट में एक्सपोर्ट
  • रेप्लिकेशन के लिए दोबारा चलाई जा सकने वाली कलेक्शन स्क्रिप्ट

इसे कैसे बनाएं, स्टेप बाय स्टेप

  1. 01

    सैंपल तय करें

    जिन चैनलों और समय-सीमा का अध्ययन करेंगे उनकी लिस्ट बनाएं, और मेथड्स सेक्शन के लिए शामिल करने के मानदंड दर्ज करें।

  2. 02

    वीडियो लिस्ट resolve करें

    हर चैनल के लिए /channels/resolve कॉल करें और नतीजों को पब्लिश डेट से फ़िल्टर करें।

  3. 03

    ट्रांसक्रिप्ट इकट्ठा करें

    वीडियो ID को /batch पर भेजें और पूरा JSON रिस्पॉन्स स्टोर करें, जिसमें हर ट्रांसक्रिप्ट की भाषा और कैप्शन सोर्स शामिल हो।

  4. 04

    एनालिसिस के लिए तैयार करें

    ट्रांसक्रिप्ट को वीडियो ID, चैनल, तारीख और टाइमस्टैम्प के साथ टेक्स्ट या CSV में एक्सपोर्ट करें, फिर टॉपिक मॉडल, कीवर्ड फ़्रीक्वेंसी या क्वालिटेटिव कोडिंग से एनालाइज़ करें।

स्टार्टर कोड

यह आइडिया "रेसिपी 3: पूरी प्लेलिस्ट को नॉलेज बेस में लोड करें" पैटर्न पर बना है। अपने चैनल, प्रॉम्प्ट और स्टोरेज लगाएं।

import requests

API = "https://www.youtubetranscript.dev/api/v2"
HEADERS = {"Authorization": "Bearer yt_sk_live_YOUR_KEY"}

playlist = requests.post(f"{API}/playlists/resolve", headers=HEADERS,
                         json={"playlist_url": "https://www.youtube.com/playlist?list=PLAYLIST_ID",
                               "limit": 100}).json()

ids = [v["video_id"] for v in playlist["items"]]
batch = requests.post(f"{API}/batch", headers=HEADERS, json={
    "video_ids": ids,
    "format": {"timestamp": True, "paragraphs": True},
}).json()

# Large batches run async: poll GET /batch/{batch_id} until status is "completed"
for r in batch.get("results", []):
    if r["status"] == "completed":
        for p in r["data"]["transcript"].get("paragraphs") or []:
            store(video_id=r["video_id"], start=p["start"], text=p["text"])  # your vector DB

इसे बनाना क्यों फायदेमंद है

रिसर्चर्स के लिए फ़ायदा है हाथ से ट्रांसक्रिप्शन की लागत और समय के छोटे से हिस्से में दोबारा बनाया जा सकने वाला डेटासेट। टीमें मीडिया मॉनिटरिंग फ़र्मों और थिंक टैंक के लिए पेड डेटासेट या एनालिटिक्स सर्विस भी बनाती हैं।

इन गलतियों से बचें

  • ऑटोमैटिक और इंसानी कैप्शन को बिना नोट किए मिलाना: कैप्शन सोर्स दर्ज करें क्योंकि सटीकता अलग होती है।
  • कच्चे रिस्पॉन्स सेव न करना: मूल JSON स्टोर करें ताकि आपका एनालिसिस दोबारा चलाया जा सके।
  • एथिक्स रिव्यू और प्लेटफ़ॉर्म की शर्तों को नज़रअंदाज़ करना: डेटासेट पब्लिश करने से पहले अपने संस्थान की ज़रूरतें और YouTube की शर्तें जांचें।

इस आइडिया से जुड़े सवाल

क्या मैं एकेडमिक रिसर्च के लिए YouTube ट्रांसक्रिप्ट इस्तेमाल कर सकता हूं?

कई रिसर्चर करते हैं। अपने संस्थान की एथिक्स ज़रूरतें, YouTube की शर्तें और कॉपीराइट कानून जांचें, खासकर डेटासेट को सार्वजनिक रूप से शेयर करने से पहले।

YouTube के ऑटोमैटिक कैप्शन कितने सटीक होते हैं?

यह ऑडियो क्वालिटी, लहजे और विषय पर निर्भर करता है। API बताता है कि हर ट्रांसक्रिप्ट मैनुअल कैप्शन, ऑटोमैटिक कैप्शन या AI स्पीच रिकग्निशन से आया, ताकि आप इसका ध्यान रख सकें।

मैं एक साथ कितने वीडियो इकट्ठा कर सकता हूं?

Business प्लान पर एक बैच रिक्वेस्ट में 3,000 वीडियो ID तक भेजी जा सकती हैं। बड़े अध्ययन कई बैच चला सकते हैं।

आज ही बनाना शुरू करें

हर महीने 10 मुफ़्त क्रेडिट। क्रेडिट कार्ड की ज़रूरत नहीं।

रिसर्च के लिए YouTube ट्रांसक्रिप्ट कॉर्पस कैसे बनाएं | YouTubeTranscript.dev