यह कौन सी समस्या हल करता है
हाथ से ट्रांसक्रिप्शन अध्ययन को कुछ दर्जन वीडियो तक सीमित कर देता है, और जुगाड़ू स्क्रेपिंग स्क्रिप्ट टूट जाती हैं और उन्हें दोहराना मुश्किल होता है। रिसर्चर्स को चैनलों और तारीखों के तय सैंपल के लिए पूरे ट्रांसक्रिप्ट इकट्ठा करने, उन्हें मेटाडेटा के साथ स्टोर करने, और अपना तरीका शेयर करने का भरोसेमंद ज़रिया चाहिए ताकि दूसरे उसे दोहरा सकें।
पहले वर्ज़न में क्या शामिल करें
- चैनलों का डॉक्यूमेंटेड सैंपल और तारीख की सीमा
- मेटाडेटा के साथ कच्चे JSON के रूप में स्टोर किए पूरे ट्रांसक्रिप्ट
- हर वीडियो के लिए कैप्शन सोर्स का रिकॉर्ड (मैनुअल, ऑटोमैटिक या AI)
- R, Python, NVivo या ATLAS.ti के लिए CSV या टेक्स्ट में एक्सपोर्ट
- रेप्लिकेशन के लिए दोबारा चलाई जा सकने वाली कलेक्शन स्क्रिप्ट
इसे कैसे बनाएं, स्टेप बाय स्टेप
- 01
सैंपल तय करें
जिन चैनलों और समय-सीमा का अध्ययन करेंगे उनकी लिस्ट बनाएं, और मेथड्स सेक्शन के लिए शामिल करने के मानदंड दर्ज करें।
- 02
वीडियो लिस्ट resolve करें
हर चैनल के लिए /channels/resolve कॉल करें और नतीजों को पब्लिश डेट से फ़िल्टर करें।
- 03
ट्रांसक्रिप्ट इकट्ठा करें
वीडियो ID को /batch पर भेजें और पूरा JSON रिस्पॉन्स स्टोर करें, जिसमें हर ट्रांसक्रिप्ट की भाषा और कैप्शन सोर्स शामिल हो।
- 04
एनालिसिस के लिए तैयार करें
ट्रांसक्रिप्ट को वीडियो ID, चैनल, तारीख और टाइमस्टैम्प के साथ टेक्स्ट या CSV में एक्सपोर्ट करें, फिर टॉपिक मॉडल, कीवर्ड फ़्रीक्वेंसी या क्वालिटेटिव कोडिंग से एनालाइज़ करें।
स्टार्टर कोड
यह आइडिया "रेसिपी 3: पूरी प्लेलिस्ट को नॉलेज बेस में लोड करें" पैटर्न पर बना है। अपने चैनल, प्रॉम्प्ट और स्टोरेज लगाएं।
import requests
API = "https://www.youtubetranscript.dev/api/v2"
HEADERS = {"Authorization": "Bearer yt_sk_live_YOUR_KEY"}
playlist = requests.post(f"{API}/playlists/resolve", headers=HEADERS,
json={"playlist_url": "https://www.youtube.com/playlist?list=PLAYLIST_ID",
"limit": 100}).json()
ids = [v["video_id"] for v in playlist["items"]]
batch = requests.post(f"{API}/batch", headers=HEADERS, json={
"video_ids": ids,
"format": {"timestamp": True, "paragraphs": True},
}).json()
# Large batches run async: poll GET /batch/{batch_id} until status is "completed"
for r in batch.get("results", []):
if r["status"] == "completed":
for p in r["data"]["transcript"].get("paragraphs") or []:
store(video_id=r["video_id"], start=p["start"], text=p["text"]) # your vector DBइसे बनाना क्यों फायदेमंद है
रिसर्चर्स के लिए फ़ायदा है हाथ से ट्रांसक्रिप्शन की लागत और समय के छोटे से हिस्से में दोबारा बनाया जा सकने वाला डेटासेट। टीमें मीडिया मॉनिटरिंग फ़र्मों और थिंक टैंक के लिए पेड डेटासेट या एनालिटिक्स सर्विस भी बनाती हैं।
इन गलतियों से बचें
- ऑटोमैटिक और इंसानी कैप्शन को बिना नोट किए मिलाना: कैप्शन सोर्स दर्ज करें क्योंकि सटीकता अलग होती है।
- कच्चे रिस्पॉन्स सेव न करना: मूल JSON स्टोर करें ताकि आपका एनालिसिस दोबारा चलाया जा सके।
- एथिक्स रिव्यू और प्लेटफ़ॉर्म की शर्तों को नज़रअंदाज़ करना: डेटासेट पब्लिश करने से पहले अपने संस्थान की ज़रूरतें और YouTube की शर्तें जांचें।
इस आइडिया से जुड़े सवाल
क्या मैं एकेडमिक रिसर्च के लिए YouTube ट्रांसक्रिप्ट इस्तेमाल कर सकता हूं?
कई रिसर्चर करते हैं। अपने संस्थान की एथिक्स ज़रूरतें, YouTube की शर्तें और कॉपीराइट कानून जांचें, खासकर डेटासेट को सार्वजनिक रूप से शेयर करने से पहले।
YouTube के ऑटोमैटिक कैप्शन कितने सटीक होते हैं?
यह ऑडियो क्वालिटी, लहजे और विषय पर निर्भर करता है। API बताता है कि हर ट्रांसक्रिप्ट मैनुअल कैप्शन, ऑटोमैटिक कैप्शन या AI स्पीच रिकग्निशन से आया, ताकि आप इसका ध्यान रख सकें।
मैं एक साथ कितने वीडियो इकट्ठा कर सकता हूं?
Business प्लान पर एक बैच रिक्वेस्ट में 3,000 वीडियो ID तक भेजी जा सकती हैं। बड़े अध्ययन कई बैच चला सकते हैं।