यह कौन सी समस्या हल करता है
जब यूज़र किसी असिस्टेंट में YouTube लिंक पेस्ट करते हैं, तो वह या तो मना कर देता है, टाइटल से मनगढ़ंत जवाब देता है, या लंबे वीडियो पर फ़ेल हो जाता है। रिसर्च, सेल्स या सपोर्ट के लिए एजेंट बनाने वाली टीमों को किसी भी वीडियो को ऐसे टेक्स्ट में बदलने का भरोसेमंद तरीका चाहिए जिस पर मॉडल तर्क कर सके, वो भी ऐसे स्क्रेपर संभाले बिना जो YouTube के हर बदलाव पर टूट जाते हैं।
पहले वर्ज़न में क्या शामिल करें
- एक टूल जिसे मॉडल किसी भी YouTube URL या वीडियो ID के साथ कॉल कर सके
- साफ़ ट्रांसक्रिप्ट टेक्स्ट और साइटेशन के लिए टाइमस्टैम्प वाले सेगमेंट
- गैर-अंग्रेज़ी वीडियो के लिए भाषा चुनना और अनुवाद
- लंबे वीडियो के लिए चंकिंग ताकि वे मॉडल के कॉन्टेक्स्ट में फ़िट हों
- कैशिंग ताकि एक ही वीडियो दो बार न लाया जाए
इसे कैसे बनाएं, स्टेप बाय स्टेप
- 01
अपना इंटीग्रेशन चुनें
अगर आपका असिस्टेंट Model Context Protocol सपोर्ट करता है, तो MCP सर्वर कनेक्ट करें और टूल अपने-आप दिखने लगेंगे। वरना एक फ़ंक्शन टूल बनाएं जो /transcribe को कॉल करे।
- 02
टूल का कॉन्ट्रैक्ट तय करें
एक वीडियो URL और वैकल्पिक भाषा लें। ट्रांसक्रिप्ट टेक्स्ट और स्टार्ट टाइम वाले सेगमेंट की लिस्ट लौटाएं।
- 03
लंबे वीडियो संभालें
जो वीडियो आपकी कॉन्टेक्स्ट विंडो से लंबे हैं, उनके सेगमेंट को चंक में बांटें और जवाब देने से पहले हर एक का सारांश बनाएं, या सिर्फ़ सवाल से जुड़े चंक निकालें।
- 04
सोर्स साइट करें
मॉडल को सेगमेंट से टाइमस्टैम्प कोट करने का निर्देश दें ताकि यूज़र हर दावे की जांच कर सकें।
स्टार्टर कोड
यह आइडिया "रेसिपी 1: एक वीडियो डालें, स्ट्रक्चर्ड आउटपुट पाएं" पैटर्न पर बना है। अपने चैनल, प्रॉम्प्ट और स्टोरेज लगाएं।
import requests
API = "https://www.youtubetranscript.dev/api/v2"
HEADERS = {"Authorization": "Bearer yt_sk_live_YOUR_KEY"}
res = requests.post(f"{API}/transcribe", headers=HEADERS, json={
"video": "https://www.youtube.com/watch?v=VIDEO_ID",
"format": {"timestamp": True, "paragraphs": True},
}).json()
transcript = res["data"]["transcript"]
print(transcript["text"][:500]) # plain text for your LLM prompt
for seg in transcript["segments"][:3]: # timestamps for deep links
print(seg["start"], seg["text"])इसे बनाना क्यों फायदेमंद है
यह आमतौर पर प्रोडक्ट नहीं, एक फ़ीचर होता है: यह आपके मौजूदा असिस्टेंट, बॉट या कोपायलट को काफ़ी ज़्यादा उपयोगी बना देता है। अलग प्रोडक्ट के रूप में, शेयर किए गए वीडियो पर सवालों के जवाब देने वाला Slack या Discord बॉट प्रति वर्कस्पेस चार्ज कर सकता है।
इन गलतियों से बचें
- तीन घंटे का ट्रांसक्रिप्ट एक ही प्रॉम्प्ट में ठूंस देना: इसकी जगह चंक में रिट्रीव करें या सारांश बनाएं।
- टाइमस्टैम्प हटा देना, जिससे जवाबों की जांच करना नामुमकिन हो जाता है।
- ट्रांसक्रिप्ट कैश करने के बजाय एक ही लोकप्रिय वीडियो बार-बार लाना।
इस आइडिया से जुड़े सवाल
क्या ChatGPT या Claude YouTube वीडियो पढ़ सकते हैं?
खुद से भरोसेमंद तरीके से नहीं। ट्रांसक्रिप्ट टूल या MCP सर्वर कनेक्ट करने से वे कैप्शन वाले किसी भी पब्लिक वीडियो का पूरा ट्रांसक्रिप्ट पढ़ सकते हैं।
MCP सर्वर क्या है?
Model Context Protocol, AI असिस्टेंट्स को टूल देने का एक स्टैंडर्ड तरीका है। हमारा MCP सर्वर ट्रांसक्रिप्ट टूल उपलब्ध कराता है जिन्हें कम्पैटिबल असिस्टेंट बिना कस्टम कोड के कॉल कर सकते हैं।
बहुत लंबे वीडियो कैसे संभालूं?
टाइमस्टैम्प वाले सेगमेंट को चंक में बांटें, फिर हर चंक का सारांश बनाएं या सिर्फ़ यूज़र के सवाल से जुड़े चंक निकालें।