बिल्ड गाइड · ऐप डेवलपर्स

अपने AI एजेंट को YouTube देखने की क्षमता कैसे दें

लैंग्वेज मॉडल वीडियो नहीं देख सकते, और ज़्यादातर खुद से YouTube ट्रांसक्रिप्ट भरोसेमंद तरीके से नहीं ला सकते। उन्हें एक ट्रांसक्रिप्ट टूल दें और वे किसी टॉक का सारांश बना सकते हैं, दो रिव्यू की तुलना कर सकते हैं या किसी लेक्चर पर सवालों के जवाब दे सकते हैं, उस पल के साइटेशन के साथ जब बात कही गई।

किसके लिए
एजेंट बनाने वाले, इंटरनल कोपायलट, रिसर्च असिस्टेंट, Slack और Discord बॉट
बनाने में समय
एक दोपहर
API एंडपॉइंट
/transcribeMCP server

यह कौन सी समस्या हल करता है

जब यूज़र किसी असिस्टेंट में YouTube लिंक पेस्ट करते हैं, तो वह या तो मना कर देता है, टाइटल से मनगढ़ंत जवाब देता है, या लंबे वीडियो पर फ़ेल हो जाता है। रिसर्च, सेल्स या सपोर्ट के लिए एजेंट बनाने वाली टीमों को किसी भी वीडियो को ऐसे टेक्स्ट में बदलने का भरोसेमंद तरीका चाहिए जिस पर मॉडल तर्क कर सके, वो भी ऐसे स्क्रेपर संभाले बिना जो YouTube के हर बदलाव पर टूट जाते हैं।

पहले वर्ज़न में क्या शामिल करें

  • एक टूल जिसे मॉडल किसी भी YouTube URL या वीडियो ID के साथ कॉल कर सके
  • साफ़ ट्रांसक्रिप्ट टेक्स्ट और साइटेशन के लिए टाइमस्टैम्प वाले सेगमेंट
  • गैर-अंग्रेज़ी वीडियो के लिए भाषा चुनना और अनुवाद
  • लंबे वीडियो के लिए चंकिंग ताकि वे मॉडल के कॉन्टेक्स्ट में फ़िट हों
  • कैशिंग ताकि एक ही वीडियो दो बार न लाया जाए

इसे कैसे बनाएं, स्टेप बाय स्टेप

  1. 01

    अपना इंटीग्रेशन चुनें

    अगर आपका असिस्टेंट Model Context Protocol सपोर्ट करता है, तो MCP सर्वर कनेक्ट करें और टूल अपने-आप दिखने लगेंगे। वरना एक फ़ंक्शन टूल बनाएं जो /transcribe को कॉल करे।

  2. 02

    टूल का कॉन्ट्रैक्ट तय करें

    एक वीडियो URL और वैकल्पिक भाषा लें। ट्रांसक्रिप्ट टेक्स्ट और स्टार्ट टाइम वाले सेगमेंट की लिस्ट लौटाएं।

  3. 03

    लंबे वीडियो संभालें

    जो वीडियो आपकी कॉन्टेक्स्ट विंडो से लंबे हैं, उनके सेगमेंट को चंक में बांटें और जवाब देने से पहले हर एक का सारांश बनाएं, या सिर्फ़ सवाल से जुड़े चंक निकालें।

  4. 04

    सोर्स साइट करें

    मॉडल को सेगमेंट से टाइमस्टैम्प कोट करने का निर्देश दें ताकि यूज़र हर दावे की जांच कर सकें।

स्टार्टर कोड

यह आइडिया "रेसिपी 1: एक वीडियो डालें, स्ट्रक्चर्ड आउटपुट पाएं" पैटर्न पर बना है। अपने चैनल, प्रॉम्प्ट और स्टोरेज लगाएं।

import requests

API = "https://www.youtubetranscript.dev/api/v2"
HEADERS = {"Authorization": "Bearer yt_sk_live_YOUR_KEY"}

res = requests.post(f"{API}/transcribe", headers=HEADERS, json={
    "video": "https://www.youtube.com/watch?v=VIDEO_ID",
    "format": {"timestamp": True, "paragraphs": True},
}).json()

transcript = res["data"]["transcript"]
print(transcript["text"][:500])        # plain text for your LLM prompt
for seg in transcript["segments"][:3]:  # timestamps for deep links
    print(seg["start"], seg["text"])

इसे बनाना क्यों फायदेमंद है

यह आमतौर पर प्रोडक्ट नहीं, एक फ़ीचर होता है: यह आपके मौजूदा असिस्टेंट, बॉट या कोपायलट को काफ़ी ज़्यादा उपयोगी बना देता है। अलग प्रोडक्ट के रूप में, शेयर किए गए वीडियो पर सवालों के जवाब देने वाला Slack या Discord बॉट प्रति वर्कस्पेस चार्ज कर सकता है।

इन गलतियों से बचें

  • तीन घंटे का ट्रांसक्रिप्ट एक ही प्रॉम्प्ट में ठूंस देना: इसकी जगह चंक में रिट्रीव करें या सारांश बनाएं।
  • टाइमस्टैम्प हटा देना, जिससे जवाबों की जांच करना नामुमकिन हो जाता है।
  • ट्रांसक्रिप्ट कैश करने के बजाय एक ही लोकप्रिय वीडियो बार-बार लाना।

इस आइडिया से जुड़े सवाल

क्या ChatGPT या Claude YouTube वीडियो पढ़ सकते हैं?

खुद से भरोसेमंद तरीके से नहीं। ट्रांसक्रिप्ट टूल या MCP सर्वर कनेक्ट करने से वे कैप्शन वाले किसी भी पब्लिक वीडियो का पूरा ट्रांसक्रिप्ट पढ़ सकते हैं।

MCP सर्वर क्या है?

Model Context Protocol, AI असिस्टेंट्स को टूल देने का एक स्टैंडर्ड तरीका है। हमारा MCP सर्वर ट्रांसक्रिप्ट टूल उपलब्ध कराता है जिन्हें कम्पैटिबल असिस्टेंट बिना कस्टम कोड के कॉल कर सकते हैं।

बहुत लंबे वीडियो कैसे संभालूं?

टाइमस्टैम्प वाले सेगमेंट को चंक में बांटें, फिर हर चंक का सारांश बनाएं या सिर्फ़ यूज़र के सवाल से जुड़े चंक निकालें।

आज ही बनाना शुरू करें

हर महीने 10 मुफ़्त क्रेडिट। क्रेडिट कार्ड की ज़रूरत नहीं।

AI एजेंट को YouTube वीडियो का एक्सेस कैसे दें (MCP और टूल) | YouTubeTranscript.dev