المشكلة التي تحلها
عندما يلصق المستخدمون رابط YouTube في مساعد، فإنه إما يرفض، أو يختلق إجابة من العنوان، أو يفشل مع الفيديوهات الطويلة. تحتاج الفرق التي تبني وكلاء للبحث أو المبيعات أو الدعم إلى طريقة موثوقة لتحويل أي فيديو إلى نص يستطيع النموذج التفكير فيه، دون صيانة أدوات كشط تتعطل كلما غيّر YouTube شيئًا.
ما يجب تضمينه في نسختك الأولى
- أداة يستدعيها النموذج بأي رابط YouTube أو معرّف فيديو
- نص نظيف مع مقاطع مزودة بالطوابع الزمنية للاستشهاد
- اختيار اللغة والترجمة للفيديوهات غير الإنجليزية
- تقسيم الفيديوهات الطويلة إلى أجزاء لتناسب سياق النموذج
- تخزين مؤقت حتى لا يُجلب الفيديو نفسه مرتين
كيف تبنيها خطوة بخطوة
- 01
اختر طريقة التكامل
إذا كان مساعدك يدعم Model Context Protocol، فاربط خادم MCP وستظهر الأدوات تلقائيًا. وإلا فعرّف أداة دالة تستدعي /transcribe.
- 02
حدّد عقد الأداة
اقبل رابط فيديو ولغة اختيارية. وأعد نص التفريغ وقائمة بالمقاطع مع أوقات بدايتها.
- 03
تعامل مع الفيديوهات الطويلة
للفيديوهات الأطول من نافذة السياق، قسّم المقاطع إلى أجزاء ولخّص كل جزء قبل الإجابة، أو استرجع فقط الأجزاء المتعلقة بالسؤال.
- 04
استشهد بالمصدر
اطلب من النموذج اقتباس الطوابع الزمنية من المقاطع ليتمكن المستخدمون من التحقق من كل ادعاء.
كود جاهز للبدء
تعتمد هذه الفكرة على نمط «الوصفة 1: فيديو واحد يدخل، ومخرجات منظمة تخرج». استبدل القنوات والتعليمات (prompts) ووسيلة التخزين بما يناسبك.
import requests
API = "https://www.youtubetranscript.dev/api/v2"
HEADERS = {"Authorization": "Bearer yt_sk_live_YOUR_KEY"}
res = requests.post(f"{API}/transcribe", headers=HEADERS, json={
"video": "https://www.youtube.com/watch?v=VIDEO_ID",
"format": {"timestamp": True, "paragraphs": True},
}).json()
transcript = res["data"]["transcript"]
print(transcript["text"][:500]) # plain text for your LLM prompt
for seg in transcript["segments"][:3]: # timestamps for deep links
print(seg["start"], seg["text"])لماذا تستحق البناء
هذه عادةً ميزة وليست منتجًا: فهي تجعل مساعدك أو البوت أو المساعد الداخلي الحالي أكثر فائدة بشكل ملحوظ. وكمنتج مستقل، يمكن لبوت Slack أو Discord يجيب عن أسئلة حول الفيديوهات المشاركة أن يتقاضى رسومًا لكل مساحة عمل.
أخطاء يجب تجنبها
- حشو نص مدته ثلاث ساعات في تعليمة واحدة: استرجع أو لخّص على أجزاء بدلًا من ذلك.
- حذف الطوابع الزمنية، ما يجعل التحقق من الإجابات مستحيلًا.
- جلب الفيديو الشائع نفسه مرارًا بدلًا من تخزين النصوص مؤقتًا.
أسئلة حول هذه الفكرة
هل يستطيع ChatGPT أو Claude قراءة فيديوهات YouTube؟
ليس بشكل موثوق بمفردهما. ربط أداة نصوص أو خادم MCP يتيح لهما قراءة النص الكامل لأي فيديو عام يحتوي على ترجمة مصاحبة.
ما هو خادم MCP؟
Model Context Protocol هو طريقة قياسية لتزويد مساعدي الذكاء الاصطناعي بالأدوات. يوفّر خادم MCP لدينا أدوات نصوص يمكن للمساعدين المتوافقين استدعاؤها دون كود مخصص.
كيف أتعامل مع الفيديوهات الطويلة جدًا؟
قسّم المقاطع المزودة بالطوابع الزمنية إلى أجزاء، ثم لخّص كل جزء أو استرجع فقط الأجزاء المتعلقة بسؤال المستخدم.