المشكلة التي تحلها
يقصر التفريغ اليدوي الدراسات على بضع عشرات من الفيديوهات، وسكربتات الكشط المرتجلة تتعطل ويصعب إعادة إنتاجها. يحتاج الباحثون إلى طريقة موثوقة لجمع نصوص كاملة لعينة محددة من القنوات والتواريخ، وتخزينها مع البيانات الوصفية، ومشاركة منهجيتهم ليتمكن الآخرون من تكرارها.
ما يجب تضمينه في نسختك الأولى
- عينة موثّقة من القنوات ونطاق زمني محدد
- نصوص كاملة مخزنة كـ JSON خام مع البيانات الوصفية
- تسجيل مصدر الترجمة المصاحبة لكل فيديو (يدوي أو تلقائي أو بالذكاء الاصطناعي)
- تصدير إلى CSV أو نص عادي لاستخدامه في R أو Python أو NVivo أو ATLAS.ti
- سكربت جمع قابل لإعادة التشغيل لأغراض التكرار
كيف تبنيها خطوة بخطوة
- 01
حدّد العينة
اسرد القنوات والفترة الزمنية التي ستدرسها، وسجّل معايير الإدراج لقسم المنهجية.
- 02
حلّل قوائم الفيديوهات
استدعِ /channels/resolve لكل قناة وصفِّ النتائج حسب تاريخ النشر.
- 03
اجمع النصوص
أرسل معرّفات الفيديوهات إلى /batch وخزّن استجابة JSON كاملة، بما في ذلك اللغة ومصدر الترجمة المصاحبة لكل نص.
- 04
جهّز للتحليل
صدّر النصوص كنص عادي أو CSV مع معرّف الفيديو والقناة والتاريخ والطوابع الزمنية، ثم حلّلها بنماذج المواضيع أو تكرار الكلمات المفتاحية أو الترميز النوعي.
كود جاهز للبدء
تعتمد هذه الفكرة على نمط «الوصفة 3: حمّل قائمة تشغيل كاملة في قاعدة معرفة». استبدل القنوات والتعليمات (prompts) ووسيلة التخزين بما يناسبك.
import requests
API = "https://www.youtubetranscript.dev/api/v2"
HEADERS = {"Authorization": "Bearer yt_sk_live_YOUR_KEY"}
playlist = requests.post(f"{API}/playlists/resolve", headers=HEADERS,
json={"playlist_url": "https://www.youtube.com/playlist?list=PLAYLIST_ID",
"limit": 100}).json()
ids = [v["video_id"] for v in playlist["items"]]
batch = requests.post(f"{API}/batch", headers=HEADERS, json={
"video_ids": ids,
"format": {"timestamp": True, "paragraphs": True},
}).json()
# Large batches run async: poll GET /batch/{batch_id} until status is "completed"
for r in batch.get("results", []):
if r["status"] == "completed":
for p in r["data"]["transcript"].get("paragraphs") or []:
store(video_id=r["video_id"], start=p["start"], text=p["text"]) # your vector DBلماذا تستحق البناء
بالنسبة للباحثين، العائد هو مجموعة بيانات قابلة لإعادة الإنتاج بجزء صغير من تكلفة التفريغ اليدوي ووقته. كما تبني فرق مجموعات بيانات مدفوعة أو خدمات تحليلية لشركات رصد الإعلام ومراكز الأبحاث.
أخطاء يجب تجنبها
- خلط الترجمات التلقائية والبشرية دون الإشارة إلى ذلك: سجّل مصدر الترجمة لأن الدقة تختلف.
- عدم حفظ الاستجابات الخام: خزّن JSON الأصلي ليمكن إعادة تشغيل تحليلك.
- تجاهل المراجعة الأخلاقية وشروط المنصة: تحقق من متطلبات مؤسستك وشروط YouTube قبل نشر مجموعات البيانات.
أسئلة حول هذه الفكرة
هل يمكنني استخدام نصوص YouTube في البحث الأكاديمي؟
يفعل ذلك كثير من الباحثين. تحقق من متطلبات الأخلاقيات في مؤسستك وشروط YouTube وقانون حقوق النشر، خاصةً قبل مشاركة مجموعة بيانات علنًا.
ما مدى دقة الترجمة التلقائية في YouTube؟
تختلف حسب جودة الصوت واللهجات والموضوع. يوضّح API ما إذا كان كل نص مأخوذًا من ترجمة يدوية أو تلقائية أو من التعرف على الكلام بالذكاء الاصطناعي لتتمكن من أخذ ذلك في الحسبان.
كم فيديو يمكنني جمعه دفعة واحدة؟
يقبل طلب الدفعة الواحد ما يصل إلى 3,000 معرّف فيديو في خطة Business. ويمكن للدراسات الأكبر تشغيل عدة دفعات.