যে সমস্যার সমাধান করে
ব্যবহারকারী অ্যাসিস্ট্যান্টে YouTube লিংক পেস্ট করলে সেটি হয় অস্বীকার করে, টাইটেল দেখে বানিয়ে বলে, নয়তো লম্বা ভিডিওতে ব্যর্থ হয়। রিসার্চ, সেলস বা সাপোর্টের জন্য এজেন্ট বানানো টিমগুলোর দরকার যেকোনো ভিডিওকে মডেলের যুক্তি করার মতো টেক্সটে রূপান্তরের নির্ভরযোগ্য উপায়, এমন স্ক্র্যাপার রক্ষণাবেক্ষণ ছাড়া যা YouTube বদলালেই ভেঙে যায়।
প্রথম ভার্সনে কী কী রাখবেন
- এমন একটি টুল যা মডেল যেকোনো YouTube URL বা ভিডিও ID দিয়ে কল করতে পারে
- পরিষ্কার ট্রান্সক্রিপ্ট টেক্সট এবং উদ্ধৃতির জন্য টাইমস্ট্যাম্পসহ সেগমেন্ট
- ইংরেজি নয় এমন ভিডিওর জন্য ভাষা নির্বাচন ও অনুবাদ
- লম্বা ভিডিও টুকরো করা যাতে মডেলের কনটেক্সটে আঁটে
- ক্যাশিং, যাতে একই ভিডিও দুবার আনতে না হয়
ধাপে ধাপে কীভাবে বানাবেন
- 01
ইন্টিগ্রেশন বেছে নিন
আপনার অ্যাসিস্ট্যান্ট Model Context Protocol সাপোর্ট করলে MCP সার্ভার কানেক্ট করুন, টুলগুলো স্বয়ংক্রিয়ভাবে দেখা যাবে। নইলে /transcribe কল করে এমন একটি ফাংশন টুল ডিফাইন করুন।
- 02
টুলের কন্ট্রাক্ট ঠিক করুন
একটি ভিডিও URL ও ঐচ্ছিক ভাষা গ্রহণ করুন। ট্রান্সক্রিপ্ট টেক্সট এবং শুরুর সময়সহ সেগমেন্টের তালিকা ফেরত দিন।
- 03
লম্বা ভিডিও সামলান
কনটেক্সট উইন্ডোর চেয়ে লম্বা ভিডিওর ক্ষেত্রে সেগমেন্টগুলো টুকরো করে উত্তর দেওয়ার আগে প্রতিটির সারাংশ করুন, অথবা শুধু প্রশ্নের সাথে প্রাসঙ্গিক টুকরোগুলো আনুন।
- 04
উৎস উল্লেখ করুন
মডেলকে সেগমেন্ট থেকে টাইমস্ট্যাম্প উদ্ধৃত করতে নির্দেশ দিন, যাতে ব্যবহারকারী প্রতিটি দাবি যাচাই করতে পারেন।
স্টার্টার কোড
এই আইডিয়াটি "রেসিপি 1: একটি ভিডিও ইন, কাঠামোবদ্ধ আউটপুট আউট" প্যাটার্নের ওপর তৈরি। নিজের চ্যানেল, প্রম্পট ও স্টোরেজ বসিয়ে নিন।
import requests
API = "https://www.youtubetranscript.dev/api/v2"
HEADERS = {"Authorization": "Bearer yt_sk_live_YOUR_KEY"}
res = requests.post(f"{API}/transcribe", headers=HEADERS, json={
"video": "https://www.youtube.com/watch?v=VIDEO_ID",
"format": {"timestamp": True, "paragraphs": True},
}).json()
transcript = res["data"]["transcript"]
print(transcript["text"][:500]) # plain text for your LLM prompt
for seg in transcript["segments"][:3]: # timestamps for deep links
print(seg["start"], seg["text"])কেন বানানো মূল্যবান
এটি সাধারণত একটি ফিচার, আলাদা প্রোডাক্ট নয়: এটি আপনার বিদ্যমান অ্যাসিস্ট্যান্ট, বট বা কো-পাইলটকে স্পষ্টভাবে বেশি কাজের করে তোলে। স্বতন্ত্র প্রোডাক্ট হিসেবে, শেয়ার করা ভিডিও নিয়ে প্রশ্নের উত্তর দেয় এমন Slack বা Discord বট প্রতি ওয়ার্কস্পেস হিসেবে চার্জ নিতে পারে।
যে ভুলগুলো এড়াবেন
- তিন ঘণ্টার ট্রান্সক্রিপ্ট একটি প্রম্পটে ঢুকিয়ে দেওয়া: বরং টুকরো টুকরো করে আনুন বা সারাংশ করুন।
- টাইমস্ট্যাম্প বাদ দেওয়া, যার ফলে উত্তর যাচাই করা অসম্ভব হয়ে পড়ে।
- ট্রান্সক্রিপ্ট ক্যাশ না করে একই জনপ্রিয় ভিডিও বারবার আনা।
এই আইডিয়া নিয়ে প্রশ্ন
ChatGPT বা Claude কি YouTube ভিডিও পড়তে পারে?
নিজে থেকে নির্ভরযোগ্যভাবে পারে না। একটি ট্রান্সক্রিপ্ট টুল বা MCP সার্ভার কানেক্ট করলে তারা ক্যাপশনসহ যেকোনো পাবলিক ভিডিওর পুরো ট্রান্সক্রিপ্ট পড়তে পারে।
MCP সার্ভার কী?
Model Context Protocol হলো AI অ্যাসিস্ট্যান্টকে টুল দেওয়ার একটি স্ট্যান্ডার্ড পদ্ধতি। আমাদের MCP সার্ভার এমন ট্রান্সক্রিপ্ট টুল দেয় যা সামঞ্জস্যপূর্ণ অ্যাসিস্ট্যান্টরা কাস্টম কোড ছাড়াই কল করতে পারে।
খুব লম্বা ভিডিও কীভাবে সামলাব?
টাইমস্ট্যাম্পসহ সেগমেন্টগুলো টুকরো করুন, তারপর প্রতিটি টুকরোর সারাংশ করুন অথবা শুধু ব্যবহারকারীর প্রশ্নের সাথে প্রাসঙ্গিক টুকরোগুলো আনুন।