બિલ્ડ ગાઇડ · સંશોધકો

YouTube ટ્રાન્સક્રિપ્ટમાંથી બહુભાષી સ્પીચ ડેટાસેટ કેવી રીતે બનાવવો

લેખિત ટેક્સ્ટ કોર્પસ લોકો ખરેખર કેવી રીતે બોલે છે તે પૂરતું દર્શાવતા નથી, ખાસ કરીને ઓછો પ્રકાશિત ટેક્સ્ટ ધરાવતી ભાષાઓ અને બોલીઓમાં. YouTube પાસે લગભગ દરેક ભાષામાં વાતચીતની વાણી છે. શબ્દ-સ્તરના ટાઇમિંગવાળી ટ્રાન્સક્રિપ્ટ તેને ઉપયોગી રિસર્ચ ડેટામાં ફેરવે છે.

કોના માટે
કમ્પ્યુટેશનલ ભાષાશાસ્ત્રીઓ, NLP લેબ, AI મૂલ્યાંકન ટીમો
બિલ્ડ સમય
1 મહિનો
API એન્ડપોઇન્ટ
/transcripts/{video_id}/languagesasr_options.codeSwitchingformat.words

તે કઈ સમસ્યા ઉકેલે છે

બોલાતી ભાષા, કોડ-સ્વિચિંગ કે ઓછાં સંસાધનવાળી ભાષાઓનો અભ્યાસ કરતા સંશોધકોને પૂરતો કુદરતી, વાતચીતનો ડેટા શોધવામાં મુશ્કેલી પડે છે. ઘણા વીડિયોમાં કૅપ્શન નથી, અને જે છે તેમાં અલગ અલગ ગુણવત્તાના માનવ અને ઓટોમેટિક સ્રોત મિશ્રિત છે. ટીમોને એવી સુસંગત પાઇપલાઇન જોઈએ જે અનેક ભાષાઓ સંભાળે અને દરેક ટ્રાન્સક્રિપ્ટ ક્યાંથી આવી તે નોંધે.

પહેલા વર્ઝનમાં શું સામેલ કરવું

  • દરેક વીડિયો માટે ઉપલબ્ધ કૅપ્શન ભાષાઓની ઓળખ
  • કૅપ્શન વિનાના વીડિયો માટે 99 ભાષાઓમાં AI સ્પીચ રેકગ્નિશન
  • ભાષાઓ મિશ્રિત કરતી વાણી માટે કોડ-સ્વિચિંગ સપોર્ટ
  • એલાઇનમેન્ટ માટે શબ્દ-સ્તરના ટાઇમસ્ટેમ્પ
  • દરેક ટ્રાન્સક્રિપ્ટ માટે ભાષા અને કૅપ્શન સ્રોતનો મેટાડેટા

તેને સ્ટેપ બાય સ્ટેપ કેવી રીતે બનાવવું

  1. 01

    યોગ્ય વીડિયો શોધો

    તમારી ટાર્ગેટ ભાષાઓ ધરાવતી જાણીતી ચેનલો કે પ્લેલિસ્ટ રિઝોલ્વ કરો અને કઈ કૅપ્શન ટ્રૅક છે તે જોવા /transcripts/{video_id}/languages કૉલ કરો.

  2. 02

    ઉપલબ્ધ હોય ત્યાં કૅપ્શન વાપરો

    જ્યાં મેન્યુઅલ કૅપ્શન હોય ત્યાં તે મેળવો, કારણ કે તે સામાન્ય રીતે સૌથી સચોટ હોય છે.

  3. 03

    સ્પીચ રેકગ્નિશનથી ખાલી જગ્યા ભરો

    કૅપ્શન વિનાના વીડિયો માટે, ભાષા સેટ કરીને કે ઓટો-ડિટેક્ટ કરીને ASR માંગો, અને મિશ્ર ભાષાની વાણી માટે codeSwitching ચાલુ કરો.

  4. 04

    એલાઇનમેન્ટ ડેટા સાથે સ્ટોર કરો

    શબ્દ-સ્તરના ટાઇમસ્ટેમ્પ માટે format.words માંગો અને ટેક્સ્ટ સાથે દરેક ટ્રાન્સક્રિપ્ટની ભાષા અને સ્રોત સ્ટોર કરો.

સ્ટાર્ટર કોડ

આ આઇડિયા "રેસીપી 3: પ્લેલિસ્ટને નોલેજ બેઝમાં બલ્ક-લોડ કરો" પેટર્ન પર બનેલો છે. તમારી પોતાની ચેનલ, પ્રોમ્પ્ટ અને સ્ટોરેજ વાપરો.

import requests

API = "https://www.youtubetranscript.dev/api/v2"
HEADERS = {"Authorization": "Bearer yt_sk_live_YOUR_KEY"}

playlist = requests.post(f"{API}/playlists/resolve", headers=HEADERS,
                         json={"playlist_url": "https://www.youtube.com/playlist?list=PLAYLIST_ID",
                               "limit": 100}).json()

ids = [v["video_id"] for v in playlist["items"]]
batch = requests.post(f"{API}/batch", headers=HEADERS, json={
    "video_ids": ids,
    "format": {"timestamp": True, "paragraphs": True},
}).json()

# Large batches run async: poll GET /batch/{batch_id} until status is "completed"
for r in batch.get("results", []):
    if r["status"] == "completed":
        for p in r["data"]["transcript"].get("paragraphs") or []:
            store(video_id=r["video_id"], start=p["start"], text=p["text"])  # your vector DB

તે બનાવવા યોગ્ય કેમ છે

લેબ અને AI ટીમોને એવી ભાષાઓમાં મૂલ્યાંકન અને રિસર્ચ ડેટા મળે છે જે અન્યથા એકત્ર કરવો મોંઘો છે. ચોક્કસ ભાષાઓ કે ક્ષેત્રો માટે સ્વચ્છ, સારી રીતે દસ્તાવેજીકૃત ડેટાસેટ મોડેલ બનાવનારાઓ માટે પણ મૂલ્યવાન છે.

ટાળવા જેવી ભૂલો

  • ઓટોમેટિક કૅપ્શનને સંપૂર્ણ સાચા માની લેવા: સ્રોત લેબલ કરો અને એક સેમ્પલ જાતે ચકાસો.
  • મેટાડેટા વિના બોલીઓ મિક્સ કરવી: ચેનલ અને પ્રદેશ નોંધો જેથી પરિણામોનું અર્થઘટન થઈ શકે.
  • લાઇસન્સિંગની અવગણના: કોઈપણ ડેટાસેટ ફરી વહેંચતા પહેલાં પ્લેટફોર્મની શરતો અને કૉપિરાઇટ તપાસો.

આ આઇડિયા વિશેના પ્રશ્નો

સ્પીચ રેકગ્નિશન કેટલી ભાષાઓ સપોર્ટ કરે છે?

AI સ્પીચ રેકગ્નિશન 99 ભાષાઓ સપોર્ટ કરે છે, ઓટોમેટિક ભાષા ઓળખ અને મિશ્ર ભાષાની વાણી માટે વૈકલ્પિક કોડ-સ્વિચિંગ સાથે.

શું મને શબ્દ-સ્તરના ટાઇમસ્ટેમ્પ મળી શકે?

હા. દરેક શબ્દનું ટાઇમિંગ મેળવવા format.words માંગો, જે એલાઇનમેન્ટ અને ધ્વન્યાત્મક સંશોધન માટે ઉપયોગી છે.

શું હું YouTube માંથી બનેલો ડેટાસેટ ફરી વહેંચી શકું?

તે YouTube ની શરતો, કૉપિરાઇટ કાયદો અને તમારી સંસ્થાની નીતિઓ પર આધાર રાખે છે. ઘણા સંશોધકો ટ્રાન્સક્રિપ્ટને બદલે વીડિયો ID અને કોડ શેર કરે છે.

આજે જ બનાવવાનું શરૂ કરો

દર મહિને 10 મફત ક્રેડિટ. ક્રેડિટ કાર્ડની જરૂર નથી.

YouTube માંથી બહુભાષી સ્પીચ ડેટાસેટ કેવી રીતે બનાવવો | YouTubeTranscript.dev