GUÍA DE DESARROLLO · DESARROLLADORES DE APPS

Cómo darle a tu agente de IA la capacidad de ver YouTube

Los modelos de lenguaje no pueden ver vídeos, y la mayoría no consigue obtener transcripciones de YouTube de forma fiable por sí sola. Dales una herramienta de transcripción y podrán resumir una charla, comparar dos reseñas o responder preguntas sobre una clase, citando el momento en que se dijo.

Para quién es
Creadores de agentes, copilotos internos, asistentes de investigación, bots de Slack y Discord
Tiempo de desarrollo
Una tarde
Endpoints de la API
/transcribeMCP server

El problema que resuelve

Cuando un usuario pega un enlace de YouTube en un asistente, este se niega, inventa a partir del título o falla con los vídeos largos. Los equipos que crean agentes para investigación, ventas o soporte necesitan una forma fiable de convertir cualquier vídeo en texto sobre el que el modelo pueda razonar, sin mantener scrapers que se rompen cada vez que YouTube cambia algo.

Qué incluir en tu primera versión

  • Una herramienta que el modelo puede llamar con cualquier URL o ID de vídeo de YouTube
  • Texto de la transcripción limpio más segmentos con marcas de tiempo para las citas
  • Selección de idioma y traducción para vídeos que no están en inglés
  • División en fragmentos de los vídeos largos para que quepan en el contexto del modelo
  • Caché para no obtener dos veces el mismo vídeo

Cómo construirlo, paso a paso

  1. 01

    Elige tu integración

    Si tu asistente es compatible con el Model Context Protocol, conecta el servidor MCP y las herramientas aparecerán automáticamente. Si no, define una herramienta de función que llame a /transcribe.

  2. 02

    Define el contrato de la herramienta

    Acepta una URL de vídeo y un idioma opcional. Devuelve el texto de la transcripción y una lista de segmentos con sus tiempos de inicio.

  3. 03

    Gestiona los vídeos largos

    Si un vídeo supera tu ventana de contexto, divide los segmentos en fragmentos y resume cada uno antes de responder, o recupera solo los fragmentos relevantes para la pregunta.

  4. 04

    Cita la fuente

    Indica al modelo que cite las marcas de tiempo de los segmentos para que los usuarios puedan verificar cada afirmación.

Código de inicio

Esta idea se basa en el patrón "Receta 1: entra un vídeo, sale un resultado estructurado". Usa tus propios canales, prompts y almacenamiento.

import requests

API = "https://www.youtubetranscript.dev/api/v2"
HEADERS = {"Authorization": "Bearer yt_sk_live_YOUR_KEY"}

res = requests.post(f"{API}/transcribe", headers=HEADERS, json={
    "video": "https://www.youtube.com/watch?v=VIDEO_ID",
    "format": {"timestamp": True, "paragraphs": True},
}).json()

transcript = res["data"]["transcript"]
print(transcript["text"][:500])        # plain text for your LLM prompt
for seg in transcript["segments"][:3]:  # timestamps for deep links
    print(seg["start"], seg["text"])

Por qué vale la pena construirlo

Normalmente es una función, no un producto: hace que tu asistente, bot o copiloto actual sea mucho más útil. Como producto independiente, un bot de Slack o Discord que responde preguntas sobre los vídeos compartidos puede cobrar por espacio de trabajo.

Errores que debes evitar

  • Meter una transcripción de tres horas en un solo prompt: recupera o resume por fragmentos.
  • Eliminar las marcas de tiempo, lo que hace imposible verificar las respuestas.
  • Obtener una y otra vez el mismo vídeo popular en lugar de guardar las transcripciones en caché.

Preguntas sobre esta idea

¿Pueden ChatGPT o Claude leer vídeos de YouTube?

Por sí solos, no de forma fiable. Si les conectas una herramienta de transcripción o un servidor MCP, pueden leer la transcripción completa de cualquier vídeo público con subtítulos.

¿Qué es un servidor MCP?

El Model Context Protocol es un estándar para dar herramientas a los asistentes de IA. Nuestro servidor MCP ofrece herramientas de transcripción que los asistentes compatibles pueden llamar sin código personalizado.

¿Cómo gestiono los vídeos muy largos?

Divide los segmentos con marcas de tiempo en fragmentos y luego resume cada fragmento o recupera solo los que sean relevantes para la pregunta del usuario.

Empieza a construir hoy

10 créditos gratis cada mes. No necesitas tarjeta de crédito.

Cómo hacer que un agente de IA lea vídeos de YouTube (MCP) | YouTubeTranscript.dev