El problema que resuelve
Los verificadores pueden buscar en las plataformas de texto, pero el vídeo es en gran medida opaco. Las afirmaciones se repiten con formulaciones ligeramente distintas en decenas de canales, y documentar su propagación implica ver horas de grabaciones. Los investigadores necesitan transcripciones en las que se pueda buscar, coincidencia semántica para las paráfrasis y un registro verificable de cada aparición.
Qué incluir en tu primera versión
- Seguimiento de un conjunto definido de canales
- Búsqueda semántica de paráfrasis de una afirmación, no solo de la formulación exacta
- Una cronología que muestra la primera aparición y la propagación
- Citas con enlaces con marca de tiempo para su verificación
- Pruebas exportables para informes y publicaciones
Cómo construirlo, paso a paso
- 01
Recopila las transcripciones
Resuelve los canales del estudio y procesa en lote sus vídeos del periodo elegido. Sigue vigilando los nuevos vídeos si el estudio continúa.
- 02
Genera embeddings de los segmentos
Crea embeddings para cada párrafo de las transcripciones y así poder encontrar declaraciones con un significado parecido.
- 03
Busca la afirmación
Genera embeddings de varias formulaciones de la afirmación, recupera los fragmentos parecidos y haz que una persona o un LLM confirme cuáles hacen realmente esa afirmación.
- 04
Crea la cronología
Ordena las coincidencias confirmadas por fecha de publicación y expórtalas con el canal, la cita y el enlace con marca de tiempo.
Código de inicio
Esta idea se basa en el patrón "Receta 2: vigila canales y avisa de los nuevos vídeos". Usa tus propios canales, prompts y almacenamiento.
import requests
API = "https://www.youtubetranscript.dev/api/v2"
HEADERS = {"Authorization": "Bearer yt_sk_live_YOUR_KEY"}
WATCHLIST = ["@somechannel", "@anotherchannel"]
KEYWORDS = ["your brand", "competitor"]
seen = set() # persist this in a database in production
for handle in WATCHLIST:
latest = requests.post(f"{API}/channels/resolve", headers=HEADERS,
json={"handle": handle, "limit": 10}).json()
for video in latest["items"]:
if video["video_id"] in seen:
continue
seen.add(video["video_id"])
t = requests.post(f"{API}/transcribe", headers=HEADERS,
json={"video": video["video_id"]}).json()
text = t.get("data", {}).get("transcript", {}).get("text", "").lower()
hits = [k for k in KEYWORDS if k in text]
if hits:
print(f"ALERT {video['title']}: {hits}")Por qué vale la pena construirlo
Las organizaciones de verificación y los grupos de investigación ganan velocidad y pruebas verificables. Los equipos de confianza y seguridad y las empresas de monitorización de medios pagarán por herramientas que cubran el vídeo.
Errores que debes evitar
- Tratar las coincidencias automáticas como conclusiones: haz siempre que una persona lo confirme antes de publicar.
- Buscar solo frases exactas: las afirmaciones mutan, así que usa búsqueda semántica con varias formulaciones.
- Perder la trazabilidad: conserva el ID del vídeo, la marca de tiempo y la fecha de obtención de cada cita.
Preguntas sobre esta idea
¿Cómo buscan los verificadores de datos en vídeos de YouTube?
Transcribiendo los vídeos y buscando en el texto. La búsqueda semántica encuentra paráfrasis que la búsqueda por palabras clave pasaría por alto.
¿Puedo demostrar cuándo se hizo por primera vez una afirmación en YouTube?
Puedes documentar la primera aparición dentro de los canales que monitorizas, con la fecha de publicación y la marca de tiempo. La cobertura determina lo completa que es esa imagen.
¿Qué pasa con los vídeos sin subtítulos?
Activa el reconocimiento de voz por IA para que los vídeos sin subtítulos también se transcriban y se puedan buscar.