Haz scraping de transcripciones de YouTube a escala
El Scraper de Transcripciones de YouTube de Livescraper convierte una lista de vídeos en texto. Envías ids o URL de vídeos de YouTube - escritos uno por línea, o subidos como archivo CSV, XLSX, TXT o Parquet - y descargas la pista de subtítulos en un archivo CSV, Excel o JSON limpio. Los ids a secas, los enlaces watch y los enlaces cortos youtu.be funcionan todos, y una URL watch con parámetros de lista de reproducción sigue resolviéndose al vídeo correcto.
Una fila es un segmento de subtítulo. Cada una lleva lo que se dijo, el segundo en que empieza y cuánto dura, junto a la consulta que enviaste, el id de vídeo al que se resolvió y el idioma de la pista. Otras dos columnas funcionan por vídeo y no por fila: segments, que es cuántas filas aporta ese vídeo, y transcript, que contiene el conjunto como un bloque de texto. Ambas están en la primera fila de cada vídeo, y ese es el detalle que conviene conocer antes de escribir un parser.
Los investigadores extraen el catálogo de un canal y buscan una frase en el texto en lugar de adelantar la reproducción. Los equipos de contenido convierten charlas en artículos, notas del programa y subtítulos. Los equipos que construyen sistemas de recuperación usan los segmentos cronometrados como trozos que ya saben de qué vídeo vienen y de qué punto - la diferencia entre una respuesta y una respuesta que puedes enlazar al segundo en que se dijo.
Conviene saber dos cosas antes de empezar. Un vídeo con los subtítulos desactivados no tiene transcripción que devolver, así que los subtítulos son un requisito y no un extra. Y como una fila es un segmento, un vídeo largo cuesta más que uno corto a la misma tarifa plana de 0,002 $ por fila. Empieza gratis: tus primeras 500 filas no cuestan nada ni necesitan tarjeta.