Scraper de Transcripciones de YouTube

Lo que se dijo de verdad,
como hoja de cálculo.

Dale un id o una URL de vídeo de YouTube y recibe la transcripción como filas: una fila por segmento de subtítulo, cada una con su texto, su momento de inicio y cuánto dura, más la transcripción entera en un único campo. Ocho columnas. Sin cuenta de YouTube, sin proxy residencial, sin un parser que mantener vivo.

500 filas gratis, una sola vez0,002 $ por fila después8 columnasCSV · XLSX · JSON
Cómo funciona

Entra una lista de vídeos,
salen las palabras dichas.

La entrada es el vídeo. Pega lo que ya tengas - el id a secas, un enlace watch o un enlace corto youtu.be - y el trabajo recupera la pista de subtítulos que hay detrás.

  1. PASO 1Inicia sesión en la plataforma.
  2. PASO 2Abre el Scraper de Transcripciones de YouTube.
  3. PASO 3Pega ids o URL de vídeos de YouTube, uno por línea - o sube un archivo CSV, XLSX, TXT o Parquet.
  4. PASO 4Elige tu formato de salida.
  5. PASO 5Haz clic en Get Data.
  6. PASO 6Descarga la transcripción como CSV, XLSX o JSON.

Cada fila va etiquetada con la consulta de la que vino y con el id del vídeo al que pertenece - así, una ejecución sobre una lista entera de reproducción sigue cuadrando con tu lista de entrada.

Por qué lo usan los equipos

Habla que se puede
buscar y citar.

Un id, un enlace watch o un enlace corto

Los tres van en el mismo cuadro, uno por línea. Una URL watch con parámetros extra - una lista de reproducción, una marca de radio - sigue resolviéndose al vídeo correcto, y el id al que se resolvió vuelve en su propia columna para que puedas cruzar por ahí.

Cronometrado al segundo

Cada segmento lleva el momento en que empieza y cuánto dura, ambos en segundos decimales. Eso es lo que convierte un muro de habla en algo a lo que puedes saltar: construir un enlace profundo, cortar un clip o alinear una cita con el fotograma del que salió.

Los segmentos y el todo

Recibes las dos formas en un archivo: una fila por segmento para todo lo cronometrado, y la transcripción completa como un único campo para lo que solo necesita el texto. El diccionario de datos explica exactamente dónde está ese campo de texto completo, porque no está en todas las filas.

Lo que recibes

Ocho columnas,
una fila por segmento.

Cada fila es un segmento de subtítulo: qué se dijo, cuándo empieza y cuánto dura, etiquetado con el vídeo al que pertenece y la consulta que enviaste.

La lista de columnas de abajo es la fila de cabecera de exportaciones reales, corroborada por el array de columnas que renderiza la interfaz de ejecución; ambas coinciden exactamente. Dos de las ocho se comportan distinto al resto - aparecen una vez por vídeo y no una vez por fila - y eso es lo que más probablemente te sorprenda, así que está detallado en la tabla y otra vez en la nota de debajo.

Diccionario de datos

Ocho columnas,
y dos son especiales.

Tomado de la fila de cabecera de ejecuciones reales. Las notas describen qué contiene cada columna y cómo se repite - no cuántas filas vas a recibir, porque eso es una propiedad de la pista de subtítulos del vídeo, no del scraper.

query
El id o la URL del vídeo que enviaste, repetido en cada fila que vino de él - incluidos los parámetros extra de la URL, exactamente como los tecleaste.
video_id
El id de YouTube al que se resolvió la consulta, repetido en cada fila de ese vídeo. Esta es la columna por la que cruzar: una URL watch con una lista de reproducción y el id a secas acaban aquí como el mismo valor.
language
El código de idioma de la pista de subtítulos, repetido en cada fila del vídeo. Solo hemos ejecutado vídeos en inglés, así que en es el único valor que hemos visto - la página no adivina qué más puede contener la columna.
segments
Solo en la primera fila de cada vídeo. En cuántos segmentos se dividió la transcripción de ese vídeo - que es también cuántas filas aporta el vídeo. En todas las demás filas del mismo vídeo está vacía. Un entero donde está rellena, no una cadena.
transcript
Solo en la primera fila de cada vídeo. La transcripción entera como un bloque de texto, con los segmentos unidos.
text
Lo que se dijo en este segmento. Presente en todas las filas - esta es la mitad por fila de la exportación.
start
Cuándo empieza el segmento, en segundos desde el principio del vídeo, como número decimal. Asciende a lo largo de un vídeo y vuelve a empezar en el siguiente.
duration
Cuánto dura el segmento, en segundos, como número decimal.

Tres cosas que conviene saber antes de escribir código contra esto. Una fila es un segmento, no un vídeo - un vídeo llena tantas filas como segmentos tenga su pista de subtítulos, y query, video_id y language se repiten a lo largo de todas ellas. segments y transcript rompen ese patrón: se escriben solo en la primera fila de cada vídeo y están vacías en el resto, así que agrupa por video_id y toma la primera fila en lugar de esperarlas en todas partes. Y start y duration vuelven como números reales mientras todo lo demás es texto - incluida segments, que es un entero donde está rellena y una cadena vacía donde no, así que un parser estricto tiene que tolerar ambas cosas.

Controles de ejecución

Un cuadro,
y nada que ajustar.

Este scraper no tiene límite ni orden - la transcripción es la que es. Lo único que decides es cómo entregas los vídeos.

Id de vídeo a secas URL watch?v= Enlace corto youtu.be Pegar uno por línea Subida de CSV Subida de XLSX Subida de TXT Subida de Parquet
Flujos de trabajo habituales

Tres tareas que la gente
ejecuta más a menudo aquí.

Algunos ejemplos de lo que hacen los equipos con las palabras habladas una vez están en una hoja de cálculo.

Investigación

Buscar una frase en todo un catálogo

Extrae las transcripciones de los vídeos de un canal y filtra la columna de texto. Encontrar cada mención de un producto, un competidor o una afirmación cuesta un filtro en vez de una tarde adelantando la reproducción.

Research · Comms
Contenido

Convertir charlas en material escrito

Una transcripción es el primer borrador de un artículo, una página de notas del programa o un juego de subtítulos. El campo de texto completo te da todo en una celda, y las filas cronometradas te dan las marcas de tiempo para enlazar de vuelta.

Contenido
IA

Dar a un modelo algo que pueda citar

Los segmentos cronometrados se trocean limpiamente para recuperación, y cada trozo ya sabe de qué vídeo viene y de qué punto. Esa es la diferencia entre una respuesta y una respuesta con un enlace al segundo en que se dijo.

Data · ML
Precios

Paga solo por los segmentos
que realmente extraes.

Sin suscripción, sin mínimo, sin factura recurrente. Tus primeras 500 filas corren de nuestra cuenta; después, pago por uso a la misma tarifa plana que cualquier otro scraper de aquí.

Plan gratuito

500 filas gratis - 0 $

En cada cuenta nueva, una sola vez. Sin tarjeta de crédito. Subida de archivos y todos los formatos de exportación incluidos. Suficiente para ver la forma de una transcripción antes de construir sobre ella.

0 $ para siempre
Pago por uso

0,002 $ por fila, tras el plan gratuito

La misma tarifa plana que cualquier otro scraper de la plataforma. El estimador previo muestra el número de filas y el coste en créditos antes de arrancar: sin facturas sorpresa ni unidades de cómputo que traducir.

El más popular
Volumen

A medida · gran volumen

Precios por volumen, workers dedicados y un SLA para monitorización continua o extracciones históricas muy grandes. Dinos tus números y te preparamos un presupuesto.

Habla con nosotros
10 % de descuento en tu primera ejecución de pago.Usa el código LIVESCRAPER10 al pagar.
Registrarse
Combina bien con

Lo que se dijo,
y dónde se encontró.

La parte legal

¿Es legal hacer scraping
de transcripciones de YouTube?

Respuesta corta: los subtítulos se sirven junto al vídeo - y lo que puedas hacer después con las palabras es una cuestión de derechos de autor, no de scraping.

Una pista de subtítulos se sirve a cualquiera que abra el vídeo, con sesión iniciada o sin ella; así funciona el botón de subtítulos. Leer esa misma pista pública con fines de investigación es una práctica asentada desde hace mucho, y nada de esto toca un inicio de sesión ni un muro de pago. Un vídeo sin subtítulos no tiene transcripción que leer, y por eso el scraper necesita una y lo dice claramente.

Lo que hay que prever no es el acceso sino la reutilización. Una transcripción son las palabras de quien creó el vídeo, y el vídeo es su obra protegida - así que citar, indexar, buscar y analizar están en un terreno muy distinto de republicar una charla como artículo propio. Si vas a entrenar con ello o a reproducirlo con extensión, eso es una cuestión de licencias, y te toca resolverla antes de escalar.

Las condiciones de YouTube restringen el acceso automatizado, así que esto es tanto una cuestión contractual como legal: si tienes una relación contractual con la plataforma, revísala. No ejecutamos rastreadores de terceros en la capa de datos, y tus exportaciones se borran solas a los 30 días.

livescraper.app · principios
Solo pistas de subtítulos públicas
Sin inicios de sesión, sin tocar cuentas
Las palabras siguen siendo de quien las dijo!
Tu IP nunca se usa - las nuestras rotan
Las exportaciones se borran solas (30 días)
Revisa las condiciones de YouTube antes de escalar.
Preguntas frecuentes

Lo que pregunta la gente
antes de registrarse.

Las preguntas que más oímos. ¿Algo más? Habla con nosotros - las respuestas las escriben personas, no bots.

¿Cómo hago scraping de una transcripción de YouTube?+
Con el Scraper de Transcripciones de YouTube:
  1. Inicia sesión en la plataforma.
  2. Abre el Scraper de Transcripciones de YouTube.
  3. Pega ids o URL de vídeos de YouTube, uno por línea - o sube un archivo CSV, XLSX, TXT o Parquet.
  4. Elige tu formato de salida.
  5. Haz clic en Get Data.
  6. Descarga la transcripción como CSV, XLSX o JSON.
¿Qué representa una fila?+
Un segmento de subtítulo, no un vídeo. Un vídeo llena tantas filas como segmentos tenga su transcripción, y query, video_id y language se repiten a lo largo de todas ellas. Si prefieres una fila por vídeo, agrupa por video_id y toma la primera fila de cada grupo - ahí es donde está la transcripción completa.
¿Por qué las columnas segments y transcript están vacías en la mayoría de las filas?+
Porque se escriben una vez por vídeo y no una vez por fila. Ambas aparecen en la primera fila de cada vídeo y están vacías en el resto de filas de ese vídeo - se cumplió en todas las ejecuciones con la forma actual que hicimos, sin excepción. Es una convención de agrupación, no un fallo de recogida: segments te dice cuántas filas aporta ese vídeo, y transcript contiene el conjunto como un bloque de texto.
¿Puedo pegar una URL completa de YouTube, o tiene que ser el id?+
Cualquiera de las dos, y un enlace corto youtu.be también funciona. Una URL watch con parámetros extra - una lista de reproducción, una marca de radio - se resuelve igualmente bien, y el id al que se resolvió vuelve en la columna video_id, así que puedes cruzar por ahí en lugar de por lo que hayas pegado.
¿Qué pasa si un vídeo no tiene subtítulos?+
No hay transcripción que devolver. Los subtítulos son la fuente que esto lee, así que un vídeo con ellos desactivados no produce nada - ese es el requisito que indica la propia herramienta, no un error tuyo. Comprueba que el vídeo tenga botón de subtítulos antes de dar por fallida una ejecución.
¿Sirven las marcas de tiempo para enlaces profundos?+
Sí. Cada segmento lleva su momento de inicio en segundos desde el principio del vídeo, y cuánto dura, ambos como números decimales. Con eso basta para construir un enlace de salto, cortar un clip o alinear una cita con el momento en que se dijo.
¿Ha cambiado la salida recientemente?+
Sí, el 03/07/2026. Las ejecuciones anteriores al cambio exportaban cinco columnas con una fila por vídeo y la transcripción entera en una sola celda. Las posteriores exportan las ocho columnas descritas aquí con una fila por segmento. Eso es un cambio en lo que significa una fila, no solo columnas extra - si tienes un archivo más antiguo, tiene otra forma, y ninguno de los dos está mal.
¿Cuánto cuesta?+
Las primeras 500 filas son gratis y de una sola vez, sin tarjeta de crédito. Después son 0,002 $ por fila - la misma tarifa plana que cualquier otro scraper de la plataforma. Recuerda que aquí una fila es un segmento, así que un vídeo largo cuesta más que uno corto; el estimador muestra el coste de una ejecución antes de que arranque.

Tus primeros 500 segmentos,
invita la casa.

500 filas gratis de una sola vez en cada cuenta nueva, sin caducidad. Después son 0,002 $ por fila, pago por uso - sin tarjeta guardada hasta que tú lo digas.

Se activa al instante · sin tarjeta

Haz scraping de transcripciones de YouTube a escala

El Scraper de Transcripciones de YouTube de Livescraper convierte una lista de vídeos en texto. Envías ids o URL de vídeos de YouTube - escritos uno por línea, o subidos como archivo CSV, XLSX, TXT o Parquet - y descargas la pista de subtítulos en un archivo CSV, Excel o JSON limpio. Los ids a secas, los enlaces watch y los enlaces cortos youtu.be funcionan todos, y una URL watch con parámetros de lista de reproducción sigue resolviéndose al vídeo correcto.

Una fila es un segmento de subtítulo. Cada una lleva lo que se dijo, el segundo en que empieza y cuánto dura, junto a la consulta que enviaste, el id de vídeo al que se resolvió y el idioma de la pista. Otras dos columnas funcionan por vídeo y no por fila: segments, que es cuántas filas aporta ese vídeo, y transcript, que contiene el conjunto como un bloque de texto. Ambas están en la primera fila de cada vídeo, y ese es el detalle que conviene conocer antes de escribir un parser.

Los investigadores extraen el catálogo de un canal y buscan una frase en el texto en lugar de adelantar la reproducción. Los equipos de contenido convierten charlas en artículos, notas del programa y subtítulos. Los equipos que construyen sistemas de recuperación usan los segmentos cronometrados como trozos que ya saben de qué vídeo vienen y de qué punto - la diferencia entre una respuesta y una respuesta que puedes enlazar al segundo en que se dijo.

Conviene saber dos cosas antes de empezar. Un vídeo con los subtítulos desactivados no tiene transcripción que devolver, así que los subtítulos son un requisito y no un extra. Y como una fila es un segmento, un vídeo largo cuesta más que uno corto a la misma tarifa plana de 0,002 $ por fila. Empieza gratis: tus primeras 500 filas no cuestan nada ni necesitan tarjeta.