Extractor de Comentarios de Reddit

Apúntelo a una publicación
y quédese el hilo entero.

Pegue la URL de una publicación de Reddit y sus comentarios vuelven como tabla: quién escribió cada uno, el texto del comentario, su puntuación, cuándo se publicó, un enlace directo a él y una columna de estado. Siete columnas, una fila por comentario, en el orden que elija entre seis.

500 filas gratis, una sola vezdespués 0,002 $ por fila7 columnasCSV · XLSX · JSON
Cómo funciona

Entra una URL,
sale un hilo.

Usted elige las publicaciones y el orden. El trabajo lee los comentarios de cada una y escribe una fila por cada comentario que devuelve.

  1. PASO 1Inicia sesión en la plataforma.
  2. PASO 2Abra el Reddit Comments Scraper.
  3. PASO 3Pegue URLs de publicaciones de Reddit, una por línea -o suba un archivo CSV, XLSX, TXT o Parquet.
  4. PASO 4Elija un orden: Best, Top, New, Controversial, Old o Q&A.
  5. PASO 5Fije un límite por consulta, o déjelo vacío para llevárselo todo.
  6. PASO 6Elija su formato de salida y haga clic en Get Data.

Una fila por comentario, cada una etiquetada con la URL de la publicación de la que procede -algo que aquí importa especialmente, porque es la única columna que devuelve un comentario a su hilo.

Por qué lo usan los equipos

El texto del comentario,
no cuántos hay.

Lo que la gente escribió de verdad

Este es el servicio que devuelve el cuerpo de los comentarios. Su hermano, el Reddit Search Scraper, tiene una columna llamada comments, pero esa es cuántos tiene una publicación: un número. Si quiere las frases y no el recuento, este es el suyo, y los dos están pensados para ejecutarse uno detrás del otro.

Seis órdenes, incluidos los que importan

Best, Top, New, Controversial, Old y Q&A. El orden no es cosmético cuando además limita las filas por consulta: un límite con Top le da los comentarios con los que el hilo estuvo de acuerdo, y el mismo límite con Controversial le da la discusión. Elija el orden pensando en el límite, no después de fijarlo.

Cada fila enlaza a sí misma

Cada comentario lleva su propio enlace permanente, no solo el de la publicación. Eso es lo que hace auditable una exportación meses después: una cita en un informe se puede rastrear hasta el comentario exacto del que salió, y quien la revise puede abrirlo sin buscar por el hilo a mano.

Lo que recibes

Siete columnas,
una fila por comentario.

Cada fila es un comentario: quién lo escribió, qué dice, cómo puntuó, cuándo apareció, dónde encontrarlo y cómo fue la descarga.

Hay dos cosas que conviene saber antes de planificar en torno a esta exportación, y ambas se deducen de la forma del esquema y no de ninguna ejecución. La primera es que es plana: no hay id de padre, ni id de comentario, ni columna de profundidad, así que lo que obtiene es una lista de comentarios y no un árbol de respuestas; query es lo único que devuelve una fila a su hilo, y por eso conviene conservarla. La segunda es que status es una columna de verdad y no un adorno. La lista de columnas de abajo es el array publicado por la plataforma, contrastado con la cabecera de las ejecuciones archivadas; lea la nota que hay debajo antes de escribir un parser, porque es franca sobre lo que esta página le va a contar y lo que no.

Diccionario de datos

Siete columnas,
en orden de exportación.

La fila de cabecera de la exportación, en orden, contrastada con la lista de columnas publicada por la plataforma. Las descripciones dicen para qué sirve cada campo; no afirman nada sobre su formato ni sobre con qué frecuencia llega relleno: mira la nota de abajo.

query
La URL de la publicación de Reddit que envió, repetida en cada fila que salió de ella. La escribe el scraper en lugar de tomarla de la página, así que está en todas las filas - y en esta exportación pesa más que de costumbre, porque nada más indica a qué hilo pertenece un comentario.
author
La cuenta de Reddit que escribió el comentario. Un nombre de usuario, no un nombre real, pero aun así una persona: vea la nota sobre datos personales más abajo en esta página.
body
El texto del comentario. Es la columna que distingue a este servicio del de búsqueda, cuyo campo comments es un recuento y no lo escrito.
score
La puntuación del comentario tal como la muestra Reddit: el neto de los votos que ha recibido.
created
Cuándo se publicó el comentario. Esta página no le dice el formato, porque ninguna ejecución que tengamos devolvió uno; mire las primeras filas de su propia ejecución antes de analizarlo.
permalink
Un enlace al comentario concreto, no a la publicación. La columna que conviene conservar por si alguna vez necesita comprobar una cita a mano o citarla en un informe.
status
Cómo fue la descarga de esa fila. Es una columna de trabajo, no un adorno: cuando una fila vuelve sin contenido, el motivo está aquí. Léala antes de concluir que una publicación sencillamente no tenía comentarios.

Lea este diccionario como una lista de nombres, no como una promesa sobre contenidos. Los siete nombres y su orden son sólidos: la lista de columnas publicada por la plataforma y la cabecera de las ejecuciones archivadas coinciden exactamente. Lo que no está resuelto es qué llega en ellas, porque no existe ninguna exportación de Reddit Comments con datos en la que basar una afirmación: las ejecuciones que tenemos volvieron solo con query y status rellenos, y apuntaban a una URL de marcador de posición en lugar de a una publicación real, así que hablan del esquema y de nada en absoluto sobre Reddit, en ninguna dirección. Por eso no encontrará en esta página ningún valor de ejemplo, ningún formato de fecha ni ninguna tasa de relleno. Dos hechos estructurales sí se mantienen, porque son propiedades de la propia lista de columnas: la exportación es plana, sin id de padre, id de comentario ni profundidad con los que reconstruir un árbol de respuestas, así que planifique una lista y no una jerarquía; y conviene meter status en su proceso desde el principio. El propio formulario de la plataforma avisa de que los sitios con antibot devuelven un estado blocked en el pool gratuito, que es solo residencial: esa es su advertencia general sobre el proceso compartido, y conviene preverla apunte a donde apunte. Ejecute una publicación con el nivel gratuito y mire las primeras filas antes de construir nada.

Controles de ejecución

Se ajusta en el trabajo,
no en la hoja de cálculo.

Una lista de URLs de publicaciones, un orden y un límite. El orden y el límite trabajan juntos: deciden qué parte de un hilo se queda y cuánto cuesta una ejecución.

URL de publicación de Reddit Una por línea Orden: Best Orden: Top Orden: New Orden: Controversial Orden: Old Orden: Q&A Límite por consulta Vacío para todo Subida de CSV · XLSX · TXT · Parquet Pool de proxies compartido, nunca su IP
Flujos de trabajo habituales

Tres tareas que se ejecutan
aquí más que ninguna otra.

Algunos ejemplos de cómo los equipos usan los datos de comentarios para responder a una pregunta que realmente tienen.

Investigación

Lea lo que dijo el hilo en realidad

La puntuación de una publicación le dice que la reacción fue fuerte; no le dice cuál fue. Extraiga los textos y tendrá el argumento delante en lugar de un número que lo sustituye - y con un enlace permanente en cada fila, cualquier cita se puede comprobar.

Investigación · Insights
Producto

Encuentre la queja bajo los votos positivos

Ordene por Controversial en lugar de por Top y limite las filas: obtendrá la parte del hilo que no se puso de acuerdo consigo misma. Ahí suele estar la necesidad no cubierta -la objeción que aún se discute, y no la opinión con la que todos ya coincidían.

Producto · Soporte
Proceso

Encadénelo después de una búsqueda

Ejecute el Reddit Search Scraper para encontrar las publicaciones, conserve su columna url y meta esa lista aquí directamente como sus consultas. La búsqueda le da qué hilos importan; esto le da qué se dijo en ellos. Los dos esquemas están separados a propósito y se unen por el enlace de la publicación.

Datos · Ops
Precios

Paga solo por las filas
que realmente extraes.

Sin suscripción, sin mínimo, sin factura recurrente. Tus primeras 500 filas corren de nuestra cuenta; después, pago por uso a la misma tarifa plana que cualquier otro scraper de aquí.

Nivel gratuito

500 filas gratis - 0 $

Para cada cuenta nueva, una sola vez. Sin tarjeta de crédito. Límites por consulta, subida de archivos y todos los formatos de exportación incluidos.

0 $ para siempre
Pago por uso

0,002 $ por fila, tras el plan gratuito

Aproximadamente 2 $ por cada 1.000 comentarios. El estimador previo muestra el número de filas y el coste en créditos antes de que empiece la ejecución: sin facturas sorpresa ni unidades de cómputo que traducir.

El más elegido
Volumen

A medida · gran volumen

Precios por volumen, workers dedicados y un SLA para supervisión continua o extracciones de hilos muy grandes. Díganos sus cifras y le pasamos presupuesto.

Habla con nosotros
10 % de descuento en tu primera ejecución de pago.Usa el código LIVESCRAPER10 al pagar.
Registrarse
Combina bien con

La publicación de la que salió
y el mismo trabajo en otro sitio.

La parte legal

¿Es legal scrapear
comentarios de Reddit?

Respuesta corta: los comentarios son públicos, pero esta exportación contiene datos personales, y conviene decirlo con claridad.

Los comentarios que se recogen aquí son los que una publicación muestra a cualquiera que la abra, con sesión iniciada o sin ella. Nada de esto toca un inicio de sesión, un subreddit privado, un mensaje directo ni una cuenta que no sea suya. Recoger discusiones publicadas públicamente es una práctica establecida desde hace mucho, y el enlace permanente de cada fila significa que todo lo que se lleve puede rastrearse hasta su origen.

A diferencia de un catálogo de productos, esta exportación son datos personales y preferimos decirlo antes que dar a entender lo contrario. author es una cuenta de Reddit y body es algo que escribió una persona: seudónimo, no anónimo. Los nombres de usuario se vinculan con frecuencia a individuos, y el texto de un comentario puede revelar mucho sobre quien lo escribió. Trate ambas columnas bajo las normas de privacidad que le apliquen, conserve solo lo que necesite y piénselo bien antes de volver a publicar un comentario junto al nombre de su autor.

Las propias condiciones de Reddit restringen el acceso automatizado y su licencia de contenidos ha cambiado más de una vez, así que esto es tanto una cuestión de condiciones como legal: revíselas, sobre todo para cualquier uso comercial o de redistribución. No ejecutamos rastreadores de terceros en la capa de datos y sus exportaciones se eliminan automáticamente a los 30 días.

livescraper.app · principios
Solo comentarios públicos
Sin inicios de sesión ni subreddits privados
Los nombres de usuario son datos personales
Cada fila conserva su enlace permanente
Las exportaciones se eliminan solas (30 días)
Revise las condiciones de Reddit antes de escalar.
Preguntas frecuentes

Lo que la gente pregunta
antes de registrarse.

Las preguntas que más oímos. ¿Algo más? Habla con nosotros: las respuestas las escriben personas, no bots.

¿Cómo scrapeo comentarios de Reddit?+
Con el Reddit Comments Scraper:
  1. Inicie sesión en la plataforma.
  2. Abra el Reddit Comments Scraper.
  3. Pegue URLs de publicaciones de Reddit, una por línea -o suba un archivo CSV, XLSX, TXT o Parquet.
  4. Elija un orden: Best, Top, New, Controversial, Old o Q&A.
  5. Fije un límite por consulta, o déjelo vacío para llevárselo todo.
  6. Elija su formato de salida y haga clic en Get Data.
¿Cuál es la diferencia con el Reddit Search Scraper?+
La búsqueda encuentra publicaciones; esto lee los comentarios de una. El servicio de búsqueda tiene una columna llamada comments, pero esa es cuántos tiene una publicación: un número, no lo escrito. Este servicio devuelve el cuerpo de los comentarios. Ejecutar antes la búsqueda y meter aquí sus enlaces de publicación es la combinación prevista.
¿Obtengo la estructura de respuestas?+
No. El esquema es plano -siete columnas sin id de padre, sin id de comentario y sin profundidad-, así que obtiene una lista de comentarios y no un árbol de respuestas. La columna query, que contiene la URL de la publicación que envió, es lo único que devuelve una fila a su hilo, y por eso conviene conservarla en su salida.
¿Puedo elegir qué comentarios recibo?+
Sí, mediante el orden, y importa más de lo que parece cuando además limita las filas. Hay seis: Best, Top, New, Controversial, Old y Q&A. Un límite con Top se queda con aquello en lo que el hilo coincidió; el mismo límite con Controversial se queda con aquello que discutió.
¿Qué llega por cada comentario?+
Siete columnas: la URL de la publicación que envió, el autor, el cuerpo del comentario, su puntuación, cuándo se creó, un enlace permanente a ese comentario concreto y una columna de estado.
¿Para qué sirve la columna status?+
Registra cómo fue la descarga de esa fila, y merece la pena leerla en lugar de ignorarla. Cuando una fila vuelve sin contenido, el motivo está ahí. El propio formulario de la plataforma también avisa de que los sitios con antibot devuelven un estado blocked en el pool gratuito, que es solo residencial: esa es su advertencia general sobre el proceso compartido, y conviene preverla.
¿Por qué esta página no muestra valores de ejemplo?+
Porque no hemos visto ninguno y preferimos decirlo antes que inventarlos. Aquí no existe ninguna exportación de Reddit Comments con datos: las ejecuciones que tenemos volvieron solo con las columnas query y status rellenas, y apuntaban a una URL de marcador de posición en lugar de a una publicación real, así que establecen el esquema y nada sobre Reddit en ninguna dirección. Los nombres de las columnas y su orden son sólidos; los formatos no nos corresponde prometerlos. Ejecute una publicación con el nivel gratuito y mírelo.
¿Cómo me llevo un hilo entero?+
Deje vacía la casilla del límite. Viene rellena con 100 y su mínimo es uno, así que vaciarla -no escribir cero- es lo que se lleva todo lo que devuelve una publicación. Tenga en cuenta que un hilo movido puede ser grande, y el estimador le mostrará el número de filas antes de que empiece la ejecución.
¿Cuánto cuesta?+
Las primeras 500 filas son gratis y de una sola vez, sin tarjeta de crédito. Después son 0,002 $ por fila -unos 2 $ por cada 1.000 comentarios-, la misma tarifa plana que en cualquier otro scraper de la plataforma. El estimador muestra el coste de una ejecución antes de que empiece.

Tus primeras 500 filas,
invita la casa.

500 filas gratis de una sola vez en cada cuenta nueva, sin caducidad. Después son 0,002 $ por fila, pago por uso, y no hay tarjeta guardada hasta que tú lo digas.

Se activa al instante · sin tarjeta

Scrapee comentarios de Reddit de cualquier publicación a escala

El Reddit Comments Scraper de Livescraper convierte URLs de publicaciones en una tabla de comentarios. Usted pega los enlaces uno por línea -o los sube como archivo CSV, XLSX, TXT o Parquet-, elige uno de los seis órdenes, limita las filas por consulta o deja la casilla vacía para llevárselo todo, y descarga los resultados como un archivo CSV, Excel o JSON limpio. Las peticiones salen por el pool de proxies compartido y no por su propia dirección.

Cada fila es un comentario: la URL de la publicación que envió, la cuenta que lo escribió, el texto, su puntuación, cuándo se creó, un enlace permanente a ese comentario concreto y una columna de estado que registra cómo fue la descarga. El orden es el control en el que merece la pena pensar, porque decide qué parte de un hilo conserva una ejecución limitada: Top y Controversial responden a preguntas realmente distintas sobre la misma publicación.

Hay dos cosas que conviene saber antes de construir sobre ello. El esquema es plano: no hay id de padre, id de comentario ni columna de profundidad, así que la exportación es una lista de comentarios y no un árbol de respuestas, y la columna query es el único vínculo con el hilo. Y esta página nombra las siete columnas y su orden sin prometer un solo formato de valor ni una tasa de relleno, porque no existe ninguna exportación de Reddit Comments con datos en la que basarlo: las ejecuciones que tenemos devolvieron solo las columnas query y status y apuntaban a una URL de marcador de posición, así que establecen el esquema y nada sobre Reddit en ninguna dirección.

También conviene meter la columna de estado en su proceso desde el principio: el propio formulario de la plataforma avisa de que los sitios con antibot devuelven un estado blocked en el pool gratuito, que es solo residencial. Ejecute una publicación con el nivel gratuito y lea las primeras filas antes de escribir un parser. Sus primeras 500 filas no cuestan nada y no necesitan tarjeta de crédito, y después son 0,002 $ por fila, tarifa plana.