Exportar resultados de búsqueda de Reddit como filas
El Scraper de Búsqueda de Reddit convierte una búsqueda en una hoja de cálculo. Envías términos de búsqueda o URLs reddit.com/search/?q=… - uno por línea, mezclados libremente, o subidos como archivo CSV, XLSX, TXT o Parquet -, fijas un límite y eliges una ordenación, y cada publicación vuelve como una fila: el título, el subreddit en el que se publicó, el autor, su puntuación, cuántos comentarios tiene, cuándo se hizo y un enlace. Nueve columnas, una fila por publicación, descargables como CSV, Excel o JSON. La descripción del propio servicio lo dice sin rodeos: devuelve resultados de búsqueda.
La columna que más se malinterpreta es comments, que es un recuento y no los comentarios en sí. Nada en estas nueve columnas es texto de comentario, y ninguna ordenación lo hará aparecer - obtener lo que la gente escribió es un servicio aparte con su propio esquema. La palabra hace doble trabajo en la interfaz, porque elegir la ordenación Comment count envía el valor comments, pero tanto la ordenación como la columna van de cuántos, no de qué. La forma útil de entenderlo es que este servicio es un índice de hilos y el otro es lo que hay dentro.
Ese recuento merece que ordenes por él. Se ofrecen cinco órdenes - Relevance, Hot, Top, New y Comment count - y el último es el que rara vez aparece en otros sitios. Una publicación con puntuación alta es una con la que la gente estuvo de acuerdo; una con muchos comentarios es una sobre la que se discutió, y para investigación de producto, quejas y comparaciones el detalle suele estar en la discusión. Que subreddit llegue como columna propia es lo otro que hace que merezca la pena una búsqueda de todo el sitio: una consulta devuelve publicaciones de dondequiera que se escribieran, y agrupas por comunidad después en vez de buscar en cada una por separado. El límite se aplica por consulta, así que varios términos multiplican.
Una limitación se dice sin rodeos porque cambia lo que cabe esperar de esta página. Tenemos tres exportaciones y ninguna contiene una publicación: todas las columnas de contenido estaban vacías en las cuatro filas. Eso merece precisión, porque las ejecuciones no fallaron por error - se enviaron consultas reales, de las dos formas que el formulario acepta, y las filas aun así volvieron con solo query y status rellenos. Así que los nueve nombres de arriba son fiables y todo lo que va más allá está deliberadamente ausente en vez de inventado. El formulario también avisa de que los sitios con antibots devuelven un estado bloqueado en el pool gratuito, que es solo residencial; ese es el propio aviso de la plataforma sobre la tubería compartida y merece preverse. En lo legal, todo lo recogido es público, pero author es un nombre de usuario seudónimo con el historial de publicaciones de una persona real detrás - trátalo como dato personal, y lee los términos de Reddit antes de escalar. Empieza gratis: tus primeras 500 filas no cuestan nada y no necesitan tarjeta, y después son 0,002 $ por fila, tarifa plana. Consulta precios para las tarifas actuales.