Scraper de Busca do Reddit

Busque no Reddit,
fique com os resultados.

Digite um termo de busca - ou cole uma URL reddit.com/search/?q=… - e as publicações voltam como uma tabela: o título, em que subreddit estava, quem publicou, a pontuação, quantos comentários tem, quando foi publicada e um link. Nove colunas, uma linha por publicação, ordenadas do jeito que você escolher.

500 linhas grátis, uma única vezdepois 0,002 $ por linhauma linha por publicaçãoCSV · JSON · Excel
Como funciona

Uma busca,
e uma ordenação.

Um campo obrigatório e dois controles. A ordenação é o que decide qual fatia do Reddit você paga.

  1. PASSO 1Faça login na plataforma.
  2. PASSO 2Abra o Scraper de Busca do Reddit.
  3. PASSO 3Digite termos de busca, um por linha - ou cole URLs reddit.com/search/?q=…, ou envie um arquivo CSV, XLSX, TXT ou Parquet.
  4. PASSO 4Defina um limite por consulta se quiser. O campo aceita no mínimo 1 e vem com 100 por padrão.
  5. PASSO 5Escolha uma ordenação: Relevance, Hot, Top, New ou Comment count.
  6. PASSO 6Clique em Get Data e baixe como CSV, JSON ou Excel.

O limite é por consulta, não por execução: cinco termos de busca com um limite de cem são cem publicações de cada um, não cem no total.

Por que é útil

Cinco ordenações,
e uma que você raramente encontra.

Uma busca lida no navegador é o que o Reddit decidiu mostrar. Uma exportação ordenada é uma amostra que você escolheu.

Ordene por número de comentários, não só por pontuação

Comment count é a ordenação que encontra discussões. Uma publicação com pontuação modesta e centenas de comentários é um tópico em que as pessoas discordaram - que costuma ser justamente onde está o detalhe útil sobre um produto ou uma decisão, e não é o que Top traz à tona.

O subreddit vem como coluna própria

subreddit estar separado de title é o que torna útil uma busca em todo o site. Uma consulta devolve publicações de onde quer que tenham sido escritas, e você pode agrupar por comunidade depois, em vez de rodar uma busca por subreddit.

Dois jeitos de pedir a mesma coisa

Um termo de busca simples e uma URL reddit.com/search/?q=… funcionam os dois, no mesmo campo. Se você já montou uma busca no navegador - com os filtros que tiver acrescentado à URL - pode colá-la em vez de reconstruí-la.

Leia isto primeiro

O que comments é
e o que não é.

Um nome de coluna desta página é lido errado com frequência, e vale trinta segundos para não planejar em cima da coisa errada.

A coluna comments é um número: quantos comentários uma publicação tem. Não são os comentários em si. Não há texto de comentário em lugar nenhum desta exportação, nem jeito de fazê-lo aparecer - as nove colunas são o esquema inteiro. Se o que você quer é o que as pessoas escreveram de fato, isso é outro serviço desta plataforma com esquema próprio, e este aqui não vai te dar por mais que você ordene.

A confusão é fácil porque o controle de ordenação usa a mesma palavra: escolher Comment count envia o valor comments. A ordenação e a coluna são relacionadas - uma ordena pela outra - mas nenhuma das duas é texto de comentário. Pense neste serviço como um índice de tópicos, e no de comentários como o que há dentro deles.

Dito isso, a contagem é exatamente o que você quer para achar os tópicos que valem leitura. Ordenar por Comment count traz à tona publicações em que muita gente respondeu, o que é um sinal diferente e muitas vezes melhor do que Top: pontuação alta significa que as pessoas concordaram com a publicação, enquanto muitos comentários significam que elas tinham algo a dizer. Para pesquisa de produto, reclamações e comparações, o segundo costuma ser o mais útil.

Uma limitação cabe aqui, e não enterrada lá embaixo. Temos três exportações deste serviço e nenhuma contém uma publicação - todas as colunas de conteúdo estavam vazias nas quatro linhas. O que faz isso valer ser dito sem rodeios é que as execuções não falharam por engano: foram enviadas consultas reais, nas duas formas que o formulário pede, e mesmo assim voltaram com apenas query e status preenchidos. Então os nomes de coluna abaixo são confiáveis e nada além deles é. Rode uma busca no plano gratuito e leia a linha de cabeçalho antes de construir qualquer coisa em cima.

O que você recebe

Nove colunas,
e nomes que podemos provar.

Esses nomes estão confirmados duas vezes: são a lista de colunas que o próprio serviço declara, e são a linha de cabeçalho de toda exportação que temos. Para que serve cada coluna está abaixo. O que cada uma conterá, não - a nota explica por quê.

query
O termo ou a URL de busca de onde esta linha veio, repetido. O scraper o escreve, então está na linha mesmo quando a requisição falhou - agrupe por ele sempre que um arquivo cobrir mais de uma busca.
title
O título da publicação, como escrito por quem a publicou.
subreddit
A comunidade em que a publicação está. Coluna própria, para você agrupar uma busca em todo o site conforme a origem das publicações.
author
O nome de usuário do Reddit ao qual a publicação é atribuída. Veja a nota jurídica abaixo - um nome de usuário é pseudônimo, não anônimo.
score
A pontuação da publicação. A pontuação do Reddit é votos positivos menos negativos, e não uma contagem bruta de votos positivos, então pode ser baixa numa publicação que muita gente viu.
comments
Quantos comentários a publicação tem - uma contagem, não os comentários. Não há texto de comentário nesta exportação. Leia a nota acima; o texto vem de um serviço à parte com esquema próprio.
created
Quando a publicação foi feita, conforme a exportação informa.
url
Um link para a publicação.
status
O que aconteceu com esta requisição - leia esta primeiro. Como uma requisição que falhou volta mesmo assim como uma linha identificada em vez de sumir, dá para saber exatamente qual consulta não funcionou. Uma linha pode chegar com os nove campos presentes e ainda assim ser um aviso de falha em vez de uma publicação.

Os nomes são sólidos; tudo além deles é tarefa da sua primeira execução. Temos três exportações deste serviço e nenhuma delas contém uma publicação. Todas as colunas de conteúdo - title, subreddit, author, score, comments, created, url - estavam vazias nas quatro linhas; só query e status traziam alguma coisa. Vale a precisão de explicar por que isso importa aqui: as consultas eram reais. Tanto um termo de busca simples quanto uma URL reddit.com/search/?q=… foram enviados, exatamente as duas formas que o formulário pede, e as linhas ainda assim voltaram sem publicação. Então essas execuções confirmam a forma da exportação e não dizem absolutamente nada sobre o conteúdo. O que elas confirmam é a lista de colunas: a linha de cabeçalho é idêntica nas três exportações e corresponde exatamente ao conjunto declarado do serviço. Todo o resto - como é uma pontuação, em que formato chega uma data, se comments é número ou texto - está deliberadamente ausente em vez de adivinhado. O formulário também avisa que sites com antibot devolvem um status bloqueado no pool gratuito, que é somente residencial; esse é o aviso da própria plataforma sobre a esteira compartilhada e vale se planejar para ele. Rode o plano gratuito sobre uma busca e leia a linha de cabeçalho e os primeiros valores antes de construir em cima deles.

Casos de uso

Três tarefas pelas quais
as pessoas usam isto.

Todos começam por algo que você digitaria na própria busca do Reddit.

Pesquisa

Descobrir onde um assunto é realmente discutido

Busque um produto, uma empresa ou um problema em todo o site e fique com subreddit. O que volta é um mapa de quais comunidades se importam - normalmente mais útil do que qualquer tópico isolado, e é justamente o que uma busca no navegador faz você deduzir rolando a tela.

Pesquisa · Estratégia
Monitoramento

Reexecutar a mesma busca de forma agendada

Os mesmos termos rodados semanalmente dão dois arquivos comparáveis. Publicações novas, movimento em score e contagens de comments subindo viram um diff em vez de uma tarde rolando a tela - e query mantém cada linha presa à busca de onde veio.

Marca · Escuta social
Triagem

Pré-selecionar os tópicos que valem leitura

Ordene por Comment count, pegue o topo do arquivo, e você tem os tópicos em que as pessoas discutiram em vez daqueles em que concordaram. Essa é a lista curta para ler à mão - e a lista de entrada para o serviço de comentários, se você quiser o que foi dito.

Produto · Suporte
Preços

Pague por linha de publicação,
nada além.

Sem assinatura, sem mínimo, sem licença por usuário. Suas primeiras 500 linhas são por nossa conta - depois disso é pago conforme o uso.

Grátis

500 linhas

Em cada conta nova, uma única vez. Sem cartão de crédito. Todos os scrapers liberados. Como nenhuma execução que temos devolveu uma publicação, esta é a parte que mais importa aqui: gaste algumas linhas descobrindo o que essa exportação realmente contém antes de planejar em cima dela.

Uma única vez · Sem cartão
Pague conforme o uso

US$ 0,002 por linha

Cerca de US$ 2 por 1.000 publicações, a mesma taxa fixa de qualquer outro scraper da plataforma. O limite é por consulta, então dez termos de busca com limite de cem são mil linhas - vale fazer a conta antes de começar.

Os créditos nunca expiram
Enterprise

Sob medida - assuntos inteiros, de forma agendada

Preços por volume, SLAs, workers dedicados e onboarding sob medida para times que acompanham um assunto através de comunidades em vez de rodar uma busca de vez em quando. Diga seus números e nós orçamos.

Fale com vendas
10 % de desconto na sua primeira execução paga.Use o código LIVESCRAPER10 no checkout.
Cadastre-se
Combina bem com

A mesma pergunta,
em outro lugar.

O Reddit é um lugar onde as pessoas conversam. Estes leem os outros, cada um com seu próprio esquema.

Jurídico

É legal fazer scraping
de resultados de busca do Reddit?

Resposta curta: são publicações públicas numa página de busca pública - mas um nome de usuário é uma pessoa, e os termos do Reddit regem o acesso automatizado.

Tudo nessas colunas é mostrado a qualquer visitante numa página pública de resultados de busca, logado ou não. Nenhum login é usado, nenhum paywall é atravessado e nenhuma conta é tocada, e a execução passa pelo nosso pool de proxies em vez do seu próprio endereço. Coletar informação publicamente visível para pesquisa é prática consolidada há muito tempo.

A coluna author é dado pessoal, e no Reddit isso pesa mais do que o habitual. Nomes de usuário são pseudônimos, não anônimos: muitos são identidades de longa data com anos de histórico de publicações atrelados, e as pessoas dizem coisas sob eles justamente porque não estão usando o nome real. Se você armazena a coluna, está tratando dados pessoais, e o GDPR e regimes semelhantes se aplicam a você independentemente de onde os obteve. Contar com que frequência um assunto aparece é um caso fácil; montar um perfil do que um usuário nomeado publicou não é, e este serviço não é destinado a isso.

Os termos do Reddit restringem o acesso automatizado e o conteúdo é licenciado ao Reddit por quem o escreveu, então isso continua sendo uma questão de termos e não do que é publicamente alcançável; leia-os antes de escalar. Não rodamos rastreadores de terceiros na camada de dados, e suas exportações se autoexcluem em 30 dias.

livescraper.app · princípios
Apenas resultados de busca públicos
Sem logins, sem paywalls
Nomes de usuário são pseudônimos, não anônimos - trate-os como dados pessoais!
Sem rastreadores de terceiros na camada de dados
As exportações se excluem sozinhas (30 dias)
As mesmas publicações que qualquer visitante vê na busca do próprio Reddit.
FAQ

O que as pessoas perguntam antes de se cadastrar.

As perguntas que mais ouvimos. Mais alguma coisa? Fale conosco - quem escreve as respostas são pessoas, não bots.

O que eu envio?+
Ou um termo de busca simples, ou uma URL de busca do Reddit no formato reddit.com/search/?q=…, um por linha, misturados livremente. O próprio exemplo do formulário mostra as duas formas. Você pode enviar um arquivo CSV, XLSX, TXT ou Parquet em vez de colar.
Quais colunas a exportação vai conter?+
Nove: query, title, subreddit, author, score, comments, created, url e status. Essa é a lista de colunas que o próprio serviço declara, e corresponde à linha de cabeçalho de toda exportação que temos.
Isto devolve os comentários de uma publicação?+
Não. A coluna comments é uma contagem de quantos comentários uma publicação tem, não os comentários em si, e não há texto de comentário em nenhuma dessas nove colunas. Obter o que as pessoas realmente escreveram é um serviço à parte na plataforma, com esquema próprio. Use este para achar os tópicos, e aquele para lê-los.
Quais são as opções de ordenação?+
Cinco: Relevance, Hot, Top, New e Comment count. Comment count é a que raramente se encontra em outros lugares, e costuma ser a mais útil - uma publicação com pontuação modesta e muitos comentários é um tópico em que as pessoas discordaram, que é onde o detalhe costuma estar.
Qual é o formato da coluna created?+
Não dizemos, e isso é deliberado. Nenhuma das execuções que temos devolveu uma publicação, então nunca vimos um valor nela. Adivinhar seria pior do que inútil, porque uma coluna de data é exatamente o tipo de campo contra o qual as pessoas escrevem código de parsing. Rode o plano gratuito sobre uma busca e olhe você mesmo primeiro.
Vocês realmente executaram isto?+
Três vezes, e nenhuma execução devolveu uma publicação - todas as colunas de conteúdo estavam vazias nas quatro linhas. Vale a precisão de explicar por que isso importa: as consultas eram reais, não de exemplo. As duas formas que o formulário pede foram enviadas, um termo de busca simples e uma URL reddit.com/search, e as linhas ainda assim voltaram com apenas query e status preenchidos. Isso mostra a forma da exportação e nada sobre o conteúdo dela, e preferimos dizer isso a enfeitar a página.
Precisa de proxy?+
O formulário avisa que sites com antibot devolvem um status bloqueado no pool gratuito, que é somente residencial. Esse é o aviso da própria plataforma sobre a esteira compartilhada, e não uma afirmação sobre este site, e vale se planejar para ele. O que podemos dizer do nosso lado é mais estreito e mais útil: nenhuma das três exportações que temos voltou com uma publicação dentro, então leia a coluna status na sua própria primeira execução antes de construir qualquer coisa sobre o resto.
Quanto custa?+
As primeiras 500 linhas de uma conta nova são gratuitas e valem uma única vez; depois disso são 0,002 $ por linha - cerca de 2 $ por 1.000 - pago conforme o uso, sem assinatura. Os créditos não expiram e não há reinício mensal.

Ache os tópicos primeiro.
Leia depois.

Rode uma busca, ordene por número de comentários e veja quais conversas valem a sua tarde. Suas primeiras 500 linhas são grátis.

Exportar resultados de busca do Reddit como linhas

O Scraper de Busca do Reddit transforma uma busca em planilha. Você envia termos de busca ou URLs reddit.com/search/?q=… - um por linha, misturados livremente, ou enviados como arquivo CSV, XLSX, TXT ou Parquet -, define um limite e escolhe uma ordenação, e cada publicação volta como uma linha: o título, o subreddit em que foi publicada, o autor, a pontuação, quantos comentários tem, quando foi feita e um link. Nove colunas, uma linha por publicação, baixáveis como CSV, Excel ou JSON. A descrição do próprio serviço diz de forma simples: ele devolve resultados de busca.

A coluna mais lida errado é comments, que é uma contagem e não os comentários em si. Nada nessas nove colunas é texto de comentário, e nenhuma ordenação fará isso aparecer - obter o que as pessoas escreveram é um serviço à parte com esquema próprio. A palavra faz papel duplo na interface, porque escolher a ordenação Comment count envia o valor comments, mas tanto a ordenação quanto a coluna são sobre quantos, não sobre o quê. O jeito útil de guardar isso é que este serviço é um índice de tópicos e o outro é o que há dentro deles.

Vale ordenar por essa contagem. Cinco ordens são oferecidas - Relevance, Hot, Top, New e Comment count - e a última é a que raramente aparece em outros lugares. Uma publicação com pontuação alta é uma com a qual as pessoas concordaram; uma com muitos comentários é uma sobre a qual se discutiu, e para pesquisa de produto, reclamações e comparações o detalhe costuma estar na discussão. subreddit chegar como coluna própria é a outra coisa que torna uma busca em todo o site valiosa: uma consulta devolve publicações de onde quer que tenham sido escritas, e você agrupa por comunidade depois em vez de buscar em cada uma separadamente. O limite vale por consulta, então vários termos multiplicam.

Uma limitação é dita sem rodeios porque muda o que esperar desta página. Temos três exportações e nenhuma delas contém uma publicação: todas as colunas de conteúdo estavam vazias nas quatro linhas. Isso merece precisão, porque as execuções não falharam por engano - consultas reais foram enviadas, nas duas formas que o formulário aceita, e as linhas ainda assim voltaram com apenas query e status preenchidos. Então os nove nomes acima são confiáveis e tudo além deles está deliberadamente ausente em vez de inventado. O formulário também avisa que sites com antibot devolvem um status bloqueado no pool gratuito, que é somente residencial; esse é o aviso da própria plataforma sobre a esteira compartilhada e vale se planejar para ele. No aspecto legal, tudo o que é coletado é público, mas author é um nome de usuário pseudônimo com o histórico de publicações de uma pessoa real atrelado - trate-o como dado pessoal, e leia os termos do Reddit antes de escalar. Comece grátis: suas primeiras 500 linhas não custam nada e não exigem cartão, e depois são US$ 0,002 por linha, taxa fixa. Veja preços para as tarifas atuais.