Scraper de Comentários do Reddit

Aponte para um post,
fique com a thread inteira.

Cole a URL de um post do Reddit e os comentários voltam como tabela: quem escreveu cada um, o texto do comentário em si, a pontuação, quando foi publicado, um link direto para ele e uma coluna de status. Sete colunas, uma linha por comentário, na ordenação que você escolher entre seis.

500 linhas grátis, uma única vezdepois 0,002 $ por linha7 colunasCSV · XLSX · JSON
Como funciona

Entra uma URL de post,
sai uma thread.

Você escolhe os posts e a ordem. O trabalho lê os comentários de cada um e escreve uma linha para cada comentário que devolve.

  1. PASSO 1Faça login na plataforma.
  2. PASSO 2Abra o Reddit Comments Scraper.
  3. PASSO 3Cole URLs de posts do Reddit, uma por linha - ou envie um arquivo CSV, XLSX, TXT ou Parquet.
  4. PASSO 4Escolha uma ordenação: Best, Top, New, Controversial, Old ou Q&A.
  5. PASSO 5Defina um limite por consulta, ou deixe em branco para levar tudo.
  6. PASSO 6Escolha o formato de saída e clique em Get Data.

Uma linha por comentário, cada uma marcada com a URL do post de onde veio - o que aqui pesa mais do que o normal, porque é a única coluna que liga um comentário de volta à sua thread.

Porque as equipas o usam

O texto do comentário,
não a contagem deles.

O que as pessoas escreveram de fato

Este é o serviço que devolve o corpo dos comentários. O irmão dele, o Reddit Search Scraper, tem uma coluna chamada comments - mas essa é quantos um post tem, um número. Se você quer as frases e não a contagem, é este, e os dois foram feitos para rodar um depois do outro.

Seis ordenações, incluindo as que importam

Best, Top, New, Controversial, Old e Q&A. A ordem não é enfeite quando você também limita as linhas por consulta: um limite com Top traz os comentários com que a thread concordou, e o mesmo limite com Controversial traz a discussão. Escolha a ordenação já pensando no limite, não depois dele.

Cada linha aponta para si mesma

Cada comentário traz o próprio link permanente, não só o do post. É isso que deixa uma exportação auditável meses depois - uma citação em um relatório pode ser rastreada até o comentário exato de onde saiu, e quem revisa consegue abri-lo sem vasculhar a thread à mão.

O que você recebe

Sete colunas,
uma linha por comentário.

Cada linha é um comentário: quem escreveu, o que diz, como pontuou, quando apareceu, onde encontrá-lo e como foi a coleta.

Duas coisas valem ser sabidas antes de planejar em cima desta exportação, e ambas vêm do formato do esquema e não de alguma execução. A primeira é que ela é plana: não há id de pai, id de comentário nem coluna de profundidade, então o que você recebe é uma lista de comentários e não uma árvore de respostas - query é a única coisa que liga uma linha de volta à sua thread, e é por isso que vale a pena mantê-la. A segunda é que status é uma coluna de verdade e não enfeite. A lista de colunas abaixo é o array publicado pela plataforma, conferido com o cabeçalho das execuções arquivadas; leia a observação logo depois dela antes de escrever um parser, porque ela é franca sobre o que esta página vai e não vai lhe contar.

Dicionário de dados

Sete colunas,
na ordem da exportação.

A linha de cabeçalho da exportação, na ordem, conferida com a lista de colunas publicada pela plataforma. As descrições dizem para que serve cada campo; não afirmam nada sobre o formato dele nem sobre com que frequência chega preenchido - veja a nota abaixo.

query
A URL do post do Reddit que você enviou, repetida em cada linha que veio dela. Escrita pelo scraper em vez de retirada da página, por isso está em todas as linhas - e nesta exportação pesa mais do que o normal, porque nada mais indica a que thread um comentário pertence.
author
A conta do Reddit que escreveu o comentário. Um nome de usuário, não um nome real, mas ainda assim uma pessoa - veja a observação sobre dados pessoais mais adiante nesta página.
body
O texto do comentário. É a coluna que diferencia este serviço do de busca, cujo campo comments é uma contagem e não o que foi escrito.
score
A pontuação do comentário como o Reddit a exibe - o saldo dos votos que recebeu.
created
Quando o comentário foi publicado. Esta página não informa o formato, porque nenhuma execução que temos devolveu um; confira as primeiras linhas da sua própria execução antes de interpretá-lo.
permalink
Um link para o comentário em si, não para o post. A coluna a manter caso um dia precise conferir uma citação à mão ou citá-la em um relatório.
status
Como foi a coleta daquela linha. É uma coluna de trabalho, não enfeite: quando uma linha volta sem conteúdo, o motivo está aqui. Leia-a antes de concluir que um post simplesmente não tinha comentários.

Leia este dicionário como uma lista de nomes, não como uma promessa sobre conteúdos. Os sete nomes e a ordem deles são sólidos - a lista de colunas publicada pela plataforma e o cabeçalho das execuções arquivadas batem exatamente. O que não está resolvido é o que chega neles, porque não existe nenhuma exportação do Reddit Comments com dados em que basear uma afirmação: as execuções que temos voltaram com apenas query e status preenchidos, e miravam uma URL de espaço reservado em vez de um post real, então falam do esquema e absolutamente nada sobre o Reddit, em nenhuma direção. Por isso você não encontra nesta página nenhum valor de exemplo, nenhum formato de data e nenhuma taxa de preenchimento. Dois fatos estruturais valem mesmo assim, porque são propriedades da própria lista de colunas: a exportação é plana, sem id de pai, id de comentário ou profundidade com que reconstruir uma árvore de respostas, então planeje uma lista e não uma hierarquia; e vale colocar status no seu processo desde o início. O próprio formulário da plataforma avisa que sites com antibot devolvem um status blocked no pool gratuito, que é só residencial - esse é o aviso geral dela sobre o processo compartilhado, e vale prever, seja qual for o alvo. Rode um post no nível gratuito e olhe as primeiras linhas antes de construir.

Controles da execução

Definido no trabalho,
não na planilha.

Uma lista de URLs de posts, uma ordenação e um limite. A ordenação e o limite trabalham juntos: decidem que parte de uma thread você guarda e quanto custa uma execução.

URL de post do Reddit Uma por linha Ordenação: Best Ordenação: Top Ordenação: New Ordenação: Controversial Ordenação: Old Ordenação: Q&A Limite por consulta Em branco para tudo Envio de CSV · XLSX · TXT · Parquet Pool de proxies compartilhado, nunca o seu IP
Fluxos de trabalho comuns

Três tarefas que correm
aqui mais do que quaisquer outras.

Alguns exemplos de como as equipes usam dados de comentários para responder a uma pergunta que realmente têm.

Pesquisa

Leia o que a thread realmente disse

A pontuação de um post diz que a reação foi forte; não diz qual foi. Puxe os textos e você tem o argumento diante de si em vez de um número no lugar dele - e com um link permanente em cada linha, tudo o que você citar pode ser conferido.

Pesquisa · Insights
Produto

Ache a reclamação embaixo dos votos positivos

Ordene por Controversial em vez de Top e limite as linhas: você fica com a parte da thread que discordou de si mesma. Em geral é aí que está a necessidade não atendida - a objeção que ainda se discute, e não a opinião com que todo mundo já concordava.

Produto · Suporte
Pipeline

Encadeie depois de uma busca

Rode o Reddit Search Scraper para achar os posts, guarde a coluna url dele e jogue essa lista aqui direto como suas consultas. A busca diz quais threads importam; este serviço diz o que foi dito nelas. Os dois esquemas são separados de propósito e se juntam pelo link do post.

Dados · Ops
Preços

Pague só pelas linhas
que você realmente extrai.

Sem assinatura, sem mínimo, sem fatura recorrente. Suas primeiras 500 linhas são por nossa conta - depois disso, pagamento conforme o uso, à mesma tarifa fixa de qualquer outro scraper daqui.

Nível gratuito

500 linhas grátis - 0 $

Em cada conta nova, uma única vez. Sem cartão de crédito. Limites por consulta, envio de arquivos e todos os formatos de exportação incluídos.

0 $ para sempre
Conforme o uso

US$ 0,002 por linha, após o plano gratuito

Cerca de US$ 2 por 1.000 comentários. O estimador prévio mostra a contagem de linhas e o custo em créditos antes de a execução começar - sem contas surpresa e sem unidades de computação para traduzir.

O mais escolhido
Volume

À medida · grande volume

Preços por volume, workers dedicados e um SLA para monitoramento contínuo ou extrações de threads muito grandes. Diga os seus números e enviamos uma proposta.

Fale connosco
10 % de desconto na sua primeira execução paga.Use o código LIVESCRAPER10 no pagamento.
Cadastre-se
Combina bem com

O post de onde veio
e o mesmo trabalho em outro lugar.

A parte legal

É legal fazer scraping
de comentários do Reddit?

Resposta curta: os comentários são públicos - mas esta exportação contém dados pessoais, e é melhor dizer isso com clareza.

Os comentários coletados aqui são os que um post mostra a qualquer pessoa que o abra, logada ou não. Nada disso toca em um login, em um subreddit privado, em uma mensagem direta ou em uma conta que não seja sua. Coletar discussões publicadas publicamente é prática estabelecida há muito tempo, e o link permanente em cada linha significa que tudo o que você levar pode ser rastreado até a origem.

Diferentemente de um catálogo de produtos, esta exportação é dado pessoal, e preferimos dizer isso a insinuar o contrário. author é uma conta do Reddit e body é algo que uma pessoa escreveu - pseudônimo, não anônimo. Nomes de usuário são rotineiramente associáveis a indivíduos, e o texto de um comentário pode revelar muito sobre quem o escreveu. Trate as duas colunas sob as regras de privacidade que se aplicam a você, guarde só o que precisar e pense bem antes de republicar um comentário ao lado do nome do autor.

Os termos do próprio Reddit restringem o acesso automatizado e o licenciamento do conteúdo já mudou mais de uma vez, então isto é tanto uma questão de termos quanto jurídica: confira-os, sobretudo para qualquer uso comercial ou de redistribuição. Não executamos rastreadores de terceiros na camada de dados, e suas exportações são apagadas automaticamente após 30 dias.

livescraper.app · princípios
Apenas comentários públicos
Sem logins, sem subreddits privados
Nomes de usuário são dados pessoais
Cada linha guarda o seu link permanente
Exportações se excluem sozinhas (30 dias)
Confira os termos do Reddit antes de escalar.
Perguntas frequentes

O que as pessoas perguntam
antes de se cadastrar.

As perguntas que mais ouvimos. Mais alguma coisa? Fale conosco - quem escreve as respostas são pessoas, não bots.

Como faço scraping de comentários do Reddit?+
Com o Reddit Comments Scraper:
  1. Entre na plataforma.
  2. Abra o Reddit Comments Scraper.
  3. Cole URLs de posts do Reddit, uma por linha - ou envie um arquivo CSV, XLSX, TXT ou Parquet.
  4. Escolha uma ordenação: Best, Top, New, Controversial, Old ou Q&A.
  5. Defina um limite por consulta, ou deixe em branco para levar tudo.
  6. Escolha o formato de saída e clique em Get Data.
Qual é a diferença entre este e o Reddit Search Scraper?+
A busca encontra posts; este lê os comentários de um. O serviço de busca tem uma coluna chamada comments, mas essa é quantos um post tem - um número, não o que foi escrito. Este serviço devolve o corpo dos comentários. Rodar a busca primeiro e alimentar os links de post dela aqui é a combinação prevista.
Recebo a estrutura de respostas?+
Não. O esquema é plano - sete colunas sem id de pai, sem id de comentário e sem profundidade -, então você recebe uma lista de comentários e não uma árvore de respostas. A coluna query, que contém a URL do post que você enviou, é a única coisa que liga uma linha de volta à sua thread, e por isso vale a pena mantê-la na sua saída.
Posso escolher quais comentários recebo?+
Sim, pela ordenação, e ela importa mais do que parece quando você também limita as linhas. São seis: Best, Top, New, Controversial, Old e Q&A. Um limite com Top guarda aquilo com que a thread concordou; o mesmo limite com Controversial guarda aquilo sobre o que ela discutiu.
O que volta para cada comentário?+
Sete colunas: a URL do post que você enviou, o autor, o corpo do comentário, a pontuação, quando foi criado, um link permanente para aquele comentário específico e uma coluna de status.
Para que serve a coluna status?+
Ela registra como foi a coleta daquela linha, e vale ler em vez de ignorar. Quando uma linha volta sem conteúdo, o motivo está ali. O próprio formulário da plataforma também avisa que sites com antibot devolvem um status blocked no pool gratuito, que é só residencial - esse é o aviso geral dela sobre o processo compartilhado, e vale prever.
Por que esta página não mostra valores de exemplo?+
Porque não vimos nenhum, e preferimos dizer isso a inventá-los. Aqui não existe nenhuma exportação do Reddit Comments com dados: as execuções que temos voltaram com apenas as colunas query e status preenchidas, e miravam uma URL de espaço reservado em vez de um post real, então estabelecem o esquema e nada sobre o Reddit em nenhuma direção. Os nomes das colunas e a ordem deles são sólidos; os formatos não cabe a nós prometer. Rode um post no nível gratuito e veja.
Como levo uma thread inteira?+
Deixe o campo de limite em branco. Ele vem preenchido com 100 e o mínimo dele é um, então esvaziá-lo - e não digitar zero - é o que leva tudo o que um post devolve. Lembre-se de que uma thread movimentada pode ser grande, e o estimador vai mostrar a contagem de linhas antes de a execução começar.
Quanto custa?+
As primeiras 500 linhas são gratuitas e de uma única vez, sem cartão de crédito. Depois disso são US$ 0,002 por linha - cerca de US$ 2 por 1.000 comentários - a mesma tarifa fixa de qualquer outro scraper da plataforma. O estimador mostra o custo de uma execução antes de ela começar.

Suas primeiras 500 linhas,
por nossa conta.

500 linhas grátis de uma única vez em cada conta nova - sem prazo de validade. Depois são US$ 0,002 por linha, conforme o uso - sem cartão registrado até você mandar.

Ativa na hora · sem cartão

Faça scraping de comentários do Reddit de qualquer post em escala

O Reddit Comments Scraper da Livescraper transforma URLs de posts em uma tabela de comentários. Você cola os links um por linha - ou os envia como arquivo CSV, XLSX, TXT ou Parquet -, escolhe uma das seis ordenações, limita as linhas por consulta ou deixa o campo em branco para levar tudo, e baixa os resultados como um arquivo CSV, Excel ou JSON limpo. As requisições saem pelo pool de proxies compartilhado e não pelo seu próprio endereço.

Cada linha é um comentário: a URL do post que você enviou, a conta que o escreveu, o texto do comentário, a pontuação, quando foi criado, um link permanente para aquele comentário específico e uma coluna de status registrando como foi a coleta. A ordenação é o controle em que vale a pena pensar, porque decide que parte de uma thread uma execução limitada guarda - Top e Controversial respondem a perguntas realmente diferentes sobre o mesmo post.

Duas coisas valem ser sabidas antes de construir em cima disso. O esquema é plano: não há id de pai, id de comentário nem coluna de profundidade, então a exportação é uma lista de comentários e não uma árvore de respostas, e a coluna query é o único vínculo de volta à thread. E esta página nomeia as sete colunas e a ordem delas sem prometer um único formato de valor ou taxa de preenchimento, porque não existe nenhuma exportação do Reddit Comments com dados em que basear isso - as execuções que temos devolveram apenas as colunas query e status e miravam uma URL de espaço reservado, então estabelecem o esquema e nada sobre o Reddit em nenhuma direção.

Também vale colocar a coluna de status no seu processo desde o início: o próprio formulário da plataforma avisa que sites com antibot devolvem um status blocked no pool gratuito, que é só residencial. Rode um post no nível gratuito e leia as primeiras linhas antes de escrever um parser. Suas primeiras 500 linhas não custam nada e não exigem cartão de crédito, e depois disso são US$ 0,002 por linha, fixo.