Faça scraping de comentários do Reddit de qualquer post em escala
O Reddit Comments Scraper da Livescraper transforma URLs de posts em uma tabela de comentários. Você cola os links um por linha - ou os envia como arquivo CSV, XLSX, TXT ou Parquet -, escolhe uma das seis ordenações, limita as linhas por consulta ou deixa o campo em branco para levar tudo, e baixa os resultados como um arquivo CSV, Excel ou JSON limpo. As requisições saem pelo pool de proxies compartilhado e não pelo seu próprio endereço.
Cada linha é um comentário: a URL do post que você enviou, a conta que o escreveu, o texto do comentário, a pontuação, quando foi criado, um link permanente para aquele comentário específico e uma coluna de status registrando como foi a coleta. A ordenação é o controle em que vale a pena pensar, porque decide que parte de uma thread uma execução limitada guarda - Top e Controversial respondem a perguntas realmente diferentes sobre o mesmo post.
Duas coisas valem ser sabidas antes de construir em cima disso. O esquema é plano: não há id de pai, id de comentário nem coluna de profundidade, então a exportação é uma lista de comentários e não uma árvore de respostas, e a coluna query é o único vínculo de volta à thread. E esta página nomeia as sete colunas e a ordem delas sem prometer um único formato de valor ou taxa de preenchimento, porque não existe nenhuma exportação do Reddit Comments com dados em que basear isso - as execuções que temos devolveram apenas as colunas query e status e miravam uma URL de espaço reservado, então estabelecem o esquema e nada sobre o Reddit em nenhuma direção.
Também vale colocar a coluna de status no seu processo desde o início: o próprio formulário da plataforma avisa que sites com antibot devolvem um status blocked no pool gratuito, que é só residencial. Rode um post no nível gratuito e leia as primeiras linhas antes de escrever um parser. Suas primeiras 500 linhas não custam nada e não exigem cartão de crédito, e depois disso são US$ 0,002 por linha, fixo.