Exportar resultados de busca do Reddit como linhas
O Scraper de Busca do Reddit transforma uma busca em planilha. Você envia termos de busca ou URLs reddit.com/search/?q=… - um por linha, misturados livremente, ou enviados como arquivo CSV, XLSX, TXT ou Parquet -, define um limite e escolhe uma ordenação, e cada publicação volta como uma linha: o título, o subreddit em que foi publicada, o autor, a pontuação, quantos comentários tem, quando foi feita e um link. Nove colunas, uma linha por publicação, baixáveis como CSV, Excel ou JSON. A descrição do próprio serviço diz de forma simples: ele devolve resultados de busca.
A coluna mais lida errado é comments, que é uma contagem e não os comentários em si. Nada nessas nove colunas é texto de comentário, e nenhuma ordenação fará isso aparecer - obter o que as pessoas escreveram é um serviço à parte com esquema próprio. A palavra faz papel duplo na interface, porque escolher a ordenação Comment count envia o valor comments, mas tanto a ordenação quanto a coluna são sobre quantos, não sobre o quê. O jeito útil de guardar isso é que este serviço é um índice de tópicos e o outro é o que há dentro deles.
Vale ordenar por essa contagem. Cinco ordens são oferecidas - Relevance, Hot, Top, New e Comment count - e a última é a que raramente aparece em outros lugares. Uma publicação com pontuação alta é uma com a qual as pessoas concordaram; uma com muitos comentários é uma sobre a qual se discutiu, e para pesquisa de produto, reclamações e comparações o detalhe costuma estar na discussão. subreddit chegar como coluna própria é a outra coisa que torna uma busca em todo o site valiosa: uma consulta devolve publicações de onde quer que tenham sido escritas, e você agrupa por comunidade depois em vez de buscar em cada uma separadamente. O limite vale por consulta, então vários termos multiplicam.
Uma limitação é dita sem rodeios porque muda o que esperar desta página. Temos três exportações e nenhuma delas contém uma publicação: todas as colunas de conteúdo estavam vazias nas quatro linhas. Isso merece precisão, porque as execuções não falharam por engano - consultas reais foram enviadas, nas duas formas que o formulário aceita, e as linhas ainda assim voltaram com apenas query e status preenchidos. Então os nove nomes acima são confiáveis e tudo além deles está deliberadamente ausente em vez de inventado. O formulário também avisa que sites com antibot devolvem um status bloqueado no pool gratuito, que é somente residencial; esse é o aviso da própria plataforma sobre a esteira compartilhada e vale se planejar para ele. No aspecto legal, tudo o que é coletado é público, mas author é um nome de usuário pseudônimo com o histórico de publicações de uma pessoa real atrelado - trate-o como dado pessoal, e leia os termos do Reddit antes de escalar. Comece grátis: suas primeiras 500 linhas não custam nada e não exigem cartão, e depois são US$ 0,002 por linha, taxa fixa. Veja preços para as tarifas atuais.