Exporter les résultats de recherche Reddit en lignes
Le Scraper de Recherche Reddit transforme une recherche en tableur. Vous soumettez des termes de recherche ou des URL reddit.com/search/?q=… - un par ligne, mélangés librement, ou téléversés en fichier CSV, XLSX, TXT ou Parquet -, fixez une limite et choisissez un tri, et chaque publication revient sous forme de ligne : le titre, le subreddit où elle a été publiée, l'auteur, son score, combien de commentaires elle a, quand elle a été faite, et un lien. Neuf colonnes, une ligne par publication, téléchargeables en CSV, Excel ou JSON. La description du service le dit simplement : il renvoie des résultats de recherche.
La colonne le plus souvent mal lue est comments, qui est un décompte et non les commentaires eux-mêmes. Rien dans ces neuf colonnes n'est du texte de commentaire, et aucun tri ne le fera apparaître - récupérer ce que les gens ont écrit est un service distinct avec son propre schéma. Le mot fait double emploi dans l'interface, puisque choisir le tri Comment count envoie la valeur comments, mais le tri comme la colonne portent sur le combien, pas sur le quoi. La bonne façon de le retenir : ce service est un index de fils et l'autre est ce qu'il y a dedans.
Ce décompte mérite qu'on trie dessus. Cinq ordres sont proposés - Relevance, Hot, Top, New et Comment count - et le dernier est celui qui apparaît rarement ailleurs. Une publication au score élevé est une publication avec laquelle les gens étaient d'accord ; une publication avec beaucoup de commentaires est une publication dont on a débattu, et pour la recherche produit, les plaintes et les comparaisons, le détail est généralement dans le débat. Que subreddit arrive dans sa propre colonne est l'autre chose qui rend une recherche à l'échelle du site intéressante : une requête renvoie des publications d'où qu'elles aient été écrites, et vous regroupez par communauté ensuite plutôt que de chercher dans chacune séparément. La limite s'applique par requête : plusieurs termes se multiplient donc.
Une limite est énoncée sans détour parce qu'elle change ce qu'il faut attendre de cette page. Nous détenons trois exports et aucun ne contient de publication : toutes les colonnes de contenu étaient vides sur les quatre lignes. Cela mérite de la précision, car les exécutions n'ont pas été mal lancées - de vraies requêtes ont été soumises, dans les deux formes que le formulaire accepte, et les lignes sont tout de même revenues avec seulement query et status renseignés. Les neuf noms ci-dessus sont donc fiables et tout ce qui va au-delà est délibérément absent plutôt qu'inventé. Le formulaire avertit par ailleurs que les sites protégés par anti-bot renvoient un statut bloqué sur le pool gratuit, qui est résidentiel uniquement ; c'est l'avertissement propre à la plateforme concernant la chaîne partagée et il vaut la peine d'être anticipé. Côté droit, tout ce qui est collecté est public, mais author est un nom d'utilisateur pseudonyme auquel s'attache l'historique de publications d'une personne réelle - traitez-le comme une donnée personnelle, et lisez les conditions de Reddit avant de monter en charge. Commencez gratuitement : vos 500 premières lignes ne coûtent rien et ne demandent pas de carte, puis c'est 0,002 $ par ligne, au forfait. Consultez les tarifs pour les prix en vigueur.