Scraper de Recherche Reddit

Cherchez sur Reddit,
gardez les résultats.

Tapez un terme de recherche - ou collez une URL reddit.com/search/?q=… - et les publications reviennent sous forme de tableau : le titre, le subreddit où elle se trouvait, qui l'a publiée, son score, combien de commentaires elle a, quand elle a été publiée, et un lien. Neuf colonnes, une ligne par publication, triées comme vous le choisissez.

500 lignes offertes, une fois0,002 $ par ligne ensuiteune ligne par publicationCSV · JSON · Excel
Comment ça marche

Une recherche,
et un tri.

Un champ obligatoire et deux réglages. C'est le tri qui décide quelle tranche de Reddit vous payez.

  1. ÉTAPE 1Connectez-vous à la plateforme.
  2. ÉTAPE 2Ouvrez le Scraper de Recherche Reddit.
  3. ÉTAPE 3Tapez des termes de recherche, un par ligne - ou collez des URL reddit.com/search/?q=…, ou téléversez un fichier CSV, XLSX, TXT ou Parquet.
  4. ÉTAPE 4Fixez une limite par requête si vous le souhaitez. Le champ accepte un minimum de 1 et vaut 100 par défaut.
  5. ÉTAPE 5Choisissez un tri : Relevance, Hot, Top, New ou Comment count.
  6. ÉTAPE 6Cliquez sur Get Data et téléchargez en CSV, JSON ou Excel.

La limite s'applique par requête et non par exécution : cinq termes de recherche avec une limite de cent font cent publications pour chacun, pas cent au total.

Pourquoi c'est utile

Cinq tris,
et un que l'on obtient rarement.

Une recherche lue dans un navigateur, c'est ce que Reddit a décidé de vous montrer. Un export trié est un échantillon que vous avez choisi.

Trier par nombre de commentaires, pas seulement par score

Comment count est le tri qui trouve les débats. Une publication au score modeste avec des centaines de commentaires est un fil où les gens n'étaient pas d'accord - et c'est généralement là que se trouve le détail utile sur un produit ou une décision, ce que Top ne fait pas remonter.

Le subreddit arrive dans sa propre colonne

Que subreddit soit séparé de title est ce qui rend utile une recherche à l'échelle du site. Une requête renvoie des publications d'où qu'elles aient été écrites, et vous pouvez regrouper par communauté après coup plutôt que de lancer une recherche par subreddit.

Deux façons de demander la même chose

Un simple terme de recherche et une URL reddit.com/search/?q=… fonctionnent tous les deux, dans le même champ. Si vous avez déjà construit une recherche dans le navigateur - avec les filtres que vous avez ajoutés à l'URL - vous pouvez la coller plutôt que de la reconstituer.

À lire d'abord

Ce qu'est comments
et ce qu'il n'est pas.

Un nom de colonne de cette page est systématiquement mal lu, et trente secondes valent la peine pour ne pas bâtir un plan sur la mauvaise chose.

La colonne comments est un nombre : combien de commentaires a une publication. Ce ne sont pas les commentaires eux-mêmes. Il n'y a de texte de commentaire nulle part dans cet export, ni moyen de l'y faire apparaître - les neuf colonnes sont tout le schéma. Si ce que vous voulez, c'est ce que les gens ont réellement écrit, c'est un autre service de cette plateforme avec son propre schéma, et celui-ci ne vous le donnera pas quel que soit le tri.

La confusion est facile parce que le réglage de tri emploie le même mot : choisir Comment count envoie la valeur comments. Le tri et la colonne sont liés - l'un ordonne selon l'autre - mais ni l'un ni l'autre n'est du texte de commentaire. Voyez ce service comme un index de fils, et le service de commentaires comme ce qu'il y a dedans.

Cela dit, le décompte est exactement ce qu'il vous faut pour trouver les fils qui méritent lecture. Trier par Comment count fait remonter les publications auxquelles beaucoup ont répondu, ce qui est un signal différent et souvent meilleur que Top : un score élevé signifie que les gens étaient d'accord avec la publication, tandis qu'un nombre élevé de commentaires signifie qu'ils avaient quelque chose à dire. Pour la recherche produit, les plaintes et les comparaisons, le second est généralement le plus utile des deux.

Une limite a sa place ici plutôt qu'enfouie tout en bas. Nous détenons trois exports pour ce service et aucun ne contient de publication - chaque colonne de contenu était vide sur les quatre lignes. Ce qui mérite d'être dit clairement, c'est que les exécutions n'ont pas été mal lancées : de vraies requêtes ont été soumises, dans les deux formes que le formulaire demande, et elles sont tout de même revenues avec seulement query et status renseignés. Les noms de colonnes ci-dessous sont donc fiables et rien au-delà ne l'est. Lancez une recherche sur l'offre gratuite et lisez la ligne d'en-tête avant de bâtir quoi que ce soit dessus.

Ce que vous obtenez

Neuf colonnes,
et des noms que nous pouvons prouver.

Ces noms sont confirmés deux fois : ils constituent la liste de colonnes que le service déclare lui-même, et ils sont la ligne d'en-tête de chaque export que nous détenons. À quoi sert chaque colonne est ci-dessous. Ce que chacune contiendra, non - la note explique pourquoi.

query
Le terme ou l'URL de recherche dont provient cette ligne, repris. Le scraper l'écrit : il figure donc sur la ligne même quand la requête a échoué - regroupez dessus dès qu'un fichier couvre plus d'une recherche.
title
Le titre de la publication, tel que rédigé par la personne qui l'a publiée.
subreddit
La communauté dans laquelle se trouve la publication. Sa propre colonne, afin de pouvoir regrouper une recherche à l'échelle du site selon la provenance des publications.
author
Le nom d'utilisateur Reddit auquel la publication est attribuée. Voyez la note juridique ci-dessous - un nom d'utilisateur est pseudonyme, pas anonyme.
score
Le score de la publication. Le score de Reddit correspond aux votes positifs moins les votes négatifs, et non à un décompte brut de votes positifs : il peut donc être bas sur une publication que beaucoup ont vue.
comments
Combien de commentaires a la publication - un décompte, pas les commentaires. Il n'y a pas de texte de commentaire dans cet export. Lisez la note ci-dessus ; le texte vient d'un service distinct avec son propre schéma.
created
La date de publication, telle que l'export la rapporte.
url
Un lien vers la publication.
status
Ce qui est arrivé à cette requête - à lire en premier. Parce qu'une requête échouée revient tout de même sous forme de ligne étiquetée au lieu de disparaître, vous savez exactement quelle requête n'a pas fonctionné. Une ligne peut arriver avec les neuf champs présents et rester un avis d'échec plutôt qu'une publication.

Les noms sont solides ; tout ce qui va au-delà est l'affaire de votre première exécution. Nous détenons trois exports pour ce service et aucun ne contient de publication. Toutes les colonnes de contenu - title, subreddit, author, score, comments, created, url - étaient vides sur les quatre lignes ; seules query et status portaient quoi que ce soit. Il vaut la peine d'être précis sur ce qui compte ici : les requêtes étaient réelles. Un simple terme de recherche et une URL reddit.com/search/?q=… ont tous deux été soumis, exactement les deux formes que le formulaire demande, et les lignes sont tout de même revenues sans publication. Ces exécutions confirment donc la forme de l'export et ne vous disent absolument rien de son contenu. Ce qu'elles confirment, c'est la liste des colonnes : la ligne d'en-tête est identique dans les trois exports et correspond exactement au jeu déclaré par le service. Tout le reste - à quoi ressemble un score, sous quel format arrive une date, si comments est un nombre ou une chaîne - est délibérément absent plutôt que deviné. Le formulaire avertit par ailleurs que les sites protégés par anti-bot renvoient un statut bloqué sur le pool gratuit, qui est résidentiel uniquement ; c'est l'avertissement propre à la plateforme concernant la chaîne partagée, et il vaut la peine d'être anticipé. Lancez l'offre gratuite sur une recherche et lisez la ligne d'en-tête et les premières valeurs avant de bâtir dessus.

Cas d'usage

Trois tâches pour lesquelles
on l'utilise.

Tous partent de quelque chose que vous taperiez dans le moteur de recherche de Reddit lui-même.

Recherche

Trouver où un sujet est réellement discuté

Cherchez un produit, une entreprise ou un problème à l'échelle du site et gardez subreddit. Ce qui revient est une carte des communautés que cela intéresse - généralement plus utile que n'importe quel fil isolé, et c'est précisément ce qu'une recherche dans le navigateur vous oblige à reconstituer en faisant défiler.

Recherche · Stratégie
Suivi

Relancer la même recherche de façon planifiée

Les mêmes termes lancés chaque semaine vous donnent deux fichiers comparables. Nouvelles publications, mouvement du score et décomptes comments qui montent deviennent un diff plutôt qu'un après-midi de défilement - et query garde chaque ligne rattachée à la recherche dont elle provient.

Marque · Écoute sociale
Tri

Présélectionner les fils qui méritent lecture

Triez par Comment count, prenez le haut du fichier, et vous avez les fils où les gens ont débattu plutôt que ceux où ils étaient d'accord. C'est la liste courte à lire à la main - et la liste d'entrée pour le service de commentaires, si vous voulez ce qui a été dit.

Produit · Support
Tarifs

Payez à la ligne de publication,
et rien d'autre.

Pas d'abonnement, pas de minimum, pas de licence par utilisateur. Vos 500 premières lignes sont offertes - ensuite, c'est du paiement à l'usage.

Gratuit

500 lignes

Sur chaque nouveau compte, une seule fois. Sans carte bancaire. Tous les scrapers débloqués. Étant donné qu'aucune exécution que nous détenons n'a renvoyé de publication, c'est ici la partie qui compte le plus : dépensez quelques lignes à établir ce que cet export contient réellement avant de bâtir des plans dessus.

Une seule fois · Sans carte
Paiement à l'usage

0,002 $ par ligne

Environ 2 $ pour 1 000 publications, le même tarif forfaitaire que pour tout autre scraper de la plateforme. La limite s'applique par requête : dix termes de recherche avec une limite de cent font donc mille lignes - un calcul qui vaut la peine avant de commencer.

Les crédits n'expirent jamais
Entreprise

Sur mesure - des sujets entiers, planifiés

Tarifs au volume, SLA, workers dédiés et intégration sur mesure pour les équipes qui suivent un sujet à travers les communautés plutôt que de lancer une recherche de temps en temps. Donnez-nous vos chiffres et nous établirons un devis.

Parler aux ventes
10 % de remise sur votre première exécution payante.Utilisez le code LIVESCRAPER10 au paiement.
S'inscrire
Se combine bien avec

La même question,
ailleurs.

Reddit est un endroit où les gens parlent. Ceux-ci lisent les autres, chacun avec son propre schéma.

Juridique

Est-il légal de scraper
les résultats de recherche Reddit ?

Réponse courte : ce sont des publications publiques sur une page de recherche publique - mais un nom d'utilisateur est une personne, et les conditions de Reddit régissent l'accès automatisé.

Tout ce qui figure dans ces colonnes est montré à n'importe quel visiteur sur une page publique de résultats de recherche, connecté ou non. Aucune connexion n'est utilisée, aucun paywall franchi et aucun compte touché, et l'exécution passe par notre pool de proxys plutôt que par votre propre adresse. Collecter des informations publiquement visibles à des fins de recherche est une pratique établie de longue date.

La colonne author est une donnée personnelle, et sur Reddit cela compte plus que d'ordinaire. Les noms d'utilisateur sont pseudonymes et non anonymes : beaucoup sont des identités de longue durée auxquelles s'attache un historique de publications de plusieurs années, et les gens disent des choses sous ces noms précisément parce qu'ils n'utilisent pas leur vrai nom. Si vous conservez la colonne, vous traitez des données personnelles, et le RGPD et les régimes équivalents s'appliquent à vous quelle qu'en soit la provenance. Compter la fréquence d'apparition d'un sujet est un cas facile ; constituer le profil de ce qu'un utilisateur nommé a publié ne l'est pas, et ce service n'est pas prévu pour cela.

Les conditions de Reddit restreignent l'accès automatisé et son contenu lui est concédé sous licence par ceux qui l'ont écrit : cela reste donc une question de conditions et non de ce qui est publiquement atteignable ; lisez-les avant de monter en charge. Nous n'exécutons aucun traceur tiers sur la couche de données, et vos exports s'auto-suppriment au bout de 30 jours.

livescraper.app · principes
Uniquement des résultats de recherche publics
Pas de connexion, pas de paywall
Les noms d'utilisateur sont pseudonymes, pas anonymes - traitez-les comme des données personnelles!
Aucun traceur tiers sur la couche de données
Les exports s'auto-suppriment (30 jours)
Les mêmes publications que voit n'importe quel visiteur dans la recherche de Reddit.
FAQ

Ce que l'on demande avant de s'inscrire.

Les questions qui reviennent le plus. Autre chose ? Écrivez-nous - ce sont des humains qui rédigent les réponses, pas des bots.

Que dois-je soumettre ?+
Soit un simple terme de recherche, soit une URL de recherche Reddit de la forme reddit.com/search/?q=…, une par ligne, mélangées librement. Le propre exemple du formulaire montre les deux formes. Vous pouvez téléverser un fichier CSV, XLSX, TXT ou Parquet au lieu de coller.
Quelles colonnes l'export contiendra-t-il ?+
Neuf : query, title, subreddit, author, score, comments, created, url et status. C'est la liste de colonnes que le service déclare lui-même, et elle correspond à la ligne d'en-tête de chaque export que nous détenons.
Est-ce que cela renvoie les commentaires d'une publication ?+
Non. La colonne comments est un décompte du nombre de commentaires d'une publication, pas les commentaires eux-mêmes, et il n'y a de texte de commentaire nulle part dans ces neuf colonnes. Récupérer ce que les gens ont réellement écrit est un service distinct sur la plateforme, avec son propre schéma. Utilisez celui-ci pour trouver les fils, et celui-là pour les lire.
Quelles sont les options de tri ?+
Cinq : Relevance, Hot, Top, New et Comment count. Comment count est celui que l'on trouve rarement ailleurs, et c'est souvent le plus utile - une publication au score modeste avec beaucoup de commentaires est un fil où les gens n'étaient pas d'accord, et c'est généralement là qu'est le détail.
Quel est le format de la colonne created ?+
Nous ne le disons pas, et c'est délibéré. Aucune des exécutions que nous détenons n'a renvoyé de publication, nous n'y avons donc jamais vu de valeur. Deviner serait pire qu'inutile, car une colonne de date est exactement le genre de champ contre lequel on écrit du code d'analyse. Lancez l'offre gratuite sur une recherche et regardez-la d'abord.
L'avez-vous réellement exécuté ?+
Trois fois, et pas une exécution n'a renvoyé de publication - toutes les colonnes de contenu étaient vides sur les quatre lignes. Il vaut la peine d'être précis sur ce qui compte : les requêtes étaient réelles, pas des exemples. Les deux formes que le formulaire demande ont été soumises, un simple terme de recherche et une URL reddit.com/search, et les lignes sont tout de même revenues avec seulement query et status renseignés. Cela vous dit la forme de l'export et absolument rien de son contenu, et nous préférons le dire plutôt que d'enjoliver la page.
Faut-il un proxy ?+
Le formulaire avertit que les sites protégés par anti-bot renvoient un statut bloqué sur le pool gratuit, qui est résidentiel uniquement. C'est l'avertissement propre à la plateforme concernant la chaîne partagée et non une affirmation sur ce site, et il vaut la peine d'être anticipé. Ce que nous pouvons vous dire de notre côté est plus étroit et plus utile : aucun des trois exports que nous détenons n'est revenu avec une publication dedans - lisez donc la colonne status sur votre propre première exécution avant de bâtir quoi que ce soit sur le reste.
Combien cela coûte-t-il ?+
Les 500 premières lignes d'un nouveau compte sont offertes, une seule fois ; ensuite c'est 0,002 $ par ligne - environ 2 $ pour 1 000 - au paiement à l'usage, sans abonnement. Les crédits n'expirent pas et il n'y a pas de remise à zéro mensuelle.

Trouvez les fils d'abord.
Lisez-les ensuite.

Lancez une recherche, triez par nombre de commentaires, et voyez quelles conversations méritent votre après-midi. Vos 500 premières lignes sont gratuites.

Exporter les résultats de recherche Reddit en lignes

Le Scraper de Recherche Reddit transforme une recherche en tableur. Vous soumettez des termes de recherche ou des URL reddit.com/search/?q=… - un par ligne, mélangés librement, ou téléversés en fichier CSV, XLSX, TXT ou Parquet -, fixez une limite et choisissez un tri, et chaque publication revient sous forme de ligne : le titre, le subreddit où elle a été publiée, l'auteur, son score, combien de commentaires elle a, quand elle a été faite, et un lien. Neuf colonnes, une ligne par publication, téléchargeables en CSV, Excel ou JSON. La description du service le dit simplement : il renvoie des résultats de recherche.

La colonne le plus souvent mal lue est comments, qui est un décompte et non les commentaires eux-mêmes. Rien dans ces neuf colonnes n'est du texte de commentaire, et aucun tri ne le fera apparaître - récupérer ce que les gens ont écrit est un service distinct avec son propre schéma. Le mot fait double emploi dans l'interface, puisque choisir le tri Comment count envoie la valeur comments, mais le tri comme la colonne portent sur le combien, pas sur le quoi. La bonne façon de le retenir : ce service est un index de fils et l'autre est ce qu'il y a dedans.

Ce décompte mérite qu'on trie dessus. Cinq ordres sont proposés - Relevance, Hot, Top, New et Comment count - et le dernier est celui qui apparaît rarement ailleurs. Une publication au score élevé est une publication avec laquelle les gens étaient d'accord ; une publication avec beaucoup de commentaires est une publication dont on a débattu, et pour la recherche produit, les plaintes et les comparaisons, le détail est généralement dans le débat. Que subreddit arrive dans sa propre colonne est l'autre chose qui rend une recherche à l'échelle du site intéressante : une requête renvoie des publications d'où qu'elles aient été écrites, et vous regroupez par communauté ensuite plutôt que de chercher dans chacune séparément. La limite s'applique par requête : plusieurs termes se multiplient donc.

Une limite est énoncée sans détour parce qu'elle change ce qu'il faut attendre de cette page. Nous détenons trois exports et aucun ne contient de publication : toutes les colonnes de contenu étaient vides sur les quatre lignes. Cela mérite de la précision, car les exécutions n'ont pas été mal lancées - de vraies requêtes ont été soumises, dans les deux formes que le formulaire accepte, et les lignes sont tout de même revenues avec seulement query et status renseignés. Les neuf noms ci-dessus sont donc fiables et tout ce qui va au-delà est délibérément absent plutôt qu'inventé. Le formulaire avertit par ailleurs que les sites protégés par anti-bot renvoient un statut bloqué sur le pool gratuit, qui est résidentiel uniquement ; c'est l'avertissement propre à la plateforme concernant la chaîne partagée et il vaut la peine d'être anticipé. Côté droit, tout ce qui est collecté est public, mais author est un nom d'utilisateur pseudonyme auquel s'attache l'historique de publications d'une personne réelle - traitez-le comme une donnée personnelle, et lisez les conditions de Reddit avant de monter en charge. Commencez gratuitement : vos 500 premières lignes ne coûtent rien et ne demandent pas de carte, puis c'est 0,002 $ par ligne, au forfait. Consultez les tarifs pour les prix en vigueur.