Extracteur de commentaires Reddit

Visez un post,
gardez le fil entier.

Collez l'URL d'un post Reddit et ses commentaires reviennent sous forme de tableau : qui a écrit chacun d'eux, le texte du commentaire lui-même, son score, sa date de publication, un lien direct vers lui et une colonne de statut. Sept colonnes, une ligne par commentaire, dans l'un des six tris de votre choix.

500 lignes offertes, une fois0,002 $ par ligne ensuite7 colonnesCSV · XLSX · JSON
Comment ça marche

Une URL de post en entrée,
un fil en sortie.

Vous choisissez les posts et l'ordre. La tâche lit les commentaires de chacun et écrit une ligne pour chaque commentaire renvoyé.

  1. ÉTAPE 1Connectez-vous à la plateforme.
  2. ÉTAPE 2Ouvrez le Reddit Comments Scraper.
  3. ÉTAPE 3Collez des URL de posts Reddit, une par ligne - ou téléversez un fichier CSV, XLSX, TXT ou Parquet.
  4. ÉTAPE 4Choisissez un tri : Best, Top, New, Controversial, Old ou Q&A.
  5. ÉTAPE 5Fixez une limite par requête, ou laissez-la vide pour tout prendre.
  6. ÉTAPE 6Choisissez votre format de sortie et cliquez sur Get Data.

Une ligne par commentaire, chacune étiquetée avec l'URL du post dont elle provient - ce qui compte particulièrement ici, car c'est la seule colonne qui rattache un commentaire à son fil.

Pourquoi les équipes l'utilisent

Le texte des commentaires,
pas leur nombre.

Ce que les gens ont réellement écrit

C'est le service qui renvoie le corps des commentaires. Son pendant, le Reddit Search Scraper, possède une colonne nommée comments - mais il s'agit du nombre de commentaires d'un post, un chiffre. Si vous voulez les phrases plutôt que le décompte, c'est celui-ci qu'il vous faut, et les deux sont conçus pour être enchaînés.

Six tris, dont ceux qui comptent

Best, Top, New, Controversial, Old et Q&A. L'ordre n'est pas cosmétique dès lors que vous plafonnez les lignes par requête : une limite plus Top vous donne les commentaires que le fil a approuvés, et la même limite plus Controversial vous donne la dispute. Choisissez le tri en pensant à la limite, pas après l'avoir posée.

Chaque ligne pointe vers elle-même

Chaque commentaire porte son propre lien permanent, et pas seulement celui du post. C'est ce qui rend un export vérifiable des mois plus tard - une citation dans un rapport peut être remontée jusqu'au commentaire exact dont elle provient, et un relecteur peut l'ouvrir sans parcourir le fil à la main.

Ce que vous récupérez

Sept colonnes,
une ligne par commentaire.

Chaque ligne est un commentaire : qui l'a écrit, ce qu'il dit, comment il a été noté, quand il est apparu, où le trouver et comment la récupération s'est passée.

Deux choses méritent d'être connues avant de bâtir autour de cet export, et toutes deux découlent de la forme du schéma plutôt que d'une exécution. La première : il est plat. Il n'y a ni identifiant parent, ni identifiant de commentaire, ni colonne de profondeur ; vous obtenez donc une liste de commentaires et non une arborescence de réponses - query est la seule chose qui rattache une ligne à son fil, raison pour laquelle il vaut la peine de la conserver. La seconde : status est une vraie colonne et non un ornement. La liste de colonnes ci-dessous est le tableau publié par la plateforme, vérifié par rapport à l'en-tête des exécutions archivées ; lisez la note en dessous avant d'écrire un parseur, car elle est franche sur ce que cette page vous dira et ne vous dira pas.

Dictionnaire de données

Sept colonnes,
dans l'ordre de l'export.

La ligne d'en-tête de l'export, dans l'ordre, recoupée avec la liste de colonnes publiée par la plateforme. Les descriptions disent à quoi sert chaque champ ; elles n'affirment rien sur son format ni sur la fréquence à laquelle il arrive rempli - voir la note en dessous.

query
L'URL du post Reddit que vous avez soumise, répétée sur chaque ligne qui en provient. Écrite par le scraper plutôt que reprise de la page, elle est donc sur toutes les lignes - et elle pèse ici plus que d'ordinaire, car rien d'autre n'indique à quel fil appartient un commentaire.
author
Le compte Reddit qui a écrit le commentaire. Un nom d'utilisateur plutôt qu'un nom réel, mais une personne tout de même - voir la note sur les données personnelles plus bas sur cette page.
body
Le texte du commentaire. C'est la colonne qui distingue ce service de celui de recherche, dont le champ comments est un décompte et non l'écrit lui-même.
score
Le score du commentaire tel que Reddit l'affiche - le solde des votes reçus.
created
La date de publication du commentaire. Cette page ne vous en donne pas le format, car aucune exécution dont nous disposons n'en a renvoyé un ; regardez les premières lignes de votre propre exécution avant de l'analyser.
permalink
Un lien vers le commentaire lui-même, et non vers le post. La colonne à conserver si vous devez un jour vérifier une citation à la main ou la sourcer dans un rapport.
status
Comment la récupération s'est passée pour cette ligne. C'est une colonne de travail, pas un ornement : lorsqu'une ligne revient sans contenu, la raison est là. Lisez-la avant de conclure qu'un post n'avait tout simplement pas de commentaires.

Lisez ce dictionnaire comme une liste de noms, pas comme une promesse sur les contenus. Les sept noms et leur ordre sont solides - la liste de colonnes publiée par la plateforme et l'en-tête des exécutions archivées coïncident exactement. Ce qui n'est pas établi, c'est ce qui y arrive, car il n'existe aucun export Reddit Comments rempli sur lequel fonder une affirmation : les exécutions dont nous disposons sont revenues avec query et status seuls remplis, et elles visaient une URL fictive plutôt qu'un vrai post - elles renseignent donc sur le schéma et absolument pas sur Reddit, dans un sens comme dans l'autre. C'est pourquoi vous ne trouverez sur cette page aucune valeur d'exemple, aucun format de date et aucun taux de remplissage. Deux faits structurels tiennent malgré tout, parce qu'ils sont des propriétés de la liste de colonnes elle-même : l'export est plat - pas d'identifiant parent, pas d'identifiant de commentaire, pas de profondeur pour reconstruire une arborescence - prévoyez donc une liste et non une hiérarchie ; et status mérite d'entrer dans votre chaîne de traitement dès le départ. Le formulaire de la plateforme prévient lui-même que les sites protégés renvoient un statut blocked sur le pool gratuit, qui est résidentiel uniquement - c'est sa mise en garde générale sur la chaîne partagée, et elle mérite d'être anticipée quel que soit votre objectif. Lancez un post sur l'offre gratuite et regardez les premières lignes avant de construire.

Réglages d'exécution

Réglé sur la tâche,
pas dans le tableur.

Une liste d'URL de posts, un tri et une limite. Le tri et la limite fonctionnent ensemble : ils décident quelle partie d'un fil vous gardez, et ce que coûte une exécution.

URL de post Reddit Une par ligne Tri : Best Tri : Top Tri : New Tri : Controversial Tri : Old Tri : Q&A Limite par requête Vide pour tout Téléversement CSV · XLSX · TXT · Parquet Pool de proxys partagé, jamais votre IP
Cas d'usage courants

Trois tâches qui tournent
ici plus que les autres.

Quelques exemples de la façon dont les équipes utilisent les données de commentaires pour répondre à une question qu'elles se posent vraiment.

Recherche

Lisez ce que le fil a vraiment dit

Le score d'un post vous dit que la réaction a été forte ; il ne vous dit pas laquelle. Récupérez les textes et vous avez l'argument sous les yeux plutôt qu'un chiffre qui en tient lieu - et avec un lien permanent sur chaque ligne, tout ce que vous citez peut être vérifié.

Recherche · Insights
Produit

Trouvez la plainte sous les votes positifs

Triez par Controversial plutôt que par Top et plafonnez les lignes : vous obtenez la partie du fil qui n'était pas d'accord avec elle-même. C'est généralement là que se trouve le besoin non satisfait - l'objection dont on discute encore plutôt que l'avis que tout le monde partageait déjà.

Produit · Support
Chaîne

Enchaînez-le après une recherche

Lancez le Reddit Search Scraper pour trouver les posts, gardez sa colonne url et injectez cette liste ici directement comme requêtes. La recherche vous donne quels fils comptent ; ceci vous donne ce qui s'y est dit. Les deux schémas sont distincts à dessein et se joignent sur le lien du post.

Données · Ops
Tarifs

Ne payez que les lignes
que vous extrayez réellement.

Pas d'abonnement, pas de minimum, pas de facture récurrente. Vos 500 premières lignes sont offertes - ensuite, paiement à l'usage au même tarif forfaitaire que tous les autres scrapers ici.

Offre gratuite

500 lignes gratuites - 0 $

Sur chaque nouveau compte, une seule fois. Aucune carte bancaire requise. Limites par requête, téléversement de fichiers et tous les formats d'export inclus.

0 $ pour toujours
Paiement à l'usage

0,002 $ par ligne, après l'offre gratuite

Environ 2 $ pour 1 000 commentaires. L'estimateur pré-exécution affiche le nombre de lignes et le coût en crédits avant le démarrage - pas de facture surprise, pas d'unités de calcul à convertir.

Le plus choisi
Volume

Sur mesure · gros volumes

Tarifs au volume, workers dédiés et SLA pour une surveillance continue ou de très grosses extractions de fils. Donnez-nous vos chiffres et nous établirons un devis.

Parlons-en
10 % de remise sur votre première exécution payante.Utilisez le code LIVESCRAPER10 au paiement.
S'inscrire
Se combine bien avec

Le post d'où il vient,
et le même travail ailleurs.

Le point juridique

Est-il légal de scraper
les commentaires Reddit ?

Réponse courte : les commentaires sont publics - mais cet export contient des données personnelles, et mieux vaut le dire franchement.

Les commentaires collectés ici sont ceux qu'un post montre à quiconque l'ouvre, connecté ou non. Rien ici ne touche à une connexion, à un subreddit privé, à un message direct ou à un compte qui ne vous appartient pas. Collecter des discussions publiées publiquement est une pratique établie de longue date, et le lien permanent présent sur chaque ligne signifie que tout ce que vous en tirez peut être remonté jusqu'à sa source.

Contrairement à un catalogue de produits, cet export contient des données personnelles et nous préférons le dire plutôt que de laisser croire l'inverse. author est un compte Reddit, et body est quelque chose qu'une personne a écrit - pseudonyme, pas anonyme. Les noms d'utilisateur sont couramment rattachables à des individus, et le texte d'un commentaire peut en révéler beaucoup sur celui qui l'a écrit. Traitez ces deux colonnes selon les règles de protection des données qui s'appliquent à vous, ne conservez que le nécessaire, et réfléchissez bien avant de republier un commentaire à côté du nom de son auteur.

Les conditions d'utilisation de Reddit restreignent l'accès automatisé et sa licence de contenu a changé plus d'une fois : c'est donc autant une question de conditions qu'une question juridique - vérifiez-les, en particulier pour tout usage commercial ou de rediffusion. Nous n'exécutons aucun traceur tiers sur la couche de données, et vos exports sont supprimés automatiquement au bout de 30 jours.

livescraper.app · principes
Commentaires publics uniquement
Aucune connexion, aucun subreddit privé
Les noms d'utilisateur sont des données personnelles
Chaque ligne garde son lien permanent
Exports supprimés automatiquement (30 jours)
Vérifiez les conditions de Reddit avant de passer à l'échelle.
Questions fréquentes

Ce que l'on demande
avant de s'inscrire.

Les questions que nous entendons le plus. Autre chose ? Parlons-en - ce sont des humains, pas des bots, qui rédigent les réponses.

Comment scraper les commentaires Reddit ?+
Avec le Reddit Comments Scraper :
  1. Connectez-vous à la plateforme.
  2. Ouvrez le Reddit Comments Scraper.
  3. Collez des URL de posts Reddit, une par ligne - ou téléversez un fichier CSV, XLSX, TXT ou Parquet.
  4. Choisissez un tri : Best, Top, New, Controversial, Old ou Q&A.
  5. Fixez une limite par requête, ou laissez-la vide pour tout prendre.
  6. Choisissez votre format de sortie et cliquez sur Get Data.
Quelle est la différence avec le Reddit Search Scraper ?+
La recherche trouve des posts ; celui-ci lit les commentaires d'un post. Le service de recherche possède une colonne nommée comments, mais c'est le nombre de commentaires d'un post - un chiffre, pas l'écrit. Ce service renvoie le corps des commentaires lui-même. Lancer la recherche d'abord puis injecter ses liens de posts ici est l'association prévue.
Est-ce que j'obtiens la structure des réponses ?+
Non. Le schéma est plat - sept colonnes sans identifiant parent, sans identifiant de commentaire et sans profondeur - vous obtenez donc une liste de commentaires et non une arborescence de réponses. La colonne query, qui contient l'URL du post que vous avez soumise, est la seule chose qui rattache une ligne à son fil, raison pour laquelle il vaut la peine de la conserver dans votre sortie.
Puis-je choisir quels commentaires j'obtiens ?+
Oui, par le tri, et cela compte davantage qu'il n'y paraît lorsque vous plafonnez aussi les lignes. Il y en a six : Best, Top, New, Controversial, Old et Q&A. Une limite plus Top garde ce que le fil a approuvé ; la même limite plus Controversial garde ce dont il a débattu.
Qu'obtient-on pour chaque commentaire ?+
Sept colonnes : l'URL du post que vous avez soumise, l'auteur, le corps du commentaire, son score, sa date de création, un lien permanent vers ce commentaire précis, et une colonne de statut.
À quoi sert la colonne status ?+
Elle enregistre comment la récupération s'est passée pour cette ligne, et elle mérite d'être lue plutôt qu'ignorée. Lorsqu'une ligne revient sans contenu, la raison s'y trouve. Le formulaire de la plateforme prévient également que les sites protégés renvoient un statut blocked sur le pool gratuit, qui est résidentiel uniquement - c'est sa mise en garde générale sur la chaîne partagée, et elle mérite d'être anticipée.
Pourquoi cette page ne montre-t-elle aucune valeur d'exemple ?+
Parce que nous n'en avons vu aucune et que nous préférons le dire plutôt que d'en inventer. Il n'existe ici aucun export Reddit Comments rempli : les exécutions dont nous disposons sont revenues avec les seules colonnes query et status remplies, et elles visaient une URL fictive plutôt qu'un vrai post - elles établissent donc le schéma et rien sur Reddit, dans un sens comme dans l'autre. Les noms de colonnes et leur ordre sont solides ; les formats ne sont pas à nous de les promettre. Lancez un post sur l'offre gratuite et regardez.
Comment prendre un fil entier ?+
Laissez le champ de limite vide. Il est prérempli à 100 et son minimum est un : le vider - et non saisir zéro - est ce qui prend tout ce qu'un post renvoie. Gardez à l'esprit qu'un fil animé peut être volumineux, et l'estimateur vous indiquera le nombre de lignes avant le démarrage.
Combien ça coûte ?+
Les 500 premières lignes sont gratuites et accordées une seule fois, sans carte bancaire. Ensuite, c'est 0,002 $ par ligne - environ 2 $ pour 1 000 commentaires - soit le même tarif forfaitaire que pour tous les autres scrapers de la plateforme. L'estimateur affiche le coût d'une exécution avant qu'elle ne démarre.

Vos 500 premières lignes,
offertes.

500 lignes gratuites une seule fois sur chaque nouveau compte - sans expiration. Ensuite c'est 0,002 $ par ligne, à l'usage - aucune carte enregistrée tant que vous ne le décidez pas.

Activation immédiate · sans carte bancaire

Scraper à grande échelle les commentaires de n'importe quel post Reddit

Le Reddit Comments Scraper de Livescraper transforme des URL de posts en tableau de commentaires. Vous collez les liens un par ligne - ou les téléversez en CSV, XLSX, TXT ou Parquet -, choisissez l'un des six tris, plafonnez les lignes par requête ou laissez le champ vide pour tout prendre, et téléchargez les résultats en fichier CSV, Excel ou JSON propre. Les requêtes sortent par le pool de proxys partagé plutôt que par votre propre adresse.

Chaque ligne est un commentaire : l'URL du post que vous avez soumise, le compte qui l'a écrit, le texte du commentaire, son score, sa date de création, un lien permanent vers ce commentaire précis et une colonne de statut consignant le déroulement de la récupération. Le tri est le réglage auquel il vaut la peine de réfléchir, car il décide quelle partie d'un fil une exécution plafonnée conserve - Top et Controversial répondent à des questions réellement différentes sur le même post.

Deux choses méritent d'être connues avant de construire dessus. Le schéma est plat : il n'y a ni identifiant parent, ni identifiant de commentaire, ni colonne de profondeur, l'export est donc une liste de commentaires et non une arborescence de réponses, et la colonne query est le seul lien vers le fil. Et cette page nomme les sept colonnes et leur ordre sans revendiquer le moindre format de valeur ni taux de remplissage, car il n'existe aucun export Reddit Comments rempli sur lequel le fonder - les exécutions dont nous disposons n'ont renvoyé que les colonnes query et status et visaient une URL fictive, elles établissent donc le schéma et rien sur Reddit, dans un sens comme dans l'autre.

Il vaut également la peine d'intégrer la colonne de statut à votre chaîne de traitement dès le départ : le formulaire de la plateforme prévient lui-même que les sites protégés renvoient un statut blocked sur le pool gratuit, qui est résidentiel uniquement. Lancez un post sur l'offre gratuite et lisez les premières lignes avant d'écrire un parseur. Vos 500 premières lignes ne coûtent rien et ne demandent pas de carte bancaire, et ensuite c'est 0,002 $ par ligne, au forfait.