Reddit Kommentar-Scraper

Auf einen Post zeigen,
den ganzen Thread behalten.

Fügen Sie die URL eines Reddit-Posts ein, und seine Kommentare kommen als Tabelle zurück: wer sie geschrieben hat, der Kommentartext selbst, sein Score, wann er gepostet wurde, ein Link direkt dorthin und eine Status-Spalte. Sieben Spalten, eine Zeile je Kommentar, in einer von sechs Sortierungen Ihrer Wahl.

einmalig 500 Zeilen gratisdanach 0,002 $ pro Zeile7 SpaltenCSV · XLSX · JSON
So funktioniert es

Eine Post-URL hinein,
ein Thread heraus.

Sie wählen die Posts und die Reihenfolge. Der Job liest die Kommentare zu jedem davon und schreibt für jeden zurückgegebenen Kommentar eine Zeile.

  1. SCHRITT 1Melden Sie sich auf der Plattform an.
  2. SCHRITT 2Öffnen Sie den Reddit Comments Scraper.
  3. SCHRITT 3Fügen Sie Reddit-Post-URLs ein, eine pro Zeile - oder laden Sie eine CSV-, XLSX-, TXT- oder Parquet-Datei hoch.
  4. SCHRITT 4Wählen Sie eine Sortierung: Best, Top, New, Controversial, Old oder Q&A.
  5. SCHRITT 5Setzen Sie ein Limit je Anfrage oder lassen Sie es leer, um alles zu nehmen.
  6. SCHRITT 6Wählen Sie Ihr Ausgabeformat und klicken Sie auf Get Data.

Eine Zeile je Kommentar, jeweils mit der Post-URL versehen, aus der sie stammt - was hier besonders zählt, denn es ist die einzige Spalte, die einen Kommentar wieder seinem Thread zuordnet.

Warum Teams es nutzen

Der Kommentartext selbst,
nicht ihre Anzahl.

Was die Leute tatsächlich geschrieben haben

Dies ist der Dienst, der Kommentartexte zurückgibt. Sein Gegenstück, der Reddit Search Scraper, hat eine Spalte namens comments - aber das ist die Anzahl der Kommentare eines Posts, eine Zahl. Wenn Sie die Sätze statt der Zählung wollen, ist dies der richtige, und beide sind dafür gemacht, nacheinander zu laufen.

Sechs Sortierungen, darunter die entscheidenden

Best, Top, New, Controversial, Old und Q&A. Die Reihenfolge ist nicht kosmetisch, wenn Sie die Zeilen je Anfrage begrenzen: ein Limit plus Top liefert die Kommentare, denen der Thread zugestimmt hat, und dasselbe Limit plus Controversial liefert den Streit. Wählen Sie die Sortierung mit Blick auf das Limit, nicht danach.

Jede Zeile verlinkt auf sich selbst

Jeder Kommentar trägt seinen eigenen Permalink, nicht nur den des Posts. Genau das macht einen Export noch Monate später prüfbar - ein Zitat in einem Bericht lässt sich auf genau den Kommentar zurückführen, aus dem es stammt, und wer es prüft, kann ihn öffnen, ohne den Thread von Hand zu durchsuchen.

Was Sie zurückbekommen

Sieben Spalten,
eine Zeile je Kommentar.

Jede Zeile ist ein Kommentar: wer ihn geschrieben hat, was darin steht, wie er bewertet wurde, wann er erschien, wo er zu finden ist und wie der Abruf verlief.

Zwei Dinge sollten Sie wissen, bevor Sie um diesen Export herum planen, und beide ergeben sich aus der Form des Schemas und nicht aus irgendeinem Lauf. Erstens ist er flach: Es gibt keine Eltern-ID, keine Kommentar-ID und keine Tiefen-Spalte, Sie erhalten also eine Liste von Kommentaren und keinen Antwortbaum - query ist das Einzige, was eine Zeile wieder ihrem Thread zuordnet, und genau deshalb lohnt es sich, sie zu behalten. Zweitens ist status eine echte Spalte und keine Zierde. Die Spaltenliste unten ist das von der Plattform veröffentlichte Array, abgeglichen mit der Kopfzeile der archivierten Läufe; lesen Sie die Anmerkung darunter, bevor Sie einen Parser schreiben, denn sie sagt offen, was diese Seite Ihnen sagt und was nicht.

Datenwörterbuch

Sieben Spalten,
in Exportreihenfolge.

Die Kopfzeile des Exports, in ihrer Reihenfolge, abgeglichen mit der von der Plattform veröffentlichten Spaltenliste. Die Beschreibungen sagen, wofür jedes Feld da ist; sie behaupten nichts über sein Format oder darüber, wie oft es gefüllt ankommt - siehe die Anmerkung darunter.

query
Die Reddit-Post-URL, die Sie eingereicht haben, wiederholt in jeder Zeile, die daraus stammt. Vom Scraper geschrieben statt der Seite entnommen, also in jeder Zeile vorhanden - und in diesem Export wiegt sie schwerer als sonst, denn nichts anderes gibt an, zu welchem Thread ein Kommentar gehört.
author
Das Reddit-Konto, das den Kommentar geschrieben hat. Ein Benutzername, kein Klarname, aber dennoch eine Person - siehe die Anmerkung zu personenbezogenen Daten weiter unten auf dieser Seite.
body
Der Kommentartext. Das ist die Spalte, die diesen Dienst vom Suchdienst unterscheidet, dessen Feld comments eine Zählung statt des Geschriebenen ist.
score
Der Score des Kommentars, wie Reddit ihn anzeigt - die Bilanz der abgegebenen Stimmen.
created
Wann der Kommentar gepostet wurde. Diese Seite nennt Ihnen das Format nicht, denn kein Lauf, der uns vorliegt, hat eines zurückgegeben; prüfen Sie die ersten Zeilen Ihres eigenen Laufs, bevor Sie es parsen.
permalink
Ein Link auf den einzelnen Kommentar, nicht auf den Post. Die Spalte, die Sie behalten sollten, falls Sie je ein Zitat von Hand prüfen oder in einem Bericht belegen müssen.
status
Wie der Abruf für diese Zeile verlief. Eine Arbeitsspalte, keine Zierde: Wenn eine Zeile ohne Inhalt zurückkommt, steht hier der Grund. Lesen Sie sie, bevor Sie schließen, dass ein Post schlicht keine Kommentare hatte.

Lesen Sie dieses Verzeichnis als Liste von Namen, nicht als Zusage über Inhalte. Die sieben Namen und ihre Reihenfolge stehen fest - die veröffentlichte Spaltenliste der Plattform und die Kopfzeile der archivierten Läufe stimmen exakt überein. Nicht geklärt ist, was darin ankommt, denn es existiert kein befüllter Reddit-Comments-Export, auf den sich eine Aussage stützen ließe: Die Läufe, die uns vorliegen, kamen mit nur query und status gefüllt zurück, und sie zielten auf eine Platzhalter-URL statt auf einen echten Post - sie sagen also etwas über das Schema und überhaupt nichts über Reddit, in keine Richtung. Deshalb finden Sie auf dieser Seite keinen Beispielwert, kein Datumsformat und keine Füllquote. Zwei strukturelle Tatsachen gelten dennoch, weil sie Eigenschaften der Spaltenliste selbst sind: der Export ist flach - ohne Eltern-ID, Kommentar-ID oder Tiefe, aus der sich ein Antwortbaum rekonstruieren ließe, planen Sie also mit einer Liste statt einer Hierarchie; und status gehört von Anfang an in Ihre Pipeline. Das Formular der Plattform warnt selbst, dass Anti-Bot-Seiten im kostenlosen Pool, der nur residenziell ist, einen blocked-Status zurückgeben - das ist ihr allgemeiner Hinweis zur gemeinsamen Pipeline, und er ist es wert, eingeplant zu werden, worauf Sie auch zielen. Lassen Sie einen Post im kostenlosen Kontingent laufen und sehen Sie sich die ersten Zeilen an, bevor Sie darauf aufbauen.

Lauf-Einstellungen

Am Job eingestellt,
nicht in der Tabelle.

Eine Liste von Post-URLs, eine Sortierung und ein Limit. Sortierung und Limit wirken zusammen - sie entscheiden, welchen Teil eines Threads Sie behalten und was ein Lauf kostet.

Reddit-Post-URL Eine pro Zeile Sortierung: Best Sortierung: Top Sortierung: New Sortierung: Controversial Sortierung: Old Sortierung: Q&A Limit je Anfrage Leer für alles CSV · XLSX · TXT · Parquet-Upload Gemeinsamer Proxy-Pool, nie Ihre IP
Gängige Arbeitsabläufe

Drei Aufgaben, die hier
am häufigsten laufen.

Ein paar Beispiele dafür, wie Teams Kommentardaten nutzen, um eine Frage zu beantworten, die sie tatsächlich haben.

Recherche

Lesen Sie, was ein Thread wirklich gesagt hat

Der Score eines Posts sagt Ihnen, dass die Reaktion heftig war; er sagt Ihnen nicht, worin sie bestand. Holen Sie die Texte, und Sie haben das Argument vor sich statt einer Zahl, die dafür einspringt - und mit einem Permalink in jeder Zeile lässt sich alles, was Sie zitieren, überprüfen.

Recherche · Insights
Produkt

Finden Sie die Beschwerde unter den Upvotes

Sortieren Sie nach Controversial statt nach Top und begrenzen Sie die Zeilen, dann erhalten Sie den Teil des Threads, der mit sich selbst uneins war. Genau dort liegt meist der unerfüllte Bedarf - der Einwand, über den noch gestritten wird, statt der Meinung, der ohnehin schon alle zustimmten.

Produkt · Support
Pipeline

Hängen Sie ihn hinter eine Suche

Lassen Sie den Reddit Search Scraper laufen, um die Posts zu finden, behalten Sie dessen Spalte url und geben Sie diese Liste hier direkt als Ihre Anfragen ein. Die Suche liefert, welche Threads zählen; dieser Dienst liefert, was darin gesagt wurde. Die beiden Schemata sind absichtlich getrennt und werden über den Post-Link verknüpft.

Daten · Ops
Preise

Zahlen Sie nur für die Zeilen,
die Sie tatsächlich abrufen.

Kein Abonnement, kein Mindestumsatz, keine wiederkehrende Rechnung. Ihre ersten 500 Zeilen gehen auf uns - danach zahlen Sie nach Verbrauch, zum selben Pauschalpreis wie bei jedem anderen Scraper hier.

Kostenlose Stufe

500 kostenlose Zeilen - 0 $

Für jedes neue Konto, einmalig. Keine Kreditkarte erforderlich. Limits je Abfrage, Datei-Upload und jedes Exportformat inbegriffen.

0 $ für immer
Nach Verbrauch

0,002 $ je Zeile, nach der kostenlosen Stufe

Rund 2 $ je 1.000 Kommentare. Der Vorab-Schätzer zeigt Zeilenzahl und Guthabenkosten, bevor ein Lauf startet - keine Überraschungsrechnungen, keine Recheneinheiten zum Umrechnen.

Am beliebtesten
Volumen

Individuell · hohes Volumen

Mengenpreise, dedizierte Worker und ein SLA für laufende Überwachung oder sehr große Thread-Abrufe. Nennen Sie uns Ihre Zahlen, und wir erstellen ein Angebot.

Sprechen Sie uns an
10 % Rabatt auf Ihren ersten kostenpflichtigen Lauf.Verwenden Sie den Code LIVESCRAPER10 an der Kasse.
Registrieren
Passt gut zu

Der Post, aus dem er stammt,
und die gleiche Aufgabe anderswo.

Das Rechtliche

Ist es legal,
Reddit-Kommentare zu scrapen?

Kurze Antwort: Die Kommentare sind öffentlich - aber dieser Export enthält personenbezogene Daten, und das sollte man offen sagen.

Die hier erhobenen Kommentare sind jene, die ein Post jedem zeigt, der ihn öffnet, angemeldet oder nicht. Nichts davon berührt ein Login, ein privates Subreddit, eine Direktnachricht oder ein Konto, das Ihnen nicht gehört. Öffentlich veröffentlichte Diskussionen zu erheben ist seit Langem etablierte Praxis, und der Permalink in jeder Zeile bedeutet, dass sich alles, was Sie mitnehmen, auf seine Quelle zurückführen lässt.

Anders als ein Produktkatalog enthält dieser Export personenbezogene Daten, und wir sagen das lieber, als etwas anderes anzudeuten. author ist ein Reddit-Konto, und body ist etwas, das ein Mensch geschrieben hat - pseudonym, nicht anonym. Benutzernamen lassen sich regelmäßig Personen zuordnen, und Kommentartexte können viel über die schreibende Person verraten. Behandeln Sie beide Spalten nach den Datenschutzregeln, die für Sie gelten, behalten Sie nur, was Sie brauchen, und überlegen Sie gut, bevor Sie einen Kommentar neben dem Namen seines Autors erneut veröffentlichen.

Reddits eigene Nutzungsbedingungen beschränken automatisierten Zugriff, und die Lizenzierung der Inhalte hat sich mehr als einmal geändert - das ist also ebenso eine Frage der Bedingungen wie eine rechtliche. Prüfen Sie sie, besonders für alles Kommerzielle oder Weiterverbreitende. Wir betreiben keine Tracker von Dritten auf der Datenebene, und Ihre Exporte löschen sich nach 30 Tagen automatisch.

livescraper.app · Grundsätze
Nur öffentliche Kommentare
Keine Logins, keine privaten Subreddits
Benutzernamen sind personenbezogene Daten
Jede Zeile behält ihren Permalink
Exporte löschen sich automatisch (30 Tage)
Prüfen Sie Reddits eigene Bedingungen, bevor Sie skalieren.
Häufige Fragen

Was Menschen fragen,
bevor sie sich anmelden.

Die Fragen, die wir am häufigsten hören. Noch etwas? Sprechen Sie uns an - die Antworten schreiben Menschen, keine Bots.

Wie scrape ich Reddit-Kommentare?+
Mit dem Reddit Comments Scraper:
  1. Melden Sie sich auf der Plattform an.
  2. Öffnen Sie den Reddit Comments Scraper.
  3. Fügen Sie Reddit-Post-URLs ein, eine pro Zeile - oder laden Sie eine CSV-, XLSX-, TXT- oder Parquet-Datei hoch.
  4. Wählen Sie eine Sortierung: Best, Top, New, Controversial, Old oder Q&A.
  5. Setzen Sie ein Limit je Anfrage oder lassen Sie es leer, um alles zu nehmen.
  6. Wählen Sie Ihr Ausgabeformat und klicken Sie auf Get Data.
Was ist der Unterschied zwischen diesem und dem Reddit Search Scraper?+
Die Suche findet Posts; dieser Dienst liest die Kommentare eines Posts. Der Suchdienst hat eine Spalte namens comments, aber das ist die Anzahl der Kommentare eines Posts - eine Zahl, nicht das Geschriebene. Dieser Dienst gibt die Kommentartexte selbst zurück. Zuerst die Suche laufen zu lassen und deren Post-Links hier einzuspeisen ist die vorgesehene Kombination.
Bekomme ich die Antwortstruktur?+
Nein. Das Schema ist flach - sieben Spalten ohne Eltern-ID, ohne Kommentar-ID und ohne Tiefe -, Sie erhalten also eine Liste von Kommentaren statt eines Antwortbaums. Die Spalte query, die die von Ihnen eingereichte Post-URL enthält, ist das Einzige, was eine Zeile wieder ihrem Thread zuordnet, und genau deshalb lohnt es sich, sie in Ihrer Ausgabe zu behalten.
Kann ich auswählen, welche Kommentare ich bekomme?+
Ja, über die Sortierung, und sie zählt mehr, als es aussieht, wenn Sie zugleich die Zeilen begrenzen. Es gibt sechs: Best, Top, New, Controversial, Old und Q&A. Ein Limit plus Top behält, dem der Thread zugestimmt hat; dasselbe Limit plus Controversial behält, worüber er gestritten hat.
Was kommt für jeden Kommentar zurück?+
Sieben Spalten: die von Ihnen eingereichte Post-URL, der Autor, der Kommentartext, sein Score, wann er erstellt wurde, ein Permalink auf genau diesen Kommentar und eine Status-Spalte.
Wofür ist die status-Spalte da?+
Sie hält fest, wie der Abruf für diese Zeile verlief, und es lohnt sich, sie zu lesen statt zu ignorieren. Wenn eine Zeile ohne Inhalt zurückkommt, steht der Grund dort. Das Formular der Plattform warnt zudem, dass Anti-Bot-Seiten im kostenlosen Pool, der nur residenziell ist, einen blocked-Status zurückgeben - das ist ihr allgemeiner Hinweis zur gemeinsamen Pipeline, und er ist es wert, eingeplant zu werden.
Warum zeigt diese Seite keine Beispielwerte?+
Weil wir keine gesehen haben und das lieber sagen, als welche zu erfinden. Es existiert hier kein befüllter Reddit-Comments-Export: Die Läufe, die uns vorliegen, kamen mit nur den Spalten query und status gefüllt zurück, und sie zielten auf eine Platzhalter-URL statt auf einen echten Post - sie belegen also das Schema und nichts über Reddit, in keine Richtung. Die Spaltennamen und ihre Reihenfolge stehen fest; die Formate zuzusagen steht uns nicht zu. Lassen Sie einen Post im kostenlosen Kontingent laufen und sehen Sie nach.
Wie nehme ich einen ganzen Thread?+
Lassen Sie das Limit-Feld leer. Es ist mit 100 vorbelegt und sein Minimum ist eins - es zu leeren, nicht null einzutippen, nimmt also alles, was ein Post zurückgibt. Bedenken Sie, dass ein reger Thread groß sein kann; der Schätzer zeigt Ihnen die Zeilenzahl, bevor der Lauf startet.
Was kostet das?+
Die ersten 500 Zeilen sind kostenlos und einmalig, ohne Kreditkarte. Danach sind es 0,002 $ je Zeile - rund 2 $ je 1.000 Kommentare - derselbe Pauschalsatz wie bei jedem anderen Scraper der Plattform. Der Schätzer zeigt die Kosten eines Laufs, bevor er startet.

Ihre ersten 500 Zeilen,
gehen aufs Haus.

500 einmalige kostenlose Zeilen für jedes neue Konto - ohne Ablaufdatum. Danach 0,002 $ je Zeile, nach Verbrauch - keine hinterlegte Karte, bis Sie es sagen.

Sofort aktiv · keine Karte erforderlich

Reddit-Kommentare aus jedem Post im großen Maßstab scrapen

Livescrapers Reddit Comments Scraper macht aus Post-URLs eine Kommentartabelle. Sie fügen die Links ein, einen pro Zeile - oder laden sie als CSV-, XLSX-, TXT- oder Parquet-Datei hoch -, wählen eine von sechs Sortierungen, begrenzen die Zeilen je Anfrage oder lassen das Feld leer, um alles zu nehmen, und laden die Ergebnisse als saubere CSV-, Excel- oder JSON-Datei herunter. Die Anfragen gehen über den gemeinsamen Proxy-Pool statt über Ihre eigene Adresse hinaus.

Jede Zeile ist ein Kommentar: die von Ihnen eingereichte Post-URL, das Konto, das ihn geschrieben hat, der Kommentartext, sein Score, wann er erstellt wurde, ein Permalink auf genau diesen Kommentar und eine Status-Spalte, die festhält, wie der Abruf verlief. Die Sortierung ist die Einstellung, über die es sich nachzudenken lohnt, denn sie entscheidet, welchen Teil eines Threads ein begrenzter Lauf behält - Top und Controversial beantworten wirklich unterschiedliche Fragen zum selben Post.

Zwei Dinge sollten Sie wissen, bevor Sie darauf aufbauen. Das Schema ist flach: Es gibt keine Eltern-ID, keine Kommentar-ID und keine Tiefen-Spalte, der Export ist also eine Liste von Kommentaren und kein Antwortbaum, und die Spalte query ist die einzige Verbindung zurück zum Thread. Und diese Seite benennt die sieben Spalten und ihre Reihenfolge, ohne ein einziges Wertformat oder eine Füllquote zuzusagen, denn es existiert kein befüllter Reddit-Comments-Export, auf den sich das stützen ließe - die Läufe, die uns vorliegen, gaben nur die Spalten query und status zurück und zielten auf eine Platzhalter-URL, sie belegen also das Schema und nichts über Reddit, in keine Richtung.

Es lohnt sich außerdem, die Status-Spalte von Anfang an in Ihre Pipeline einzubauen: Das Formular der Plattform warnt selbst, dass Anti-Bot-Seiten im kostenlosen Pool, der nur residenziell ist, einen blocked-Status zurückgeben. Lassen Sie einen Post im kostenlosen Kontingent laufen und lesen Sie die ersten Zeilen, bevor Sie einen Parser schreiben. Ihre ersten 500 Zeilen kosten nichts und brauchen keine Kreditkarte, danach sind es 0,002 $ je Zeile, pauschal.