YouTube-Kommentare in strukturierte Zeilen extrahieren
Ein YouTube-Kommentarbereich ist einer der wenigen Orte, an denen ein Publikum sagt, was es denkt, ohne gefragt worden zu sein. Er ist zugleich fürs Scrollen gebaut und nicht fürs Lesen: Es gibt keine Möglichkeit, ihn nach eigenen Kriterien zu sortieren, keine zu filtern und keine, ein Video mit einem anderen zu vergleichen. Dieser Dienst macht daraus eine Tabelle - eine Zeile je Kommentar, mit dem Autor, dessen Kanal-ID, dem Kommentartext, der Anzahl der Likes, der Antwortanzahl und einer Kennzeichnung, ob die Zeile eine Antwort ist, exportiert als CSV, JSON oder Excel.
Die Bedienung ist bewusst schlicht. Fügen Sie Video-IDs oder vollständige Watch-URLs ein, eine je Zeile, oder laden Sie eine CSV-, TXT- oder XLSX-Datei hoch; die erste Spalte wird als Ihre Liste gelesen. Ein Limit gilt je Anfrage, ein einzelner Job kann also die ersten hundert Kommentare von vielen Videos holen - oder einen ganzen Kommentarbereich, wenn Sie es auf null setzen. Die Sortierung liegt bei Ihnen - Top oder Neueste - und Antworten sind ein eigener Schalter, der aus ist, sofern Sie ihn nicht einschalten. Der Dienst liest die JSON-Schnittstelle von YouTube selbst, statt Seiten-HTML zu parsen, eine Layout-Änderung auf der Website bricht Ihren Export also nicht still.
Zwei Dinge über die Daten sollten Sie wissen, bevor Sie darauf aufbauen. Die Spalte published ist kein Datum: Sie trägt den relativen Text, den YouTube selbst anzeigt, in der Einheit, die zum Alter des Kommentars passt - „vor 1 Tag“ bei einem frischen, „vor 2 Jahren“ bei einem alten Kommentar - mit dem Zusatz „(bearbeitet)“, wenn er bearbeitet wurde. Sie lässt sich nicht als Zeitstempel parsen und ist nur neben dem Datum aussagekräftig, an dem Sie den Job ausgeführt haben. Und likes sowie reply_count kommen leer statt null an, wenn nichts angezeigt wird, was eine Summe oder einen Durchschnitt still verzerrt, sofern Sie nicht zuvor vereinheitlichen. Die Spalte is_reply enthält die Zeichenfolge yes oder no statt eines Booleschen Werts - prüfen Sie also auf die Zeichenfolge.
Eine ehrliche Anmerkung zum Schema. Der Tabellen-Export hat zehn Spalten, das JSON hat elf - das JSON ergänzt position, die Reihenfolge, in der der Kommentarbereich zurückkam, und eine Umwandlung der Tabelle stellt sie nicht wieder her. Und parent_author, das die Autorin oder den Autor benennen soll, auf die oder den eine Antwort antwortet, kam in jeder Zeile jedes unserer Läufe leer zurück, auch in den Antwortzeilen, wo es das einzige Feld ist, das gefüllt sein könnte. Es ist dokumentiert, weil es Teil des deklarierten Schemas ist, nicht weil wir es je funktionieren sahen; prüfen Sie Ihren eigenen Export, bevor Sie sich darauf verlassen. Starten Sie kostenlos: Ihre ersten 500 Zeilen kosten nichts und brauchen keine Kreditkarte. Aktuelle Konditionen finden Sie unter Preise.