YouTube-Transkripte im großen Maßstab scrapen
Livescrapers YouTube Transkript-Scraper macht aus einer Videoliste Text. Sie übermitteln YouTube-Video-IDs oder -URLs - eine pro Zeile getippt oder als CSV-, XLSX-, TXT- oder Parquet-Datei hochgeladen - und laden die Untertitelspur als saubere CSV-, Excel- oder JSON-Datei herunter. Blanke IDs, Watch-Links und youtu.be-Kurzlinks funktionieren alle, und eine Watch-URL mit Playlist-Parametern löst weiterhin auf das richtige Video auf.
Eine Zeile ist ein Untertitelsegment. Jede trägt, was gesagt wurde, die Sekunde, in der es beginnt, und wie lange es dauert, dazu die übermittelte Abfrage, die aufgelöste Video-ID und die Sprache der Spur. Zwei weitere Spalten arbeiten pro Video statt pro Zeile: segments, also wie viele Zeilen das Video beisteuert, und transcript, das Ganze als ein Textblock. Beide stehen in der ersten Zeile jedes Videos - das ist das Detail, das man kennen sollte, bevor man einen Parser schreibt.
Research-Teams ziehen den Backkatalog eines Kanals und durchsuchen den Text nach einer Formulierung, statt im Schnelldurchlauf durch die Wiedergabe zu scrollen. Content-Teams machen aus Vorträgen Beiträge, Shownotes und Untertitel. Teams, die Retrieval-Systeme bauen, nutzen die getakteten Segmente als Abschnitte, die bereits wissen, aus welchem Video sie stammen und von welcher Stelle - der Unterschied zwischen einer Antwort und einer Antwort, die sich auf die Sekunde verlinken lässt, in der sie gesagt wurde.
Zwei Dinge sollten Sie vor dem Start wissen. Ein Video mit deaktivierten Untertiteln hat kein Transkript, das zurückgegeben werden könnte - Untertitel sind also Voraussetzung und kein Bonus. Und weil eine Zeile ein Segment ist, kostet ein langes Video bei denselben pauschalen 0,002 $ je Zeile mehr als ein kurzes. Starten Sie kostenlos: Ihre ersten 500 Zeilen kosten nichts und brauchen keine Kreditkarte.