Scraper les transcriptions YouTube à grande échelle
Le Scraper de transcriptions YouTube de Livescraper transforme une liste de vidéos en texte. Vous soumettez des identifiants ou des URL de vidéos YouTube - saisis un par ligne, ou importés en CSV, XLSX, TXT ou Parquet - et téléchargez la piste de sous-titres sous forme de fichier CSV, Excel ou JSON propre. Les identifiants seuls, les liens watch et les liens courts youtu.be fonctionnent tous, et une URL watch portant des paramètres de playlist se résout toujours vers la bonne vidéo.
Une ligne est un segment de sous-titre. Chacune porte ce qui a été dit, la seconde où cela commence et la durée, aux côtés de la requête soumise, de l'identifiant de vidéo obtenu et de la langue de la piste. Deux autres colonnes fonctionnent par vidéo et non par ligne : segments, c'est-à-dire combien de lignes cette vidéo occupe, et transcript, qui contient l'ensemble en un bloc de texte. Toutes deux se trouvent sur la première ligne de chaque vidéo, et c'est le détail à connaître avant d'écrire un parser.
Les chercheurs extraient le catalogue d'une chaîne et cherchent une formule dans le texte au lieu d'avancer en accéléré. Les équipes contenu transforment des interventions en articles, en notes d'émission et en sous-titres. Les équipes qui construisent des systèmes de recherche documentaire utilisent les segments horodatés comme des morceaux qui savent déjà de quelle vidéo ils viennent et à quel endroit - la différence entre une réponse et une réponse que l'on peut relier à la seconde où elle a été prononcée.
Deux choses méritent d'être connues avant de commencer. Une vidéo dont les sous-titres sont désactivés n'a pas de transcription à renvoyer : les sous-titres sont une exigence, pas un bonus. Et parce qu'une ligne est un segment, une vidéo longue coûte plus qu'une courte au même tarif forfaitaire de 0,002 $ par ligne. Commencez gratuitement : vos 500 premières lignes ne coûtent rien et ne demandent aucune carte bancaire.