入力は動画です。すでにお持ちのもの - 素のID、watchリンク、短いyoutu.beリンク - を貼り付ければ、ジョブがその字幕トラックを取得します。
各行には由来したクエリと、属する動画IDが付きます。プレイリスト相当の本数をまとめて実行しても、入力リストと突き合わせられます。
3つとも同じ欄に、1行に1件で入れられます。プレイリストやラジオフラグなど追加パラメータの付いたwatch URLでも正しい動画に解決され、解決されたIDが専用の列で返るので、それを使って結合できます。
各セグメントには開始の瞬間と長さが、いずれも小数の秒数で入ります。それが、話し言葉の塊を「そこへ飛べるもの」に変えます - ディープリンクを作る、クリップを切り出す、引用を元の映像と突き合わせる。
1つのファイルで両方の形が得られます。時刻が要るものにはセグメントごとの行を、テキストだけでよいものには全文を1フィールドで。この全文フィールドがどこに入るかはデータディクショナリで正確に説明しています - すべての行に入るわけではないからです。
各行は1つの字幕セグメントです。何が語られたか、いつ始まりどれだけ続くか、そして属する動画と送信したクエリが付いています。
下の列一覧は実際の実行エクスポートのヘッダー行であり、実行画面が描画する列配列によって裏付けられています。両者は完全に一致します。8列のうち2列は他と挙動が異なり - 行ごとではなく動画ごとに1回だけ現れます - これが最も驚かれやすい点なので、表の中と、その下の注記の両方で明記しています。
実際の実行のヘッダー行から取っています。ここでの注記は各列が何を含み、どう繰り返されるかを述べるものであり、何行得られるかではありません。行数は動画の字幕トラックの性質であって、スクレイパーの性質ではないからです。
en のみです - この列が他に何を含みうるかは推測しません。これに対してコードを書く前に知っておくべき3点。 1行は動画ではなくセグメントです - 1本の動画は、その字幕トラックのセグメント数だけ行を占め、query、video_id、language はその全行に繰り返されます。segments と transcript はこの原則から外れ、各動画の最初の行にのみ書かれ、残りは空です。すべての行にあると期待せず、video_id でグループ化して最初の行を取ってください。そして start と duration は本物の数値として返り、それ以外はすべてテキストです - segments も含め、値が入っていれば整数、なければ空文字列なので、厳密なパーサーは両方を許容する必要があります。
このスクレイパーには上限も並べ替えもありません - 文字起こしはあるがままです。決めるのは、動画をどう渡すかだけです。
話し言葉がスプレッドシートに入ったあと、チームがそれをどう使うかの例をいくつか挙げます。
あるチャンネルの動画の文字起こしを取得し、テキスト列を絞り込みます。製品名・競合名・特定の主張への言及をすべて見つけるのに、早送りで午後を潰す代わりにフィルタ一つで済みます。
文字起こしは、ブログ記事・ショーノート・字幕データの初稿です。全文フィールドが1セルで全体を渡し、時刻付きの行が元動画へ戻るリンクのためのタイムスタンプを渡します。
時刻付きセグメントは検索用のチャンクにきれいに分割でき、どのチャンクもどの動画のどの位置から来たかをすでに知っています。それが、単なる回答と、語られた秒にリンクできる回答との違いです。
サブスクリプションなし、最低利用額なし、継続請求なし。最初の500行は当社負担です。それ以降は従量課金で、ここにある他のスクレイパーとまったく同じ均一料金です。
すべての新規アカウントに初回限定で。クレジットカード不要。ファイルアップロードとすべてのエクスポート形式を含みます。設計に入る前に文字起こしの形を確かめるには十分です。
プラットフォーム上の他のすべてのスクレイパーと同じ均一料金です。事前見積もりが、実行前に行数とクレジット費用を表示します - 想定外の請求も、換算が必要な計算ユニットもありません。
継続的なモニタリングや非常に大規模な過去データ取得に向けた、ボリューム料金、専用ワーカー、SLA。ご希望の規模をお知らせいただければお見積もりします。
LIVESCRAPER10 をご利用ください。短い答え:字幕は動画と一緒に配信されています - そして、その言葉をあとで何に使ってよいかは、スクレイピングではなく著作権の問題です。
字幕トラックは、ログインの有無にかかわらず動画を開いた誰にでも配信されます。字幕ボタンはそうやって機能しています。同じ公開トラックを調査目的で読むことは長年の確立した実務であり、ここではログインもペイウォールも一切扱いません。字幕のない動画には読むべき文字起こしがありません。だからこのスクレイパーは字幕を必要とし、その旨をはっきり示しています。
計画に織り込むべきはアクセスではなく再利用です。文字起こしは制作者の言葉であり、動画はその著作物です - 引用、索引付け、検索、分析は、講演を自分の記事として再公開することとはまったく別の土俵にあります。それで学習させる場合や、長文をそのまま再現する場合は、ライセンスの問題であり、規模を拡大する前にご自身で答えを出す必要があります。
YouTubeの利用規約は自動アクセスを制限しているため、これは法律の問題であると同時に規約の問題でもあります。プラットフォームと契約関係がある場合は確認してください。当社はデータ層でサードパーティのトラッカーを一切動かしておらず、エクスポートは30日後に自動削除されます。
最も多くいただく質問です。ほかにご不明な点は? お問い合わせください - 回答を書くのはボットではなく人間です。
LivescraperのYouTube文字起こしスクレイパーは、動画のリストをテキストに変えます。YouTubeの動画IDまたはURLを - 1行に1件入力するか、CSV、XLSX、TXT、Parquetファイルとしてアップロードして - 送信し、字幕トラックをきれいなCSV、Excel、JSONファイルとしてダウンロードします。素のID、watchリンク、youtu.beの短縮リンクのいずれも使え、プレイリストのパラメータが付いたwatch URLでも正しい動画に解決されます。
1行は1つの字幕セグメントです。各行には、語られた内容、開始の秒数、長さに加えて、送信したクエリ、解決された動画ID、トラックの言語が入ります。さらに2つの列は行単位ではなく動画単位で働きます。segments はその動画が占める行数、transcript は全体を1つのテキストブロックとして保持します。どちらも各動画の最初の行にあり、これはパーサーを書く前に知っておく価値のある点です。
リサーチ担当はチャンネルの過去作を取得し、早送りする代わりにテキストから言い回しを検索します。コンテンツチームは講演を記事・ショーノート・字幕に変えます。検索基盤を作るチームは、時刻付きセグメントを、どの動画のどの位置から来たかをすでに知っているチャンクとして使います - 単なる回答と、語られた秒にリンクできる回答との違いです。
始める前に知っておくべきことが2つあります。字幕が無効な動画には返せる文字起こしがないため、字幕はあれば良いものではなく前提条件です。そして1行がセグメントである以上、同じ均一料金の1行0.002ドルでも、長い動画は短い動画より費用がかかります。無料で始められます。最初の500行は費用もクレジットカードも不要です。