YouTube文字起こしスクレイパー

実際に語られた内容を、
スプレッドシートに

YouTubeの動画IDまたはURLを渡せば、文字起こしが行データで返ります - 字幕セグメントごとに1行、それぞれにテキスト、開始時刻、長さが付き、さらに全文が単一のフィールドとして入ります。8列。YouTubeのアカウントも、レジデンシャルプロキシも、保守し続けるパーサーも不要です。

初回限定500行無料以降は1行0.002ドル8列CSV · XLSX · JSON
使い方

動画リストを入れると、
語られた言葉が出てくる

入力は動画です。すでにお持ちのもの - 素のID、watchリンク、短いyoutu.beリンク - を貼り付ければ、ジョブがその字幕トラックを取得します。

  1. ステップ 1プラットフォームにサインインします。
  2. ステップ 2YouTube文字起こしスクレイパーを開きます。
  3. ステップ 3YouTubeの動画IDまたはURLを1行に1件ずつ貼り付けます - あるいはCSV、XLSX、TXT、Parquetファイルをアップロードします。
  4. ステップ 4出力形式を選びます。
  5. ステップ 5Get Data をクリックします。
  6. ステップ 6文字起こしをCSV、XLSX、JSONのいずれかでダウンロードします。

各行には由来したクエリと、属する動画IDが付きます。プレイリスト相当の本数をまとめて実行しても、入力リストと突き合わせられます。

チームが使う理由

検索でき、
引用できる話し言葉。

ID、watchリンク、短縮リンクのいずれでも

3つとも同じ欄に、1行に1件で入れられます。プレイリストやラジオフラグなど追加パラメータの付いたwatch URLでも正しい動画に解決され、解決されたIDが専用の列で返るので、それを使って結合できます。

秒単位の時刻付き

各セグメントには開始の瞬間と長さが、いずれも小数の秒数で入ります。それが、話し言葉の塊を「そこへ飛べるもの」に変えます - ディープリンクを作る、クリップを切り出す、引用を元の映像と突き合わせる。

セグメントと、全体と

1つのファイルで両方の形が得られます。時刻が要るものにはセグメントごとの行を、テキストだけでよいものには全文を1フィールドで。この全文フィールドがどこに入るかはデータディクショナリで正確に説明しています - すべての行に入るわけではないからです。

返ってくるもの

8列、
1セグメントにつき1行

各行は1つの字幕セグメントです。何が語られたか、いつ始まりどれだけ続くか、そして属する動画と送信したクエリが付いています。

下の列一覧は実際の実行エクスポートのヘッダー行であり、実行画面が描画する列配列によって裏付けられています。両者は完全に一致します。8列のうち2列は他と挙動が異なり - 行ごとではなく動画ごとに1回だけ現れます - これが最も驚かれやすい点なので、表の中と、その下の注記の両方で明記しています。

データディクショナリ

8列、
うち2列は特別です

実際の実行のヘッダー行から取っています。ここでの注記は各列が何を含み、どう繰り返されるかを述べるものであり、何行得られるかではありません。行数は動画の字幕トラックの性質であって、スクレイパーの性質ではないからです。

query
送信した動画IDまたはURL。そこから得られた各行に繰り返されます - URLの追加パラメータも、入力したとおりそのまま含まれます。
video_id
クエリが解決したYouTubeのID。その動画の各行に繰り返されます。結合にはこの列を使ってください。プレイリスト付きのwatch URLでも素のIDでも、ここでは同じ値になります。
language
字幕トラックの言語コード。その動画の各行に繰り返されます。当社は英語の動画しか実行していないため、確認できた値は en のみです - この列が他に何を含みうるかは推測しません。
segments
各動画の最初の行にのみ入ります。 その動画の文字起こしがいくつのセグメントに分割されたか - すなわちその動画が占める行数でもあります。同じ動画の他の行では空です。値が入っている箇所は整数であり、文字列ではありません。
transcript
各動画の最初の行にのみ入ります。 全文が1つのテキストブロックとして、セグメントを連結した形で入ります。同じ動画の他の行では空なので、この列を素朴に読むと動画ごとに1セルだけ埋まり、間は空白になります。これは設計であって、欠落ではありません。
text
そのセグメントで語られた内容。すべての行に入ります - エクスポートのうち「行ごと」の側です。
start
セグメントの開始時刻。動画の先頭からの秒数を小数で表します。1つの動画の中では増加し、次の動画で再び始まります。
duration
セグメントの長さ。秒数を小数で表します。

これに対してコードを書く前に知っておくべき3点。 1行は動画ではなくセグメントです - 1本の動画は、その字幕トラックのセグメント数だけ行を占め、queryvideo_idlanguage はその全行に繰り返されます。segmentstranscript はこの原則から外れ、各動画の最初の行にのみ書かれ、残りは空です。すべての行にあると期待せず、video_id でグループ化して最初の行を取ってください。そして startduration は本物の数値として返り、それ以外はすべてテキストです - segments も含め、値が入っていれば整数、なければ空文字列なので、厳密なパーサーは両方を許容する必要があります。

実行の設定

入力欄が一つ、
調整するものはなし

このスクレイパーには上限も並べ替えもありません - 文字起こしはあるがままです。決めるのは、動画をどう渡すかだけです。

素の動画ID watch?v= のURL youtu.be の短縮リンク 1行に1件貼り付け CSVアップロード XLSXアップロード TXTアップロード Parquetアップロード
よくある使い方

ここで最もよく実行される
3つの仕事。

話し言葉がスプレッドシートに入ったあと、チームがそれをどう使うかの例をいくつか挙げます。

リサーチ

過去の全動画から特定の言い回しを探す

あるチャンネルの動画の文字起こしを取得し、テキスト列を絞り込みます。製品名・競合名・特定の主張への言及をすべて見つけるのに、早送りで午後を潰す代わりにフィルタ一つで済みます。

Research · Comms
コンテンツ

講演を文章素材に変える

文字起こしは、ブログ記事・ショーノート・字幕データの初稿です。全文フィールドが1セルで全体を渡し、時刻付きの行が元動画へ戻るリンクのためのタイムスタンプを渡します。

コンテンツ
AI

モデルに「出典を示せるもの」を与える

時刻付きセグメントは検索用のチャンクにきれいに分割でき、どのチャンクもどの動画のどの位置から来たかをすでに知っています。それが、単なる回答と、語られた秒にリンクできる回答との違いです。

Data · ML
料金

実際に取得した
セグメントの分だけお支払い。

サブスクリプションなし、最低利用額なし、継続請求なし。最初の500行は当社負担です。それ以降は従量課金で、ここにある他のスクレイパーとまったく同じ均一料金です。

無料枠

500行無料 - 0ドル

すべての新規アカウントに初回限定で。クレジットカード不要。ファイルアップロードとすべてのエクスポート形式を含みます。設計に入る前に文字起こしの形を確かめるには十分です。

ずっと0ドル
従量課金

無料枠の後は1行0.002ドル

プラットフォーム上の他のすべてのスクレイパーと同じ均一料金です。事前見積もりが、実行前に行数とクレジット費用を表示します - 想定外の請求も、換算が必要な計算ユニットもありません。

最も人気
大量利用

カスタム · 大量利用

継続的なモニタリングや非常に大規模な過去データ取得に向けた、ボリューム料金、専用ワーカー、SLA。ご希望の規模をお知らせいただければお見積もりします。

ご相談ください
初回の有料実行が10%オフ。チェックアウト時にコード LIVESCRAPER10 をご利用ください。
登録する
相性のよいツール

何が語られたか、
そしてどこで見つかったか

法務について

YouTubeの文字起こし
スクレイピングするのは合法ですか?

短い答え:字幕は動画と一緒に配信されています - そして、その言葉をあとで何に使ってよいかは、スクレイピングではなく著作権の問題です。

字幕トラックは、ログインの有無にかかわらず動画を開いた誰にでも配信されます。字幕ボタンはそうやって機能しています。同じ公開トラックを調査目的で読むことは長年の確立した実務であり、ここではログインもペイウォールも一切扱いません。字幕のない動画には読むべき文字起こしがありません。だからこのスクレイパーは字幕を必要とし、その旨をはっきり示しています。

計画に織り込むべきはアクセスではなく再利用です。文字起こしは制作者の言葉であり、動画はその著作物です - 引用、索引付け、検索、分析は、講演を自分の記事として再公開することとはまったく別の土俵にあります。それで学習させる場合や、長文をそのまま再現する場合は、ライセンスの問題であり、規模を拡大する前にご自身で答えを出す必要があります。

YouTubeの利用規約は自動アクセスを制限しているため、これは法律の問題であると同時に規約の問題でもあります。プラットフォームと契約関係がある場合は確認してください。当社はデータ層でサードパーティのトラッカーを一切動かしておらず、エクスポートは30日後に自動削除されます。

livescraper.app · 方針
公開されている字幕トラックのみ
ログインなし、アカウントに触れません
言葉は制作者のものであり続けます!
あなたのIPは使いません - 当社のIPが巡回します
エクスポートは自動削除(30日)
規模を拡大する前にYouTube自身の規約をご確認ください。
よくある質問

登録前によく
寄せられる質問。

最も多くいただく質問です。ほかにご不明な点は? お問い合わせください - 回答を書くのはボットではなく人間です。

YouTubeの文字起こしをスクレイピングするには?+
YouTube文字起こしスクレイパーを使います:
  1. プラットフォームにサインインします。
  2. YouTube文字起こしスクレイパーを開きます。
  3. YouTubeの動画IDまたはURLを1行に1件ずつ貼り付けます - あるいはCSV、XLSX、TXT、Parquetファイルをアップロードします。
  4. 出力形式を選びます。
  5. Get Data をクリックします。
  6. 文字起こしをCSV、XLSX、JSONのいずれかでダウンロードします。
1行は何を表しますか?+
動画ではなく、1つの字幕セグメントです。1本の動画は、その文字起こしのセグメント数だけ行を占め、query、video_id、language はその全行に繰り返されます。動画ごとに1行が欲しい場合は、video_id でグループ化して各グループの最初の行を取ってください - 全文はそこに入っています。
segments と transcript の列がほとんどの行で空なのはなぜですか?+
行ごとではなく、動画ごとに1回書かれるからです。どちらも各動画の最初の行に入り、その動画の残りの行では空になります - 現行形式で当社が行ったすべての実行で、例外なくそうでした。取得の失敗ではなくグループ化の規約です。segments はその動画が占める行数を示し、transcript は全体を1つのテキストブロックとして保持します。
YouTubeの完全なURLを貼り付けてもよいですか、それともIDでなければいけませんか?+
どちらでもよく、youtu.be の短縮リンクも使えます。プレイリストやラジオフラグなど追加パラメータの付いたwatch URLでも正しく解決され、解決されたIDが video_id 列で返るので、貼り付けた文字列ではなくそちらで結合できます。
動画に字幕がない場合はどうなりますか?+
返せる文字起こしがありません。字幕がここで読み取る対象なので、字幕が無効な動画からは何も得られません - これはツール自体に記載された前提条件であり、お客様側のエラーではありません。実行が失敗したと判断する前に、その動画に字幕ボタンがあるかご確認ください。
タイムスタンプはディープリンクに使えますか?+
はい。各セグメントには動画の先頭からの開始秒数と長さが、いずれも小数で入っています。ジャンプリンクを作る、クリップを切り出す、引用を語られた瞬間と突き合わせる - それには十分です。
出力は最近変わりましたか?+
はい、2026年7月3日に変わりました。切り替え前の実行は、動画ごとに1行で5列をエクスポートし、文字起こし全体が単一のセルに入っていました。切り替え後の実行は、セグメントごとに1行でここに記載した8列をエクスポートします。これは列が増えただけではなく、1行の意味が変わったということです - 古いファイルをお持ちなら形式が異なりますが、どちらのファイルも誤りではありません。
料金はいくらですか?+
最初の500行は初回限定で無料、クレジットカードも不要です。それ以降は1行0.002ドル - プラットフォーム上の他のすべてのスクレイパーと同じ均一料金です。ここでの1行はセグメントである点にご注意ください。長い動画は短い動画より費用がかかります。実行前に見積もりが費用を表示します。

最初の500セグメントは、
当社のおごり

すべての新規アカウントに初回限定で500行無料 - 有効期限はありません。それ以降は1行0.002ドルの従量課金で、あなたが決めるまでカード情報の登録は不要です。

即時有効 · カード不要

YouTubeの文字起こしを大規模にスクレイピングする

LivescraperのYouTube文字起こしスクレイパーは、動画のリストをテキストに変えます。YouTubeの動画IDまたはURLを - 1行に1件入力するか、CSV、XLSX、TXT、Parquetファイルとしてアップロードして - 送信し、字幕トラックをきれいなCSV、Excel、JSONファイルとしてダウンロードします。素のID、watchリンク、youtu.beの短縮リンクのいずれも使え、プレイリストのパラメータが付いたwatch URLでも正しい動画に解決されます。

1行は1つの字幕セグメントです。各行には、語られた内容、開始の秒数、長さに加えて、送信したクエリ、解決された動画ID、トラックの言語が入ります。さらに2つの列は行単位ではなく動画単位で働きます。segments はその動画が占める行数、transcript は全体を1つのテキストブロックとして保持します。どちらも各動画の最初の行にあり、これはパーサーを書く前に知っておく価値のある点です。

リサーチ担当はチャンネルの過去作を取得し、早送りする代わりにテキストから言い回しを検索します。コンテンツチームは講演を記事・ショーノート・字幕に変えます。検索基盤を作るチームは、時刻付きセグメントを、どの動画のどの位置から来たかをすでに知っているチャンクとして使います - 単なる回答と、語られた秒にリンクできる回答との違いです。

始める前に知っておくべきことが2つあります。字幕が無効な動画には返せる文字起こしがないため、字幕はあれば良いものではなく前提条件です。そして1行がセグメントである以上、同じ均一料金の1行0.002ドルでも、長い動画は短い動画より費用がかかります。無料で始められます。最初の500行は費用もクレジットカードも不要です。