入力欄は 4 種類のものを受け付け、1 つのリストに混ぜて入れられます - チャンネル、再生リスト、あるいは単に検索したいフレーズ。
@handle、チャンネル ID、再生リスト URL、または単純なキーワード。あるいは CSV、XLSX、TXT、Parquet ファイルをアップロードします。ページの HTML をスクレイピングするのではなく YouTube 自身の JSON インターフェースを読みます。だからフィールドは、変わりうるレイアウトから切り出されたものではなく、構造化されたまま返ります。
チャンネル URL、@handle、チャンネル ID、再生リストのリンク、あるいは素のキーワード。どれも同じ欄に入り、1 つのリストに混ぜられます。始める前に何かを正規化する必要はありません。
表示用のテキストと、その裏にある数値が別々の列で届きます。合計を出す前に 1.2M が何を意味するのかを推測する必要はありません。
レンダリング済みの HTML を解析するのではなく、YouTube 自身の JSON インターフェースを読みます。サイトのレイアウトが安定しなくても列が安定しているのはそのためです。
このエクスポートには実データの裏付けがあるので、以下の形式は説明ではなく実測です。そのうち 2 つの性質は実行の計画そのものを変えるので、表の前に置く価値があります。
ショートと通常動画は絞り込みではなく選択です。動画の種類の設定はどちらか一方であり、1 回の実行はどちらかを返すだけで両方は返しません。手元のどの実行も両者を混ぜたことはありません。つまりチャンネルの全出力を取るには 1 回ではなく 2 回の実行が必要です。返ってくる内容にも関わります。ショートの行はどれも公開日も再生時間もなしで届きます。ショートがそれらを表示しないからです。分析に日付や長さが必要なら、通常動画の実行が必要です。
公開日は相対表記で、ファイルの中にそれを固定するものが何もありません。値はどれも9 日前や3 か月前と読めます。そして取得時刻の列も、タイムスタンプも、日付らしきものも 12 列のどこにもありません。ですからこのエクスポートは、動画が実際にいつ公開されたかを教えてくれません。あなたが見た時点で何日経っていたかだけです。実行日をファイルと一緒に記録してください。1 週間後には同じファイルが静かに別の意味になります。
実際の実行のヘッダー行と JSON キーから取り、プラットフォームの公開列一覧と突き合わせています。形式は値の入ったセルから実測したものです。
video_type に従い、通常動画なら /watch?v=<id>、ショートなら /shorts/<id> です。ID は必ず含まれています。UC で始まります。チャンネル単位で集計する際の安定した手段です。チャンネルは改名できますが、これは変わりません。キーワード検索の結果では空になることがあります。5.6K views のような丸められた省略表記の文字列です。常に再生回数とは限りません。1 回だけなら 1 view と読め、ライブ配信では <n> watching と読めます。これは累計再生数ではなく同時視聴者数です。4.1M views と表示される動画が 4099999 で返ってきました。合計・並べ替え・比較にはこの列を使ってください。views は人に見せるためのものです。9 days ago、2 weeks ago、3 months ago のような相対表記です。絶対日付になることはなく、ショートには存在しません。固定の仕方については下の注記をご覧ください。m:ss または h:mm:ss です。ショートには存在せず、ライブ配信にも存在しません。short か video のいずれかで、その実行で選んだ動画の種類に一致します。1 回の実行はどちらかしか返さないので、この列は 1 つのファイルの中では一定です。あとから 2 つのファイルを見分けるためにあります。frame0.jpg、それ以外では hqdefault、hq720、カスタム版などになります。URL を自分で組み立てず、この列を読んでください。動画 ID は必ず含まれています。備えておかないと噛みつくものが 3 つあります。第一に、published は相対表記で、ファイルのどこにもタイムスタンプがありません - 取得時刻も実行日も、何もです。エクスポートは、あなたが実行した瞬間を基準に動画が3 か月前だと言い、後日読んだ同じファイルは別の日付について同じ言葉を言います。実行日をファイルと一緒に保存してください。第二に、views_parsed が正確な数値で、views が丸められたテキストです。名前が示唆するのとは逆なので、合計と並べ替えは views_parsed で行ってください。第三に、同じ video_id が 1 回の実行で複数回現れることがあります。確認したところ、コピー間で異なる列は query ただ 1 つでした。同じチャンネルに解決する 2 つの入力が、それぞれその動画を返すからです。一意の動画がほしければ video_id で重複除去し、どのクエリが何を見つけたかが重要ならコピーを残してください。もう 1 つ小さな点として、title と channel_title はどちらも末尾に空白を持つので、突き合わせの前にトリムしてください。
入力リストが 1 つ、上限が 1 つ、そして排他的な選択が 1 つ。動画の種類は、量ではなく何が返るかを変える設定です。意識して選んでください。
チームがチャンネルのカタログを使って、実際に抱えている問いに答えている例をいくつか。
ハンドルを入れればカタログが出てきて、合計できる再生回数が付いてきます。ショートと通常動画の 2 回の実行を見れば、そのチャンネルが労力を形式間でどう配分しているかが分かります。トップページを眺めても分からないことです。
数値の再生回数で並べ替えると、仕事をしているひと握りの動画とロングテールが分かれます。数値は丸められた表示テキストではなく正確なので、画面上では同じに見える動画同士でも順序が崩れません。
クエリ欄に素のフレーズを入れると YouTube を検索するので、あるテーマがチャンネルと再生回数付きの候補リストになります。誰かのお気に入り一覧ではない、クリエイター開拓の出発点です。
サブスクリプションも、最低利用額も、毎月の請求もありません。最初の 500 行は当社負担です。その後は従量課金で、ここにある他のスクレイパーとまったく同じ均一料金です。
新規アカウントごとに初回 1 回。クレジットカード不要。クエリごとの上限、ファイルアップロード、すべての書き出し形式を含みます。
動画 1,000 本でおよそ 2 ドル。チャンネルのショートと通常動画は 2 回の実行になるため、完全なカタログは両方分かかる点を覚えておいてください。事前の見積り表示が、実行を開始する前に行数とクレジット費用を示します。
継続的なモニタリングや非常に大きな過去データの取得のための、ボリューム料金、専用ワーカー、SLA。ご要望の規模をお知らせいただければお見積りします。
LIVESCRAPER10 をご利用ください。短い答え:これは YouTube 自身のインターフェース経由で公開された一覧メタデータを読むもので、動画の内容は取得しません。ただし YouTube の規約は多くのサービスより厳しく、そこはきちんと読む価値があります。
返ってくるのは、チャンネルページが誰にでも見せている情報です。タイトル、再生回数、公開からの経過、再生時間、サムネイル。動画ファイルはダウンロードされず、サインインの向こう側には何も触れず、非公開やメンバー限定のコンテンツも一切関わりません。スクレイパーはレンダリング済みのページを解析するのではなく、YouTube 自身の JSON インターフェースを読みます。
とはいえ YouTube の利用規約は自動アクセスを制限しており、マーケットプレイスやディレクトリと違って、これは明示的にそう述べ、実際に運用しているプラットフォームです。Google はこの多くについて公式の Data API も公開しています。何らかの規模で運用する場合や、結果の上に製品を作る場合、正直な立場はこうです。公式 API が認められた経路であり、これはそうではありません。ですからその判断はこのページではなく、あなたとあなた自身の助言者が下すものです。
個人データについて。返る行は個人ではなく動画とチャンネルを記述しており、チャンネル名は私的な身元ではなく公開された名乗りです。とはいえ小規模なクリエイターのチャンネルは、名前が違うだけで一人の個人であることもあります。コンテンツを測るのではなく個人をプロファイリングするものを作るなら、そこからデータ保護上の義務があなたに及び始めます。当社はデータ層でサードパーティのトラッカーを一切動かしておらず、書き出したファイルは 30 日で自動的に削除されます。
最もよくいただく質問です。ほかにもあれば ご連絡ください - 回答を書いているのはボットではなく人間です。
Livescraper の YouTube 動画スクレイパーは、チャンネル、再生リスト、あるいは検索フレーズを動画の表に変えます。クエリを 1 行に 1 件ずつ貼り付けるか - チャンネル URL、@handle、チャンネル ID、再生リストのリンク、単純なキーワード - CSV、XLSX、TXT、Parquet ファイルとしてアップロードし、ショートか通常動画かを選び、クエリごとの行数に上限をかけ、結果をきれいな CSV、Excel、JSON としてダウンロードします。レンダリング済みの HTML を解析するのではなく、YouTube 自身の JSON インターフェースを読みます。
各行は 12 列を運びます。その行が生じたクエリ、動画 ID とタイトル、リンク、チャンネル名とその ID、YouTube が表示するとおりの再生回数と正確な数値の両方、公開からどれくらい経っているか、再生時間、ショートか通常動画か、そしてサムネイルのリンク。
コンテンツチームは競合のハンドルを実行して、トップページが押し出すものではなく実際に公開されているものを確認します。アナリストは正確な再生回数で並べ替えて、チャンネルを支えている動画とロングテールを切り分けます。パートナーシップチームはテーマをキーワードとして入れ、チャンネルと再生回数の付いた候補クリエイターのリストを得ます。
土台にする前に知っておくべき性質が 3 つあります。ショートと通常動画は絞り込みではなく排他的な選択なので、チャンネルの全出力は 2 回の実行になります。そしてショートは公開日も再生時間もなしで届きます。ショートがそれらを表示しないからです。通常動画が持つ公開日は相対表記で、9 日前や 3 か月前と読め、エクスポートにはそれを固定するタイムスタンプの列がありません。ですから実行日をファイルと一緒に記録してください。また views_parsed が正確な数値で views が丸められた表示テキストであり、名前が示唆するのとは逆です。合計と並べ替えは前者で行ってください。無料で始められます。最初の 500 行は費用もクレジットカードも不要で、その後は 1 行 0.002 ドルの均一料金です。