Yahoo 検索スクレイパー

Yahooの検索結果を、
1行ずつ

検索語を送信すると、Yahooが表示した内容が表として返ります。順位、タイトル、リンク、スニペットを1件1行で。5カラムで、このページの根拠となる360行では、そのすべてが全行で埋まっていました。

一度きりの無料500行以降は1行0.002ドル1件あたり5カラムCSV · JSON · Excel
使い方

検索語を入れると、順位付きの表が出ます。

  1. ステップ 1プラットフォームにサインインします。
  2. ステップ 2Yahoo Search Scraper を開きます。
  3. ステップ 3取得したい検索語を1行に1つずつ入力します。
  4. ステップ 4出力形式を選びます(CSV / JSON / XLSX)。
  5. ステップ 5ジョブを実行します。
  6. ステップ 6結果をダウンロードします - 1件1行、5カラム。
エクスポートの実際

5カラムと、知っておくべき2点

空欄が一切ない

手元の360行すべてで、querypositiontitleurldescription が全行埋まっていました。エクスポート全体で空のセルは1つもありません。わざわざ書く価値があるほど珍しいことです。多くのデータ源では、null チェックを書き続けることになります。

position は数値で、しかも連番

5回の実行すべてで position は 1, 2, 3 … N と欠番も重複もなく並んでいました。そのまま並べ替えに使えますし、番号が欠けていればスクレイピング側ではなく自分のパイプラインで行が失われた証拠になります。

同じURLが2回出ることがある

ここでつまずく人が多い点です。1回の実行の中で url カラムは繰り返されます。74行のエクスポートで重複20行、ほかの実行では4、9、11、16行でした。エクスポートの不具合ではなく、実在の順位に並ぶ実在の行です。何かを数える前に url で重複排除してください。

検索結果は一晩で変わる

python web scraping を24時間あけて2回実行しました。1日目は66件、2日目は62件の異なるURLで、両方に出たのは42件だけ - およそ3分の1が入れ替わっています。残った42件のうち22件は順位が変わっていました。1回の実行はスナップショットであって、順位そのものではありません。

スニペットは実テキスト、時に途中で切れる

説明文は6〜417文字、中央値194文字で、360件中79件が三点リーダーで終わっていました。Yahoo側で切られたものです。テキスト列は幅広く用意し、末尾の「…」をデータ不良と扱わないでください。

タイトルに表示URLが混じることがある

360件中9件のタイトルが、www. python .org › downloads Download Python のように空白で区切られたパンくずドメインから始まっていました。少数ですが、タイトルで突き合わせると必ず驚かされます。先頭のドメイン断片を除去するか、url で突き合わせてください。

取得できるデータ

1件あたり5カラム

本サービスの実際のエクスポートのヘッダー行から、シートの順序どおりに読み取ったものです。以下の説明はすべて、測定した360行に基づいています。

query
送信した検索語。複数の検索語をまたぐエクスポートでも切り分けられるよう、全行に繰り返されます。今回の5回の実行はいずれも検索語1つでしたが、それらを結合できるのはこのカラムのおかげです。
position
順位を数値で。5回の実行すべてで1から始まる連番で、欠番も重複もありません - 1〜74、1〜70、1〜73、1〜69、1〜74。行の並び順ではなくこの値で並べ替えてください。
title
検索結果の見出し。通常はページタイトルですが、360行中9行では実際のタイトルの前に www. python .org › downloads のような空白区切りの表示ドメインが付いていました。
url
リンク先。360件中358件が https、2件が http で、異なるホストは168件でした。このカラムは1回の実行内で重複します - これで重複排除してください。
description
検索結果の下に表示される説明文。6〜417文字、中央値194文字で、360件中79件はYahooが切り詰めた三点リーダーで終わっています。

1行あたり5カラム · CSV、JSON、Excel

実際の5回の実行・360行で測定しました。python(74行)、snake(69行)、titan(74行)、そして python web scraping を2回(70行と73行)。検索語あたりの行数は69〜74で変動したため、当てにできる固定のページサイズはありません。きりのよい数を前提にせず、返ってきた行をそのまま読んでください。

よくある使い方

第2の検索エンジンが役立つ場面

順位トラッキング

順位は一度ではなく、時系列で見る

同じ検索語を定期実行し、queryurlposition と実行日を保存します。1日あけた2回の実行で、共通する42件のURLのうち22件が動きました。1回の測定ではほとんど何も分からず、系列にすれば多くが分かります。

SEO · レポーティング
競合の可視性

同じ語で誰が上位に出ているかを見る

ホスト単位でグループ化して数えます。360行で異なるホストは168件でした。まさにそこが問いです - 関心のある検索語群にわたって繰り返し現れるのは誰か、そしてどの深さまで出ているか。

SEO · 市場調査
カバレッジ確認

YahooとGoogleを比べる

同じ検索語リストを本サービスと Google Search Scraper の両方に通し、URL集合を突き合わせます。両者が食い違うところに、監査で見つかるものがあります。

SEO · 監査
リード獲得

検索結果ページをリストに変える

業種と都市を組み合わせた検索語なら、事業者ページが何十件も返ります。url カラムを Email & Contact Scraper に渡せば、検索結果が連絡可能なリストになります。

セールス · 新規開拓
料金

実際に使った分だけお支払い。

無料枠

最初の500行は無料

登録時に一度きり。カード不要で、あとから解約するものもありません。

登録時に一度きり
単価

以降は1行0.002ドル

実際に返った行数で課金します。今回の実行で検索語1件あたり69〜74行でしたから、無料500行はおよそ7件の検索語分にあたり、そこまでは課金されません。

返った行数で課金
サブスクなし

継続課金はありません

クレジットは月次で失効しません。今まとめて実行し、必要になるまで何もしない、という使い方ができます。

月次の失効なし
初回の有料実行が10%オフ。お支払い時にコード LIVESCRAPER10 をご利用ください。
登録する
相性のよいサービス

検索ファミリーのほかのサービス。

法的な話

Yahooの検索結果のスクレイピングは合法ですか?

検索結果ページは公開ページであり、ここでの5カラムは人ではなくウェブページを記述しています。留意点は分量と再利用についてです。

検索結果ページを読むことは訪問者なら誰もが行うことであり、順位、タイトル、リンク、スニペットは公開されたウェブページに関する事実です。エクスポートに個人を特定する情報はありません。氏名も、メールアドレスも、電話番号も、アカウントもないため、個人を扱うサービスで問題になるデータ保護上の論点はここでは生じません。

はっきり述べておくべきことが2つあります。第一に、スニペットとタイトルを書いているのは当社ではなくインデックスされた各サイトであり、それらはそのサイトの著作物です。順位トラッキング、競合分析、監査のために社内で使うのは通常の実務ですが、自社コンテンツとして再公開するのは別の問いであり、答えも異なります。第二に、これは順位そのものではなくスナップショットです。1日あけた同一検索語の2回の実行で共通していたURLは約64件中42件にすぎず、単一のエクスポートから導いた結論は見た目より脆いということです。系列で実行してください。

当社の条件はここにあるほかのサービスと同じです。公開されているページのみ、ログインの背後にあるものは扱わず、データ層に第三者トラッカーは置かず、エクスポートは30日後に自動削除されます。最初の500行は無料で、クレジットカードは不要です。

livescraper.app · 実行を左右する条件
1つの行セットにつき検索語は1つ
行数は今回の実行で69〜74と変動
position は1から連番
url は重複する - 数える前に重複排除を!
エクスポートは30日後に自動削除
結果は日ごとに変わります。2回実行した唯一の検索語では、24時間でURLの3分の1が入れ替わりました。
よくある質問

登録前によく聞かれること。

エクスポートにはどのカラムが含まれますか?+
5つです。querypositiontitleurldescription。1件1行です。このページの根拠となる360行では、この5つすべてが全行で埋まっていました - 空のセルは1つもありませんでした。
検索語1件でいくつの結果が返りますか?+
変動します。今回の5回の実行では74、70、73、69、74行でした。計画の前提にできる固定のページサイズはありません。きりのよい数を想定せず、返ってきた行をそのまま読んでください。
なぜ同じURLが複数回出てくるのですか?+
Yahooが複数回表示しているからです。1回の実行の中で、74行のエクスポートでは重複20行、ほかの実行では4、9、11、16行を数えました。いずれも実在する別々の順位に並んでいます。ホスト数や結果シェアを数える前に url で重複排除してください。
明日もう一度実行したら結果は同じですか?+
いいえ。python web scraping を24時間あけて2回実行したところ、1日目は66件、2日目は62件の異なるURLで、両方に出たのは42件でした。その42件のうち22件は順位が変わっています。上位10件でさえ、10件中9件は共通でしたが順序は同じではありませんでした。1回の実行はスナップショットとして扱い、傾向が必要なら系列で追ってください。
position カラムで並べ替えできますか?+
はい。数値であり、5回の実行すべてで1からNまで欠番も重複もなく連続していました。したがってデータに番号の欠けがあれば、それはスクレイピングではなく自分のパイプラインで行が落ちたことを意味します。
なぜ一部のタイトルが「www. python .org」のような形で始まるのですか?+
Yahooが見出しの前に表示URLをパンくずとして付けることがあるためです。今回は360行中9行で発生しました。タイトルで突き合わせる場合は先頭の断片を除去するか、この問題が起きない url で突き合わせてください。
料金はいくらですか?+
最初の500行は一度きりで無料、カードは不要です。以降は1行0.002ドルで、実際に返った行数で課金されます。今回の実行での検索語1件あたり69〜74行という実績なら、無料枠でおよそ7件分をまかなえます。
どの形式で書き出せますか?+
CSV、JSON、Excelです。5つのカラムとその順序は3形式とも同じです。

検索結果ページを表計算に

1件あたり5カラム、全行が埋まった状態で。最初の500行は無料、以降は1行0.002ドルです。

即時有効 · カード不要

Yahooの検索結果をスクレイピングする

Yahoo Search Scraper は検索語を受け取り、検索結果ページを行として返します。querypositiontitleurldescription の5カラムで、1件1行です。このページの背後には5回の実行と360行があり、その5カラムすべてが全行で埋まっていました - エクスポートのどこにも空のセルはありません。position は1から連続する数値で返るためそのまま並べ替えられ、データに欠番があればスクレイピング中ではなく後段で行が失われたことを意味します。

スキーマよりも重要なのは、データの2つの性質です。1つ目は重複です。1回の実行の中で url カラムは繰り返され、74行のエクスポートでは20回、ほかでは4、9、11、16回でした。実在の順位に並ぶ本物の行なので、ホスト数、ドメイン数、結果シェアを数える処理はまず重複排除から始める必要があります。2つ目は変動です。python web scraping という検索語を連続する2日間で実行したところ、1日目は66件、2日目は62件の異なるURLで、両方に現れたのは42件だけでした。その42件のうち22件は順位が変わり、上位10件でさえ10件中9件が共通しながら順序は異なりました。単一のエクスポートはある瞬間のスナップショットにすぎず、四半期に1回の測定で組んだ順位トラッキングは、ノイズを変動として報告することになります。

行数も固定ではありません。今回の5回の実行は、検索語1件につき74、70、73、69、74行を返しました。スニペットは6〜417文字、中央値194文字で、360件中79件はYahooが切り詰めた三点リーダーで終わっていたため、description カラムは短い varchar ではなく幅広いテキスト型が適しています。タイトルは通常ページタイトルですが、360行中9行では www. python .org › downloads のような空白区切りの表示ドメインから始まっていました。url で突き合わせればこの問題は完全に避けられます。360行全体では、異なるホストが168件、https のリンクが358件、http が2件でした。

よくある使い方は、この形から自然に決まります。順位トラッキングは、単発のエクスポートではなく系列で実行すれば機能します。競合の可視性はホスト単位のグループ化です。カバレッジ監査は、同じ検索語リストを本サービスと Google Search Scraper に通してURL集合を突き合わせることです。2つのエンジンが食い違うところに、たいてい興味深いものがあります。そして業種と都市を組み合わせた検索語の結果ページは、url カラムを Email & Contact Scraper に通した時点でリード一覧になります。法的には、順位、リンク、スニペットは公開ウェブページに関する事実であり、5つのカラムのいずれも人を記述していません。ただしスニペットはインデックスされた各サイトの著作物なので、社内分析は通常の実務、再公開は別の問いになります。公開されているページのみ、データ層に第三者トラッカーは置かず、エクスポートは30日後に自動削除されます。最初の500行は無料で、クレジットカードは不要です。