欄は 1 つではなく 2 つ - 何を探すか、そしてどこで。プラットフォームが両者を組み合わせるので、すべてのカテゴリーがすべての地域で検索されます。
2 つのリストは直積として組み合わされます。10 カテゴリー × 20 都市は 30 件ではなく 200 件の検索です。どちらかの欄に長いリストを貼り付ける前に、辞書の下の注記を読んでください。
欧米の地図製品は中国本土の掲載が手薄です。それらの拠点があるのは百度であり、だからこそ中国国内の拠点データセットを作る出発点として現実的なのはここしかありません。
2 つのリストを渡せば、ジョブがその格子を巡ります。20 都市にわたるカテゴリー調査は、後で縫い合わせる 20 個のジョブではなく、出力ファイル 1 つの 1 ジョブになります。
どの行にも百度自身の拠点識別子が入っています。それがあるからこそ 2 回目の実行が 1 回目と比較可能になり、あいまい照合が必要な名前の山を新たに受け取らずに済みます。
下の列の一覧は確かです。セルに何が入っているかについて、このページは推測しません。その理由には 2 段落を割く価値があります。
9 つの名前とその順序は、2 週間離れて実行された 5 つの別々のエクスポートのヘッダー行から来ており、それらは完全に一致しています。これはこのスクレイパーについて私たちが持つ最も強い証拠です - そしてそれは 2 つではなく 1 つの情報源であり、それははっきり言っておくべきことです。ここのほとんどのページと違い、突き合わせるべき公開された列一覧が存在しません。
持っていないのは、データの入ったエクスポートです。百度地図は中国でホストされ、中国国外のデータセンター IP を遮断します。ここに保管されている実行はすべて中国出口のプロキシなしで行われたため、どれもヘッダー行だけでその下には何もない状態で返ってきました。これは仕様どおりの挙動であり、不具合ではありません。つまりこのページは、各列が何のためのものかは伝えられますが、その値がどんな形をしているかは伝えられません。ですから以下に型も単位も形式も例も見つかりません。ご自身のプロキシで 1 つの都市の 1 つのカテゴリーに実行を向け、最初に得たファイルを読んでください。
エクスポートのヘッダー行を、その順序で。説明は各フィールドが何のためのものかを述べるだけで、その形式、単位、値の種類については意図的に何も主張していません - 上の注記をご覧ください。
category と合わせて、その行がどの検索に属するかを教えてくれます。category ではありません。同じ行で両者が食い違うことがあります。上の表を前提に計画を立てる前に、これを読んでください。このスクレイパーについて手元にある実行エクスポートは、どれも空で返ってきました - いずれもこのヘッダー行だけで、その下にデータ行はありません。原因は不具合ではありません。百度地図は中国でホストされ、中国国外のデータセンター IP を遮断します。レジデンシャルプロキシ - できれば中国出口のもの - なしの実行は、エラーを出すのではなく完了して何も返しません。ですから 9 つの名前は確かであり、ここにあるそれ以外は確かではありません。私たちはどの列についても充填率も例示値も形式も公表しません。それは座標にも当てはまり、そして噛みついてくるのは座標です。地図サービスがすべて同じ測地系で位置を公開しているわけではなく、2 つの数値を GPS のベースマップに落とすのは一行で済む操作ですが、測地系が違えば自信たっぷりに間違った地図ができあがります。このページはそれらがどの座標系かを教えません。データの入ったセルを見ていないからです。最初の本番実行のときに、知っている住所をいくつかご自身のベースマップと突き合わせてください。下流の何かがその答えに依存する前に。
入力リストは 2 つ、上限は 1 つ。リストは直積として組み合わされるため、上限は実行ごとではなく検索ごとに効きます。ジョブの費用を決めるのはその数値です。
チームが中国の拠点データを使って、実際に抱えている問いに答えている例をいくつか。
1 つのカテゴリーを都市のリストに当てれば、市場ごとに比較できる件数が 1 つのファイルにまとまります。組の両方がどの行にも入っているので集計軸は最初からそこにあり、その拠点がどの検索から来たかを後から復元する必要はありません。
入力欄はカテゴリーと同じようにブランドも受け付けます。複数都市にわたるチェーンの店舗が、拠点ごとの安定した ID 付きで 1 つの表として返ります - それが次回の実行を、やり直しではなく比較にします。
欧米の情報源から作った拠点データセットは、中国国内で急に薄くなります。同じカテゴリー一覧をここで実行して追加するのが、その穴を埋める現実的な方法です - 上の座標の問題を片づけたうえで。
サブスクリプションも、最低利用額も、毎月の請求もありません。最初の 500 行は当社負担です。その後は従量課金で、ここにある他のスクレイパーとまったく同じ均一料金です。
新規アカウントごとに初回 1 回。クレジットカード不要。クエリごとの上限、ファイルアップロード、すべての書き出し形式を含みます。
1,000 拠点でおよそ 2 ドル。事前の見積り表示が、実行を開始する前に行数とクレジット費用を示します。ここでは二度見する価値があります。入力リストが 2 つあると、思っている以上の検索数に膨らむからです。
継続的なモニタリングや非常に大きな過去データの取得のための、ボリューム料金、専用ワーカー、SLA。ご要望の規模をお知らせいただければお見積りします。
LIVESCRAPER10 をご利用ください。短い答え:掲載は公開された事業者情報です。ただしこれは中国のデータを持つ中国のサービスであり、そのぶん「どの規則を気にすべきか」が変わります。
百度地図の掲載は、検索した人には誰にでも表示されます。名称、住所、電話番号、カテゴリーは、まさにその拠点が見つけてもらうために公開している内容です。公開されている事業者掲載を市場調査のために収集することは長く確立された実務であり、このスクレイパーはログインにもアカウントにも有料の壁にも触れません。
ここで違うのは法域です。サービスは中国でホストされ、データは中国の事業者を記述しており、百度自身の規約は自動アクセスを制限しています。つまりこれは法律の問題であると同時に規約の問題でもあり、しかもこのサイトの読者の多くが慣れている規約ではありません。結果を中国の外へ持ち出すのであれば、越境移転は独自の規則を持つ現実の論点であって後回しにできるものではなく、パイプラインがその答えに依存する前に有資格者に相談する価値があります。私たちはその助言をする立場になく、この段落もその助言ではありません。
個人データの面では、返る行は事業者のレコードであり、その大半はこの論点の外にあります - ただし phone はやはり連絡先番号であり、個人事業主や小さな店では、その番号が特定の個人につながることがよくあります。分析の対象が連絡先ではなくカバレッジと立地であれば、取り込み時にその列を捨ててください。そうすればこの問題はあなたのものではなくなります。当社はデータ層でサードパーティのトラッカーを一切動かしておらず、書き出したファイルは 30 日で自動的に削除されます。
最もよくいただく質問です。ほかにもあれば ご連絡ください - 回答を書いているのはボットではなく人間です。
Livescraper の百度地図スクレイパーは、地図検索を拠点データに変えます。探したいカテゴリーやブランドと、探す地域という 2 つのリストを渡すと、プラットフォームがそれらを組み合わせ、すべてのカテゴリーをすべての地域で検索します。地域は 1 行に 1 件ずつ入力しても、CSV、XLSX、TXT、Parquet ファイルとしてアップロードしても構いません。検索ごとの行数に上限をかけ、結果をきれいな CSV、Excel、JSON としてダウンロードできます。
各行は 9 列を運びます。送信したカテゴリーと地域、拠点の名称、住所、電話番号、百度自身のカテゴリータグ、緯度と経度、そして百度による拠点の識別子。最後の列こそが、繰り返しの実行をやり直しではなく比較にするものです。店舗が名前を変えても残るからです。
出店チームは 1 つのカテゴリーを都市のリストに当てて、市場ごとに比較できる件数を 1 つのファイルにまとめます。小売チームは同じ欄にブランドを入れて、チェーンの本土店舗を地図に落とします。データエンジニアは、欧米の情報源から組み立てた拠点データセットで本土のカバレッジが急に薄くなる部分、その中国の穴を埋めるために使います。
これを土台にする前に知っておくべきことが 2 つあります。このスクレイパーにはレジデンシャルプロキシ、できれば中国出口のものが必要です。百度地図は中国でホストされ、中国国外のデータセンター IP を遮断するため、プロキシがなければ実行はエラーを出すのではなく完了して何も返しません。そして、ここに保管されているエクスポートがどれもデータのないヘッダー行として返ってきたため、このページは 9 列の名前を挙げてそれぞれが何のためのものかを述べる一方、いずれについても型や単位や形式を主張しません。座標も同様で、GPS データと結合する前に、ご自身の最初の実行から測地系を確かめてください。無料で始められます。最初の 500 行は費用もクレジットカードも不要で、その後は 1 行 0.002 ドルの均一料金です。