必須項目が 1 つと設定が 1 つ。並べ替えの指定も、店舗や地域の選択もありません。
上限はクエリごとに適用されるため、キーワードを並べたリストではその分だけ倍になります。範囲の広いカテゴリを上限なしで実行すると長時間に及ぶことがあります。
Home Depot の掲載 1 行から得られて、検索ページのスクリーンショットからは得られないもの。
price と original_price は別々の列なので、値引き額は推測ではなく引き算になります。この 2 つを時系列で追えば、施策の形が見えてきます--いつ始まり、どこまで下げ、また戻ってきたのか。
model と sku の両方が返ります。識別子が 2 つあれば、自社カタログや他社のフィードと 1 行を突き合わせる機会も 2 回。これはたいてい、機能する結合と、行の半分を黙って落とす結合との分かれ目になります。
入力の形をどちらかに決める必要はありません。検索語、カテゴリページ、個別の商品ページを同じ実行の連続する行に並べられるので、1 つのジョブで広い調査と短い監視リストを同時にこなせます。
1 つは動かせない前提条件、1 つはこのページがどこまで断定するかという話、最後はファイルアップロードに潜む静かな落とし穴です。
このサービスにはご自身の有料レジデンシャルプロキシが必要です。実行結果が空で返ってくると、プラットフォームがその理由を示します。homedepot.com は無料のプロキシアドレスを通さないこと、PROXY_URL として設定した有料レジデンシャルアドレスが必要であること、そして実際の IP アドレスは決して使われないこと。このメッセージは空の実行のあとにしか現れません。だからこそここで先にお伝えします。そうでなければ、空の表は設定漏れではなくサービスの故障に見えてしまいます。
私たちはこのエクスポートを実測しておらず、このページもそれを装いません。以下の 12 列はサービスが宣言しているもので、宣言どおりの順序です。その中身--price が数値か文字列か、availability がどんな語を使うか、rating と reviews が素の数字なのか、original_price がどれくらいの頻度で埋まるのか--はこのページのどこにも書かれていません。突き合わせるためのエクスポートを持っていないからです。当サイトの他のページには形式を記載したものもありますが、そちらには実際の実行が裏づけとしてありました。形式についての推測の上にパイプラインを組む前に、小さく試してご自身のヘッダー行を読んでください。
ファイルアップロードは、思っているより少ししか読み取りません。CSV・XLSX・TXT・Parquet が選べますが、Parquet はブラウザ側で拒否され、URL を貼り付けるか他の 3 形式を使うよう案内されます。CSV と TXT では各行の最初の列だけを取るため、URL が B 列にある表をアップロードすると、A 列の内容が並んだリストとして読み込まれます。XLSX も先頭シートに対して同じ挙動です。読み取られた内容は入力欄にすでにあるものと統合され、重複が除かれます--知っていれば便利で、知らなければ意外に映る動きです。
これはサービス自身の列一覧を、その並び順のまま示したものです。各列が何のためのものかは説明しますが、値がどんな形をしているかは意図的に書きません。
url が使われます。price と併せて読むと値引き額が得られます。どれくらいの頻度で埋まるかはお伝えできません。このサービスを実行していないためです。sku とは別に宣言されているため同じ番号ではありませんが、それぞれがどの採番体系かについては、エクスポートを目の前にせずにこのページが断定することはありません。model と並んで宣言されている 2 つ目の識別子。予備の結合キーとして有用です。どちらもここで詳しく説明しない理由は model の記載をご覧ください。これらは宣言された列であり、実測された列ではありません。このページの他の記述はすべて、サービス自身の列一覧か、ご自身でも確認できるプラットフォームのインターフェースのいずれかに基づいています。エクスポートに基づくものは 1 つもありません。このサービスのエクスポートを持っていないからです。だからこそ上には型も形式も値の語彙も充足率も書かれていません--availability や price についてのもっともらしい推測は、正直な空白よりも価値が低いからです。それでも当てにできることが 2 つあります。列一覧そのものは 12 で固定されており、JSON でも Excel でもダウンロードはこれを土台に作られるため、ヘッダー行に驚かされることはありません。そして有料レジデンシャルプロキシを設定するまで、実行は何も返しません。このサービスが空に見える理由としては、これが群を抜いて多いものです。まず小さく実行し、ご自身のヘッダー行を読み、それを後続すべての仕様として扱ってください。
いずれも、Home Depot の検索窓にそのまま入力するような内容から始まります。
カテゴリの URL を貼り付けて定期実行し、price を original_price の隣に保持します。両者の差が施策そのものであり、カテゴリ全体で見るほうが単一商品を見るより多くを語ります。
キーワードや商品 URL をアップロードし、結果を model または sku で自社カタログに結合します。識別子の列が 2 つあるということは、一方で一致しなかった行にもう一度チャンスがあるということです。
カテゴリを広く上限なしで実行すると、品揃えが行データで返ります--ブランド、価格帯、評価、レビュー件数がまとめて手に入ります。特定商品の値段とは別の問いであり、先に立てるべきなのはこちらです。
プラットフォーム上の他のスクレイパーと同じ均一料金です。プランもシートも月額の最低額もありません。
新規アカウントごとに 1 回だけ。クレジットカードは不要です。すべてのスクレイパーが利用可能で、本格的に組み込む前にプロキシ設定を確認し、このサービスの実際のヘッダー行を自分の目で読むには十分な量です。
1,000 商品でおよそ $2。ここにある他のスクレイパーと同じ均一料金です。上限はクエリごとに適用されるため、キーワードを並べたリストではその分だけ倍になります。空欄のままにするとすべて取得します。
数点の商品を確認するのではなく、小売の品揃えを継続的に追跡するチーム向けに、ボリューム価格・SLA・専用ワーカー・個別の統合をご用意します。想定される数量をお知らせいただければお見積もりします。
LIVESCRAPER10 をご利用ください。こちらは商品の行を返します。以下は、その先にあるものや、競合の同じ売り場を返します。それぞれ独自のスキーマを持ちます。
自然な次の一手です。このページは商品とそのレビュー件数を返し、あちらはレビュー本文そのものを返します。別の エンドポイント上の別サービスで、列一覧も独自のものです--一致していると決めつけず、両方のデータ辞書をお読みください。
最も近い競合の同じ売り場です。同じカテゴリを両方で実行することで、価格比較が印象論でなくなります。ただし 2 つのサービスはそれぞれ独自のスキーマを持つため、列の位置ではなくご自身の識別子で突き合わせてください。
3 社目のホームセンターです。2 社の比較で判断がつかないときに役立ちます。スキーマについては上と同じ注意を--各サービスの列一覧はそのサービス固有のものとして扱ってください。
短く答えると、これは公開されている商品掲載情報であり、12 列のどれも人を説明していません。
これらの列にあるものはすべて、homedepot.com の公開検索ページや商品ページで誰にでも表示されている内容です。ログインは使わず、ペイウォールも越えず、アカウントにも触れません。公開されている商品情報や価格情報を調査や比較のために収集することは長年確立されてきた実務であり、価格の透明性はその中でも分かりやすい事例のひとつです。
このエクスポートに個人データは含まれません。どの列も商品を説明します。名称、ブランド、2 つの価格、評価と件数、2 つの識別子、リンク、画像、在庫状況です。宣言された一覧のどこにもレビュー投稿者も出品者名も担当者名もメールアドレスも含まれておらず、これは当サイトの多くのページについては言えないことです。評価は顧客が述べた内容の集計値であって発言そのものではありません。個々のレビューが必要であれば、それは上でリンクした別サービスであり、より重い責任を伴います。
ご自身の有料レジデンシャルプロキシを経由するという要件は、法的というより技術的な利用条件ですが、シグナルとして読む価値はあります。Home Depot は自動アクセスの制御に実際の労力を割いており、その利用規約が適用されます。規模を拡大する前に規約を確認し、収集量は実際に行っている調査に見合った範囲にとどめ、公開価格をカタログ丸ごとの再公開の許諾とみなさないでください。データ層でサードパーティのトラッカーは動かしておらず、エクスポートは 30 日で自動削除されます。
Home Depot 商品スクレイパーは、homedepot.com の検索を表計算データに変えます。キーワードまたは Home Depot の URL を 1 行に 1 件ずつ、自由に混在させて送信するか--カテゴリページも個別の商品ページも同様に受け付けます--CSV・XLSX・TXT ファイルとしてアップロードし、クエリごとの上限を設定すると、掲載商品が 1 行として返ってきます。商品名、ブランド、価格と参考価格、評価とレビュー件数、モデル番号と SKU、ページへのリンク、画像、在庫状況です。12 列、商品 1 点につき 1 行、JSON または Excel でダウンロードできます。
使い勝手を決めるものが 2 つあり、どちらも最初の実行の前に知っておく価値があります。1 つは、このサービスがご自身の有料レジデンシャルプロキシを PROXY_URL として設定することを求める点です。Home Depot は無料のプロキシアドレスを通さず、設定のない実行は空で返ります。プラットフォームがその理由を説明するのは事後であり、だからこそここでは先に書いています。もう 1 つは、このページが宣言された列一覧を記載し、そこで意図的に止まっている点です。このサービスの実行結果を手元に持っていないため、データ型も値の形式も availability の語彙も original_price が埋まる頻度も、ここでは一切断定しません。当サイトの他のいくつかのページは実測した形式を記載していますが、それは読み取れる実行があったからです。このページは、それが無いことを正直に述べます。まず小さく実行し、ご自身のヘッダー行を仕様としてください。
列一覧から分かることだけでも十分な価値があります。price と original_price が別々の列で届くため、値引きは推論ではなく計算になり、この 2 つをカテゴリ全体で時系列に追えば、瞬間の断面ではなく施策の形が見えてきます。model と sku が別々に宣言されているということは、1 行を自社カタログや競合のフィードに突き合わせる機会が 2 回あるということで、これはたいてい、信頼できる一致率と、黙って行を落とす一致率との分かれ目になります。そしてキーワードと URL が同じ入力欄を共有しているため、1 つのジョブで広いカテゴリ調査と特定商品の短い監視リストを同時に扱えます。
実務上の注意をいくつか。上限は初期値 100、最小値 1 を受け付け、実行単位ではなくクエリ単位で適用されるため、キーワードを並べたリストではその分だけ倍になります。すべて取得するには空欄にしますが、範囲の広いカテゴリを上限なしで実行すると長時間に及ぶことがあります。ファイルアップロードは CSV・TXT・XLSX の最初の列しか読まず、Parquet はブラウザ側で拒否されるため、URL は A 列に置いてください。並べ替えの指定も店舗・地域の選択もないため、順序はダウンロード後に整えてください。法的な観点では、このエクスポートは際立って扱いやすいものです。どの列も人ではなく商品を説明し、宣言された一覧にレビュー投稿者も出品者も担当者もメールアドレスも現れません。それでも自動アクセスには Home Depot の利用規約が適用されます。規模を拡大する前にお読みください。無料で始められます。最初の 500 行は費用もカードも不要で、以降は 1 行 $0.002 の従量課金です。現在の料金は料金ページをご覧ください。