入力は製品ページそのものです。ほしい品目を指定すれば、ジョブが 1 件ずつ読み取り、行ったリクエストのすべてについて結果を返します。
1 製品につき 1 行で、どのクエリから来たかが各行に記録されます。長いリストをまとめて実行しても、入力ファイルと必ず突き合わせられます。
たいていのスクレイパーは、リクエストの失敗を「何も返さない」という形で示します。それはデータを持たない製品と見分けがつきません。これはどちらの場合も行を書き、結果を読める文章として status に入れます。URL の誤り、移動したページ、通らなかったリクエスト--いずれも列を読めば分かります。
17 列はこの系統で最も広く、そのうち 4 組がほぼ重複した対になっています--sku_code と sku、product_url と url、parsed_price と price、images と image。私たちは対の存在を示すだけで、両者の違いを創作しません。データ辞書には、それぞれについて言えることと言えないことを正確に書いてあります。
並び順もフィルタもありません--URL のリスト以外にこのフォームが求めるのは、クエリごとの上限だけです。知っておく価値があるのは、それが初期値 100 で埋まった状態で届くこと。すべて取るには、届いたままにするのではなく欄を空にする必要があります。
各行は、サイトが公開しているとおりの製品ページと、それを取ってきたリクエストの結果です。
下の列一覧は裏付けが揃っています--プラットフォームが公開している配列、保存済み実行の JSON キー、そのワークブックのヘッダー行が、いずれも同じ 17 個の名前を同じ順序で持っています。裏付けがないのは、そこに何が入るかです。そして表の下の注記こそがこのページの要点です。パーサーを書く前に読んでください。ほぼ重複した対を 4 組も含む 17 列は、自分の最初の数行を見ることが最も報われる形だからです。
プラットフォーム自身の列一覧を、実際の実行の JSON キーおよびワークブックのヘッダー行と突き合わせたものです。説明は各項目が何のためのものかを述べるだけで、形式については何も主張しません--下の注記をご覧ください。
sku と、この表の下の注記をご覧ください。url をご覧ください。currency と並んで価格の列が 2 つあります--下の price をご覧ください。image をご覧ください--スキーマは両方を持っています。sku_code の両方を自分の最初の数行で確かめてから、どちらかを選んでください。product_url は空でした。これはエラー時の挙動の手がかりであって、成功した行の説明ではありません。名前は確かです。値はここでは説明しません。その理由はかなり具体的です。3 つの独立した情報源が同じ 17 個の名前を同じ順序で持っています--プラットフォームが公開している配列、保存済み実行の JSON キー、そのワークブックのヘッダー行。ところがその保存済み実行は、Brady Industries ではなくプレースホルダーのアドレスに向けられていました。そして status に http 404 を載せて返ってきました。スキーマは裏付けられ、status 列が機能することも分かります。しかしこの販売店のカタログについては何一つ語っておらず、このページもそれ以上を装いません。4 組のほぼ重複した対が説明されないままなのも同じ理由です--sku_code と sku、product_url と url、parsed_price と price、images と image。すべて実在しますが、その違いを創作すれば推測になります。仕組みが全行で保証する列は query だけです。無料枠で製品をいくつか走らせ、まず status を読み、それから各対のどちらが埋まっているかを見てください--5 分の確認が、書き直しを防ぎます。
URL のリスト以外にこのフォームが求めるのは、クエリごとの上限だけです--並び順もフィルタもありません。それが決めるのは、実行の費用とファイルに入る量です。
販売店のカタログデータを、現場が実際に抱えている問いに答えるために使っている例をいくつか。
見積書や発注ガイドにある製品 URL を投入すれば、名称・価格・通貨・在庫状況が横並びで得られます。仕入先のリストが並べ替えられるものになり、前回から動いた品目は記憶ではなく差分になります。
まず status で絞り込みます。古くなった URL も行は作るので、この列に一度目を通すだけで、本当に何も公開していない製品と、もう解決しないリンクとを分けられます--どちらかがレポートの数字になってしまう前に。
同じ URL のリストを一定の間隔で再実行し、何が変わったかを読みます。価格も在庫状況も在庫コードもすべて同じ行にあるので、変化は誰かが気づく必要のあるものではなく、2 つのエクスポートの差として現れます。
サブスクリプションも、最低利用額も、毎月の請求もありません。最初の500行は当社負担 - その後は従量課金で、ここにある他のスクレイパーと同じ均一料金です。
新規アカウントごとに初回のみ。クレジットカード不要。クエリごとの上限、ファイルアップロード、すべてのエクスポート形式を含みます。
1,000製品あたり約 $2。事前見積もりが実行開始前に行数とクレジット費用を表示します - 想定外の請求も、換算が必要な計算ユニットもありません。
継続的なモニタリングや非常に大規模なカタログ取得向けに、ボリューム料金、専用ワーカー、SLA をご用意します。ご希望の規模をお知らせいただければお見積もりします。
LIVESCRAPER10 をご利用ください。短い答え--公開カタログについては合法です。そしてこのエクスポートには、アカウント・顧客・注文のデータは一切含まれません。
ここで収集する項目は、製品ページを開いた誰にでも公開されているものです--名称、説明、価格、在庫状況、ブランド、識別子。公開されたカタログデータの収集は長く確立された実務であり、ここではログインもアカウントも決済も一切扱いません。
この出力に個人データはありません--商品のテーブルです。顧客名も、注文履歴も、交渉価格もありません。いずれも公開されていないからです。ログイン後にあなたのアカウントに見えているものは、これが読むものではありません。それは回避すべき制限ではなく、意図した線引きです。
Brady Industries の利用規約は自動アクセスを制限しているため、これは法律の問題であると同時に契約の問題でもあります。同社にアカウントや取引関係がある場合は規約を確認してください。データ層でサードパーティのトラッカーは一切動かしておらず、エクスポートは 30 日で自動的に削除されます。
最もよくいただく質問です。ほかにご不明な点は お問い合わせください - 回答を書いているのはボットではなく人間です。
Livescraper の Brady Industries Products Scraper は、製品 URL のリストを 1 枚の表に変えます。1 行に 1 件ずつ貼り付けるか、CSV、XLSX、TXT、Parquet でアップロードし、クエリごとの上限を設定するか、すべて取るなら空にして、結果を整った CSV、Excel、JSON ファイルとしてダウンロードします。リクエストは自分のアドレスではなく共有プロキシプールを通ります。
各行が 1 つの製品ページです。名称と説明、通貨を伴う価格の項目 2 つ、在庫状況、ブランド、在庫コードの項目 2 つ、評価とレビュー数、画像の項目 2 つ、リンクの項目 2 つ。17 列はこのカタログ系スクレイパーの中で最も広く、そのうち 4 組はほぼ重複した対です。このページはそれを説明せずに指摘するにとどめます--説明の根拠になる中身入りのエクスポートが存在しないからです。
知っておく価値があるのは 17 番目の列です。status はリクエスト自体がどう処理されたかを読める文章で記録し、何も返さなかった URL も消えるのではなく行を作ります。これにより、古くなったリンクはレポートの中の静かな欠落ではなく、絞り込める対象になります。新しいリストを扱うとき、まずこの列を読むべき理由がそこにあります。
先に実務上の注記を一つ、そしてこれが誠実なところです。このサービスの保存済み実行は Brady Industries ではなくプレースホルダーのアドレスに向けられており、http 404 を返しました。17 個の列名--プラットフォームの公開一覧、実行の JSON キー、ワークブックのヘッダー行が一致している点--は裏付けられ、status 列が働くことも示されますが、この販売店のカタログについては何も語りません。作り込む前に、無料枠で製品をいくつか走らせて最初の数行を読んでください。最初の 500 行は無料でクレジットカードも不要、以降は 1 行 0.002 ドルの均一料金です。