https://www.otto.de を通常のクライアントで要求すると、およそ 320 KB の正常なページが返り、そこには70件ほどのスクリプトタグがある一方、配信されたマークアップに商品へのリンクは1つもありません。カタログはその後、JavaScript から届きます。HTTP ライブラリと HTML パーサーの上に組んだものは、正常なページを読みながらその中に商品を見つけられません。このサービスはブラウザと同じようにページを読み込みます。
Otto は一般に向けて販売しています。これを言っておく価値があるのは、このスキーマを共有する他のカタログ - BiggestBook、Vistaprint、Waxie - が法人向けサイトであり、それぞれ固有の理由で価格の列が空になるからです。消費者向けの店は誰に対しても価格を公開します。当社は Otto の価格を測定していないので約束もしませんが、それらのページが挙げる金額の列が空になる理由は、ここには当てはまりません。
エクスポートには price と parsed_price、sku と sku_code、image と images、url と product_url が含まれます。各組の一方は表示用、もう一方は計算用で、どちらがどちらかをインポーターを書く前に把握しておけば、書き直さずに済みます。
Livescraper は小売・供給系の一連のソースで、このスキーマを使っています。17個の名前もその順序も同一なので、インポーターは1つですべてを読めますし、2つ目のソースを追加するのは設定変更であってプロジェクトではありません。
最後の列は status で、サイトではなく当社のエクスポーターが書き込みます。取得できなかった行も理由を持って必ず届きます。3週間後に静かな欠落に気づくのではなく、入力リストと突き合わせられます。
このページの根拠となる2回の実行は、どちらも 404 が返るプレースホルダーのアドレスを送信したため、Otto の商品データは一切ありません。下の列一覧は本物で、それらのエクスポートのヘッダー行そのものです。値については記述していません。1件も見ていないからです。
このサービスの実際のエクスポートのヘッダー行から、シートの順序どおりに読み取ったものです。手元にある2回の実行はこのヘッダーの下にデータを返していないため - 表の下の注記をご覧ください - 各項目はその列が何のためにあるかを述べ、そこで止めています。
sku と対になります。このスキーマ系統では両者が独立に埋まり、同一の場合も異なる場合も観測されているため、結合キーを決める前に両方を確認してください。url とは別物です。送信したリンクがリダイレクトすれば、両者は食い違います。parsed_price を使ってください。ドイツの店では、表示形式はお使いの表計算ソフトが既定で解釈する形式ではありません。rating と同じ但し書きが付きます。両方そろっている場合は組で扱ってください。件数の裏付けのない評価は順位付けには使えません。sku_code と組になる識別子のもう一方です。query と比べればリダイレクトが、product_url と比べれば正規化が分かります。http 404 です。送信したアドレスが存在しないプレースホルダーだったからです。1行あたり17列 · 3つのファイル形式
このページの根拠は2026年7月14日と15日の2回の実行で、そのペイロードはバイト単位で同一です。どちらも https://www.example.com/product/123 - Otto のアドレスではなくプレースホルダー - を送信し、どちらも http 404 を持つ1行を返し、データ列14個はすべて空でした。つまりスキーマは確実にお伝えできますが、Otto の値については何一つお伝えできず、このページはそれを取り繕っていません。この17個の名前は当社の BiggestBook、Vistaprint、Waxie のエクスポートにも同じ順序で現れ、Waxie の実行には値が入っています。スキーマが下書きではなく実際に動いていると分かるのはそのためです。ただし Otto の列を、それらのページの値を使って説明することは意図的にしていません。あちらは法人向けサイトで、金額の列が空なのはそれぞれ固有の理由によるものであり、Otto は一般消費者向けの小売業者です。あちらの測定結果を借りてくることは、事実の衣をまとった推測にすぎません。
関心のある商品のアドレスを定期的に送信し、parsed_price、currency、実行日を保存します。価値は単独の数字ではなく系列にあります。小売業者はたいてい品揃えの幅ごとまとめて動かすもので、ブラウザのタブでは見えないその動きが表なら見えます。
エクスポートを brand でグループ化して数えます。ブランドごとの深さから、その小売業者がどこに本腰を入れ、どこは様子見なのかが分かります。バイヤーが取引先を増やす前に立てるのと同じ問いに、カタログ自身が答えてくれます。
商品データベースは識別子には強く、説明文や画像には弱いのが普通です。description、image、images が、すでに手元にある識別子を手がかりにその空白を埋めます。撮り直しは要りません。
全国規模の小売業者のカタログは、ある市場が何をどの価格帯で扱っているかを知るための、最も安価に手に入る見取り図です。name、brand、parsed_price を保存すれば、調査を発注せずにカテゴリーの輪郭がつかめます。
LIVESCRAPER10 をご利用ください。同じスキーマのもう一つの一般消費者向け小売。法人向けカタログではなく欧州の衣料市場を読むときの、自然な2つ目のソースです。
同じ17列を法人向け卸売業者に向けたもの。識別子の項目に2つの異なる番号が入り、価格はログインの先にあります。
同じスキーマで、こちらもクライアント側で描画されるカタログ。複数のソース向けにインポーターを1つ作るときに参考になります。
行の隣に置く、日付入りのページ画像。ブラウザ内で組み立てられるカタログでは価値があります。実際に何が描画されたかを示す唯一の記録だからです。
一般に公開されているページ上の商品情報は、ごく普通の競合情報です。ここで挙げておくべき注意点は、再利用について、そしてドイツのサイトはドイツのサイトである、という点についてです。
価格、商品名、ブランド、在庫状況は、販売されている品物についての事実です。どの訪問者にも配信されるページからそれを読み取ることは、買い手が手作業でしていることを実用的な速度で行うのと同じ行為です。17列のどこにも個人を表す情報はありません。氏名も、メールアドレスも、電話番号も、アカウントもないため、個人情報を扱うサービスで問題になるデータ保護の論点は、ここでは生じません。ドイツのサイトではこれをはっきり述べておく価値があります。まず尋ねられるのが GDPR だからです。GDPR が規律するのは個人データであり、商品の1行はそれに当たりません。
挙げておくべき注意点が2つあります。1つ目は再利用です。説明文や商品写真は誰かの著作物です。価格追跡、品揃えの分析、自社データとの突き合わせのために社内で使うことは一般的な実務ですが、自社のカタログとして公開するのは別の問いであり、答えも別です。2つ目はサイト自身が表明している方針です。Otto は robots.txt を公開しており、一般的なクローラーに対しては包括的な禁止ではなく、ごくわずかな限定的除外だけを記しています。したがって商品ページは、クローラーに避けるよう求めているパスには含まれていません。当社は推測せずにそのファイルを読み、一般に公開されているページにとどまり、節度ある速度で動きます。
当社の条件は、ここにある他のサービスと同じです。一般に公開されているページのみ、ログインの先には入らず、データ層に第三者のトラッカーは置かず、エクスポートは30日後に自動削除されます。最初の500行は無料で、クレジットカードは不要です。
query、sku_code、product_url、name、description、parsed_price、price、currency、availability、rating、reviews、images、brand、sku、url、image、status。送信した商品ページごとに1行です。http 404 が返るプレースホルダーのアドレスを送信したため、データ列はすべて空で返りました。それで確定できるのは17個の列名だけで、それ以上ではありません。だからこのページは各列が何のためにあるかを述べ、その値がどのようなものかは決して述べていません。https://www.otto.de への通常のクライアントからのリクエストは、およそ 320 KB の正常なページを返しますが、そこには70件ほどのスクリプトタグがある一方、配信されたマークアップに商品へのリンクはありません。カタログはその後に要求され描画されるため、HTML パーサーだけに頼るスクレイパーには、中身のない正常なページに見えます。name と description は店が印字するものであり、これはドイツの店です。これらの列の文字コードと照合順序はそれを前提に設計してください。また、表示される price はドイツ式の数値表記になります。計算のためにあるのが parsed_price です。price は表示どおりの価格、parsed_price は同じ数字を書式なしの数値にしたものです。sku と sku_code はこのスキーマ系統では独立に埋まり、同一の場合も異なる場合も観測されているため、結合キーを決める前に両方を確認してください。同じ重複が image と images、url と product_url にも当てはまります。http 404 です。CSV、JSON、Excel の3形式です。17列とその順序は、どの形式でも同じです。Otto はドイツ最大級の総合小売業者で、otto.de を通じて衣料品、家具、電化製品、家庭用品を一般消費者に販売しています。法人向け卸ではなく消費者向けの店であることは、聞こえる以上に重要です。というのも、このスキーマを共有する他のカタログ - BiggestBook、Vistaprint、Waxie - はいずれも法人向けサイトであり、それぞれに価格の列が空になる固有の理由があるからです。誰にでも売る小売業者は、誰に対しても価格を公開します。当社は Otto の価格を測定していないので、このページはそれを約束しません。ただ、それらのページに当てはまる論理はこのページには移せません。似ているからといって、検証していないことをほのめかせるよりは、そう言っておくほうがよいと考えています。
実務上の壁は、サイトの作りにあります。通常の HTTP クライアントから https://www.otto.de に要求を出すと、およそ 320 KB の成功応答が返り、そこには70件ほどのスクリプトタグがある一方、配信されるマークアップに商品へのリンクはありません。一覧は、その外枠が届いた後にクライアント側で組み立てられます。したがって HTTP ライブラリと HTML パーサーの上に組んだものは、正常なページを読みながら中に何も見つけられません。自作のスクレイパーが動いているように見えて空の行を返す、最も多い原因がこれです。このサービスはブラウザと同じようにページを読み込むので、何かを読み取る時点で商品はそこにあります。
エクスポートは商品ページごとに17列です。query、sku_code、product_url、name、description、parsed_price、price、currency、availability、rating、reviews、images、brand、sku、url、image、status。このうち4組は対になっています。表示どおりの価格と計算できる価格、2つの識別子項目、主画像とすべての画像、要求したアドレスと正規のアドレス。どちらの側を使うかをインポーターを書く前に決めておくことが、きれいに取り込めるか書き直しになるかの分かれ目です。識別子の対を確認すべきだというのは理屈だけの話ではありません。同じスキーマを使う当社の Waxie のエクスポートでは、2つの列に本当に別々の番号 - 卸業者の品番とメーカーの品番 - が入っていました。name と description にはドイツ語を、表示される price にはドイツ式の数値表記を見込んでください。
お見せできる範囲の限界については、意図してはっきり書いています。このページの根拠となる2026年7月14日と15日の2回の実行は、どちらも Otto のアドレスではなくプレースホルダーのアドレスを送信し、どちらも 404 とすべて空のデータ列で返ってきました。これはスキーマを裏づけますが - ヘッダー行は下にデータがなくても本物のヘッダー行です - Otto の値については何も裏づけません。ですからこのページのどこにも、サンプルの価格も品番も評価もありません。法的な面では、商品の1行に個人データは含まれません。ドイツのサイトでまず持ち上がるのがこの点です。説明文と写真は、著作権と再利用という別の問題です。Otto は robots.txt を公開しており、一般的なクローラーに対しては包括的な禁止ではなくごくわずかな限定的除外だけを列挙しているため、商品ページは避けるよう求められているパスには含まれていません。一般に公開されているページのみ、データ層に第三者のトラッカーは置かず、エクスポートは30日後に自動削除されます。最初の500行は無料で、クレジットカードは不要です。