Decathlon Produkt-Scraper

Eine Kollektions-URL rein,
eine Zeile je Variante raus.

Die meisten Katalog-Scraper geben Ihnen eine Zeile je Produkt. Dieser geht eine Ebene tiefer: Übermitteln Sie eine Kollektionsseite, und Sie bekommen eine Zeile für jede Größe und Farbe - jede mit eigener SKU, eigenem Preis und eigenem Bestandsstatus.

einmalig 500 Zeilen gratisdanach 0,002 $ pro Zeileeine Kollektions-URL fächert in Varianten aufCSV · JSON · Excel
So funktioniert es

Eine Liste von URLs rein, eine Tabelle raus.

  1. SCHRITT 1Melden Sie sich auf der Plattform an.
  2. SCHRITT 2Öffnen Sie den Decathlon Products Scraper.
  3. SCHRITT 3Fügen Sie die gewünschten Decathlon-URLs ein, eine pro Zeile - eine Kollektionsseite liefert jedes Produkt darin, und jede Variante jedes Produkts.
  4. SCHRITT 4Wählen Sie Ihr Ausgabeformat (CSV / JSON / XLSX).
  5. SCHRITT 5Starten Sie den Job.
  6. SCHRITT 6Laden Sie die Ergebnisse herunter - siebzehn Spalten je Zeile.
Was Sie erwartet

Was man wissen sollte, bevor man ihn laufen lässt.

Eine Kollektions-URL, sechsundsechzig Zeilen

Unser Lauf übermittelte eine einzige Kollektionsseite für Herrenhandschuhe und bekam 66 Zeilen zurück, alle mit ok, verteilt auf zehn verschiedene Produkte - je zwischen 4 und 12 Zeilen. Das vom Anbieter veröffentlichte Testbeispiel für diesen Dienst ist genau dieselbe Kollektions-URL; das Auffächern ist also der vorgesehene Arbeitsablauf und kein Nebeneffekt unserer Fragestellung.

Die Zeile ist eine Variante, kein Produkt

Das ist der Teil, der Ihr Datenmodell verändert. Jede Zeile ist eine Größe und Farbe - mit eigener sku, eigener availability und einem name, der das Suffix trägt, etwa … Steel Blue / XS. Zwölf unserer Zeilen teilten sich eine product_url. Gruppieren Sie nach product_url, wenn Sie Produkte wollen; behalten Sie die Zeilen, wenn Sie die Größenkurve wollen.

Der Bestand gilt je Größe, und das ist der nützliche Teil

Über unsere 66 Zeilen hinweg kamen 39 als InStock und 27 als OutOfStock zurück - bei Produkten, die nominell verfügbar sind. Ein Scraper auf Produktebene würde alle zehn dieser Produkte als lieferbar melden. Hier sehen Sie, dass eine bestimmte Farbe in L fehlt und in M nicht, und das ist der Unterschied zwischen einem Bestandsbericht und einem, mit dem sich arbeiten lässt.

rating und reviews sind leer, und dafür gibt es einen Grund

Beide Spalten sind auf allen 69 unserer Zeilen leer. Wir haben nachgesehen, warum: Ein Abruf einer dieser Produktseiten liefert einen strukturierten Datenblock, der das Produkt und jede Variante beschreibt - und der überhaupt keine Bewertung und keine Rezensionszahl enthält. Die Spalten sind leer, weil die Seite die Werte nicht veröffentlicht, nicht weil der Lauf gescheitert wäre. Planen Sie also keinen Rezensions-Arbeitsablauf um diesen Dienst herum.

Die Marken sind Decathlons eigene

Unsere 66 Zeilen trugen vier Markenwerte - Forclaz auf 40, Wedze auf 14, Quechua auf 6 und Kiprun auf 6. Das sind Decathlons Eigenmarken; die Markenspalte gruppiert also einen Katalog, statt einen Hersteller zu benennen, den Sie anderswo nachschlagen könnten. Wenn Ihr Arbeitsablauf der Abgleich über Händler hinweg ist, ist das die falsche Quelle; für die Sortimentsanalyse von Eigenmarken ist es eine gute.

Eine Zeile unseres Laufs war die Kollektionsseite selbst

Ein zweiter Lauf auf dieselbe URL lieferte eine einzelne Zeile, die die Seite beschreibt - Name „Men's Gloves“, das Decathlon-Logo als Bild, keine sku und keine product_url. Sie ist zugleich die einzige Zeile, deren price ein Währungssymbol trägt. Filtern Sie vor dem Aggregieren darauf, dass sku vorhanden ist, dann fällt diese Zeile sauber heraus.

Was Sie zurückbekommen

Siebzehn Spalten, fünfzehn davon gefüllt.

Aus einem echten Export gelesen, in Blattreihenfolge. Die Zahlen unten stammen aus unserem Kollektionslauf mit 66 Zeilen; wo hier steht, dass eine Spalte einen Wert trug, beschreibt das Zeilen, die wir tatsächlich halten.

query
Die Decathlon-URL, die Sie übermittelt haben. Bei einem Kollektionslauf ist das auf allen 66 Zeilen derselbe Wert, und genau das trennt eine Kollektion von der anderen in einem zusammengelegten Export. Bei einem so tiefen Auffächern ist es die einzige Spalte, die den gesamten Ergebnissatz gruppiert.
sku_code
Die eigene Artikelnummer der Variante. Auf jeder Produktzeile gefüllt und auf jeder verschieden - 66 Zeilen, 66 Werte. Sie ist auf jeder Zeile, die wir halten, identisch mit sku, anders als auf unseren Distributorenseiten, wo die beiden Spalten unterschiedliche Nummerierungen tragen.
product_url
Die Produktseite, zu der die Variante gehört. Zehn verschiedene Werte über unsere 66 Zeilen hinweg - nach dieser Spalte gruppieren Sie, wenn Sie Produkte statt Varianten wollen.
name
Der Produkttitel mit angehängtem Variantensuffix, etwa Forclaz Adult MT500 Touchscreen Stretch Backpacking Gloves - Steel Blue / XS. Farbe und Größe nach dem Bindestrich unterscheiden eine Zeile von ihren Geschwistern.
description
Der Highlight-Text der Anzeige. Auf unseren Produktzeilen gefüllt und über die Varianten eines Produkts hinweg identisch - er beschreibt das Produkt, nicht die Größe. Die Längen reichten in unserem Lauf bis knapp unter 400 Zeichen.
parsed_price
Der Preis als nackte Zahl. Auf jeder Produktzeile gefüllt. Damit rechnen Sie; die Varianten eines Produkts trugen in unserem Lauf denselben Wert, lesen Sie ihn aber je Zeile, statt das vorauszusetzen.
price
Derselbe Betrag, und auf den Produktzeilen kommt er ohne Währungssymbol an - die einzige Ausnahme in unserem Export ist die Zeile auf Seitenebene, die $49.99 trug. Lesen Sie currency, statt aus der Zeichenkette zu schließen.
currency
Die Währung, in der der Preis angegeben ist - USD auf jeder Produktzeile unseres Laufs. Lesen Sie sie, statt sie anzunehmen: Decathlon betreibt nationale Shops, und die Spalte existiert genau deshalb, weil die Antwort nicht immer dieselbe ist.
availability
InStock oder OutOfStock, je Variante. Unser Lauf teilte sich 39 zu 27. Diese Spalte macht es lohnend, den Dienst nach Zeitplan statt einmalig laufen zu lassen.
rating
Auf allen 69 Zeilen leer. Die Produktseiten veröffentlichen in ihren strukturierten Daten keine Durchschnittsbewertung - wir haben eine direkt geprüft und keine gefunden. Behandeln Sie die Spalte für diese Quelle als nicht vorhanden.
reviews
Vorgesehen für die Anzahl der Bewertungen, mit demselben Vorbehalt wie bei rating.
images
Jedes Bild der Anzeige, durch Semikolon getrennt. Unsere Zeilen trugen zwischen 1 und 25 URLs, und die Varianten eines Produkts teilen sich dessen Galerie, statt je ein Foto der eigenen Farbe zu haben.
brand
Die Decathlon-Eigenmarke - in unserem Lauf Forclaz, Wedze, Quechua und Kiprun. Nützlich zum Gruppieren eines Eigenmarkenkatalogs, nicht zum Abgleich eines Produkts mit einem anderen Händler.
sku
Der Variantenidentifikator. Auf jeder Zeile, die wir halten, derselbe Wert wie sku_code. Behalten Sie beide, wenn Sie einen Importer für mehrere unserer Katalogdienste schreiben, wo sie oft abweichen; hier genügt einer.
url
Die Adresse, aus der die Zeile entstanden ist. Auf unseren Produktzeilen entspricht sie product_url - die Zeile zeigt auf ihre eigene Produktseite, nicht auf die Kollektion, aus der sie stammt.
image
Das Hauptbild für sich, sodass der Normalfall ohne Zerlegen von Zeichenketten auskommt. Geprüft: Auf jeder Zeile ist es der erste Eintrag von images.
status
Ein Kennzeichen je Zeile, geschrieben von unserem Exporter, nicht von Decathlon. Über unsere vier Läufe hinweg nahm es zwei Werte an: ok auf 67 Zeilen und http 404 auf 2, letztere von einer Platzhalteradresse, die es nicht gibt. Gleichen Sie über diese Spalte ab und nicht über die Zeilenzahl, die ein Varianten-Auffächern für sich genommen bedeutungslos macht.

Siebzehn Spalten je Zeile · CSV, JSON oder Excel

Worauf Sie Ihren Importer auslegen sollten: Eine Zeile ist eine Variante. Eine Kollektions-URL erzeugte in unserem Lauf 66 Zeilen über zehn Produkte - je 4 bis 12 Zeilen - mit Größe und Farbe im Suffix von name und dem Bestand je Zeile entschieden. Genau deshalb lohnt availability: 39 dieser 66 waren verfügbar und 27 nicht, bei Produkten, die ein Scraper auf Produktebene als lieferbar gemeldet hätte. Zwei Spalten sind aus einem Grund leer, den wir geprüft und nicht geraten haben. Ein Abruf einer der Produktseiten liefert einen strukturierten Datenblock, der das Produkt beschreibt und jede Variante mit eigenem Preis, eigener Währung und eigenem Bestand auflistet - und der nirgends eine Bewertung oder eine Rezensionszahl trägt. rating und reviews sind leer, weil die Quelle sie nicht veröffentlicht.

Häufige Arbeitsabläufe

Wofür Zeilen auf Variantenebene gut sind.

Größenkurven-Monitoring

Sehen, welche Größen tatsächlich ausverkauft sind

Der Bestand kommt je Variante, ein wöchentlicher Lauf sagt Ihnen also, dass eine Farbe in M und L weg ist, während XS im Regal liegt. Das ist die Form der Nachfrage innerhalb eines Produkts, und für jeden Scraper, der einen Verfügbarkeitswert je Produktseite meldet, ist sie unsichtbar.

Merchandising · Bestand
Eigenmarken-Recherche

Ein Eigenmarkensortiment kartieren

Vier Marken deckten unseren ganzen Lauf ab - Forclaz, Wedze, Quechua und Kiprun. Gruppieren Sie nach brand und product_url, und ein paar Kollektions-URLs geben Ihnen die Form einer Eigenmarkenreihe: wie viele Produkte, wie viele Varianten je Produkt, zu welchen Preisen.

Sortiment · Kategorienrecherche
Preisverfolgung

Preisen über eine Kollektion hinweg folgen

parsed_price ist eine nackte Zahl, und currency sagt Ihnen, worin sie ausgedrückt ist; ein geplanter Kollektionslauf erzeugt also eine saubere Preisreihe ganz ohne Zeichenkettenreinigung. Unser Lauf enthielt sieben verschiedene Preise über zehn Produkte.

Preisgestaltung · Monitoring
Katalogaufbau

Einen Produktfeed mit Bildern füllen

images trug bis zu 25 URLs je Zeile, und image ist nachweislich die erste davon; Sie können also einen Feed mit Aufmacherbild und Galerie bauen, ohne für den Normalfall Zeichenketten zu zerlegen. Die Beschreibung wiederholt sich über die Varianten eines Produkts, und genau das will man in einem Feed.

Feeds · Inhalte
Preise

Zahlen Sie nur, was Sie tatsächlich nutzen.

Gratis-Kontingent

Die ersten 500 Zeilen sind gratis

Einmalig, bei der Anmeldung. Keine Karte, und nichts, was danach gekündigt werden müsste.

Einmalig, bei der Anmeldung
Preis

danach 0,002 $ pro Zeile

Abgerechnet nach tatsächlich gelieferten Zeilen - hier planenswert, weil Varianten sich vervielfachen. Eine Kollektions-URL erzeugte in unserem Lauf 66 Zeilen, und 66 Zeilen würde sie kosten.

Abgerechnet nach gelieferten Zeilen
Kein Abo

Nichts Wiederkehrendes

Guthaben verfällt nicht im Monatsrhythmus. Erfassen Sie die Wintersaison im Oktober und danach nichts mehr bis zum Frühjahr, wenn die Arbeit so aussieht.

Kein monatlicher Verfall
10 % Rabatt auf Ihren ersten bezahlten Lauf.Verwenden Sie beim Checkout den Code LIVESCRAPER10.
Registrieren
Passt gut zu

Andere Kataloge, dieselben siebzehn Spalten.

Das Rechtliche

Ist es legal, Decathlon zu scrapen?

Preise, Größen und Bestand auf einer öffentlichen Produktseite sind gewöhnliche Geschäftstatsachen. Die Vorbehalte, die hier zu nennen sind, betreffen das Volumen und das, wofür die Daten taugen und wofür nicht.

Ein Preis, ein Produktname, eine Größe und ob sie vorrätig ist, sind Tatsachen über zum Verkauf angebotene Waren. Sie von einer Seite zu lesen, die jedem Besucher ausgeliefert wird, ist dieselbe Tätigkeit, die ein Käufer von Hand ausführt - nur in nützlichem Tempo. Nichts in den siebzehn Spalten beschreibt eine Person: kein Name, keine E-Mail-Adresse, keine Telefonnummer, kein Konto. Die datenschutzrechtlichen Fragen, die unsere personenbezogenen Dienste prägen, stellen sich hier also nicht.

Was dieser Seite eigen ist, ist das Volumen. Eine Kollektions-URL, die bis auf jede Variante auffächert, leistet mehr Arbeit je Anfrage als ein Produktabruf, und sie erzeugt weit mehr Zeilen: Eine Kollektionsseite gab uns 66. Wir arbeiten in rücksichtsvollem Tempo und machen jeden Fehlschlag in der Statusspalte sichtbar, statt ihn totzuwiederholen, und Sie sollten mit der Vervielfachung im Kopf planen, statt eine Kollektions-URL als Gratisabkürzung zu behandeln. Der Vollständigkeit halber: Keiner unserer Läufe gegen diese Seite wurde blockiert - die beiden Zeilen ohne ok in unserem Export sind 404er von einer Platzhalteradresse, die es nicht gibt, und der Anbieterkatalog verzeichnet für diesen Dienst keinen Blocker.

Unsere eigenen Bedingungen sind dieselben wie bei jedem anderen Dienst hier. Nur öffentlich zugängliche Seiten, nichts hinter einem Login, keine Tracker Dritter auf der Datenebene, und Exporte werden nach 30 Tagen automatisch gelöscht. Ihre ersten 500 Zeilen sind gratis und brauchen keine Kreditkarte.

livescraper.app · was einen Lauf prägt
Eine Kollektions-URL kann zu Dutzenden Zeilen werden
Eine Zeile ist eine Größe und Farbe, kein Produkt
Bewertung und Rezensionen werden von der Quelle nicht veröffentlicht
Nur anonymer Zugriff
Exporte werden nach 30 Tagen automatisch gelöscht
Kein Lauf von uns gegen diese Seite wurde blockiert; die einzigen Zeilen ohne ok stammen von einer Platzhalter-URL.
Häufige Fragen

Was Leute fragen, bevor sie sich anmelden.

Kann ich eine Kollektions-URL statt einzelner Produkte übermitteln?+
Ja, und das ist die vorgesehene Nutzung. Unser Lauf übermittelte eine Kollektionsseite für Herrenhandschuhe und erhielt 66 Zeilen über zehn Produkte - alle mit ok, alle mit derselben query. Das vom Anbieter veröffentlichte Testbeispiel für diesen Dienst ist genau dieselbe Kollektions-URL.
Warum gibt es mehrere Zeilen mit derselben Produkt-URL?+
Weil jede Zeile eine Variante ist. Ein Produkt mit sechs Farben in fünf Größen sind viele Zeilen, jede mit eigener sku, eigener availability und einem name, der auf etwas wie - Steel Blue / XS endet. In unserem Lauf erzeugte ein Produkt zwölf Zeilen. Gruppieren Sie nach product_url, wenn Sie eine Zeile je Produkt wollen.
Wird der Bestand je Größe gemeldet?+
Ja, und das ist hier das Nützlichste. Von unseren 66 Variantenzeilen kamen 39 als InStock und 27 als OutOfStock zurück - bei zehn Produkten, die ein Scraper auf Produktebene als verfügbar bezeichnet hätte. Das ist der Unterschied zwischen dem Wissen, dass es ein Produkt gibt, und dem Wissen, dass Sie es in L kaufen können.
Warum sind die Spalten rating und reviews leer?+
Weil die Quelle sie nicht veröffentlicht. Wir haben eine der Produktseiten direkt abgerufen: Sie liefert einen strukturierten Datenblock, der das Produkt und jede Variante beschreibt, mit Preis, Währung und Bestand auf jeder - und nirgends im Dokument eine Bewertung oder eine Rezensionszahl. Deshalb sind die Spalten leer, nicht weil der Lauf gescheitert wäre.
Sind die Marken echte Hersteller?+
Es sind Decathlons Eigenmarken. Unser Lauf lieferte vier - Forclaz, Wedze, Quechua und Kiprun -, was hervorragend ist, um eine Eigenmarkenreihe zu kartieren, und völlig unbrauchbar, um ein Produkt im Katalog eines anderen Händlers zu finden.
Kommt der Preis als Zahl zurück?+
Ja. parsed_price ist eine nackte Zahl, und auf den Produktzeilen hält price denselben Betrag ohne Symbol; currency war auf jeder Produktzeile unseres Laufs USD. Die einzige Zeile mit Symbol war die Kollektionsseite selbst, kein Produkt.
Was war diese Zeile auf Seitenebene?+
Ein zweiter Lauf auf die Kollektions-URL lieferte eine Zeile, die die Seite beschreibt - Name „Men's Gloves“, das Decathlon-Logo als Bild, keine sku und keine product_url. Filtern Sie vor dem Aggregieren darauf, dass sku vorhanden ist, dann fällt sie heraus.
Was kostet das?+
Ihre ersten 500 Zeilen sind gratis, einmalig, ohne Karte. Danach sind es 0,002 $ pro Zeile, abgerechnet nach tatsächlich gelieferten Zeilen. Bei Varianten lohnt sich das zu planen: Unsere eine Kollektions-URL erzeugte 66 Zeilen, und 66 Zeilen würde sie kosten.
In welchen Formaten kann ich exportieren?+
CSV, JSON oder Excel. Die siebzehn Spalten und ihre Reihenfolge sind in allen dreien gleich.

Jede Größe, nicht nur jedes Produkt.

Eine Kollektions-URL, eine Zeile je Größe und Farbe, mit Preis, Bestand und Bildern auf jeder. Ihre ersten 500 Zeilen sind gratis, danach je 0,002 $.

Sofort aktiv · keine Karte erforderlich

Decathlon-Produktdaten scrapen

Decathlon ist ein Sportartikelhändler, der überwiegend eigene Marken verkauft, und der Dienst auf dieser Seite liest seine Kollektions- und Produktseiten in dieselbe siebzehnspaltige Tabelle, die auch unsere anderen Katalog-Scraper erzeugen. Was ihn von jenen unterscheidet, ist die Tiefe des Auffächerns. Unser Lauf übermittelte eine einzige Kollektions-URL für Herrenhandschuhe und erhielt sechsundsechzig Zeilen, jede davon erfolgreich, verteilt auf zehn verschiedene Produktseiten mit je vier bis zwölf Zeilen. Das vom Anbieter veröffentlichte Testbeispiel für diesen Dienst ist genau dieselbe Kollektions-URL; das ist also der vorgesehene Arbeitsablauf und kein Zufall unserer Fragestellung.

Die Zeilen sind Varianten, keine Produkte. Jede ist eine bestimmte Größe in einer bestimmten Farbe, mit eigener Artikelnummer in sku, eigenem Bestandsstatus in availability und einem name, der mit der Variante endet - etwa Steel Blue / XS. Genau darum lässt man diesen Dienst statt eines Scrapers auf Produktebene laufen: Von unseren sechsundsechzig Zeilen waren neununddreißig verfügbar und siebenundzwanzig nicht, bei zehn Produkten, die eine Prüfung auf Seitenebene als lieferbar gemeldet hätte. Zu wissen, dass eine Farbe in M und L weg ist, während XS unangetastet liegt, ist eine andere Tatsache als zu wissen, dass es das Produkt gibt, und es ist die, die eine Nachbestell-Warnung oder einen Größenkurvenbericht trägt. Gruppieren Sie nach product_url, wenn Sie Produkte zurückwollen; behalten Sie die Zeilen, wenn Sie das Detail wollen.

Zwei Spalten kommen auf jeder Zeile leer an, und wir haben geprüft, warum, statt zu raten. Ein Abruf einer der Produktseiten liefert ein großes Dokument mit einem strukturierten Datenblock, der das Produkt beschreibt und alle seine Varianten mit Preis, Währung und Bestandsstatus auflistet - und der nirgends eine Durchschnittsbewertung oder eine Rezensionszahl enthält. rating und reviews sind also leer, weil die Quelle sie nicht veröffentlicht, und kein noch so häufiges Wiederholen ändert daran etwas. Derselbe Abruf bestätigte den Rest des Exports: Die Zahl der auf der Seite gelisteten Varianten stimmte exakt mit der Zahl der Zeilen überein, die unser Lauf für dieses Produkt erzeugte, die Artikelnummer erschien in beiden, und die Marke stimmte überein. Preise kommen als nackte Zahlen in parsed_price an, mit currency daneben - lesen Sie die Währung, statt sie anzunehmen, denn Decathlon betreibt nationale Shops.

Die Markenspalte verdient einen Vorbehalt. Unser Lauf lieferte vier Werte - Forclaz, Wedze, Quechua und Kiprun -, allesamt Decathlons Eigenmarken. Das macht die Quelle hervorragend für die Kartierung eines Eigenmarkensortiments und schlecht für den Abgleich eines Produkts mit einem anderen Händler, weil es keinen dritten Hersteller gibt, über den man abgleichen könnte. Darüber hinaus planen Sie mit dem Volumen: Varianten vervielfachen sich, eine Kollektions-URL kostete uns sechsundsechzig Zeilen statt einer, und abgerechnet wird nach gelieferten Zeilen. Keiner unserer Läufe gegen diese Seite wurde blockiert - die einzigen Zeilen ohne ok in unserem Export sind 404er von einer Platzhalteradresse -, und der Anbieterkatalog verzeichnet für den Dienst keinen Blocker. Nur öffentlich zugängliche Seiten, keine Tracker Dritter auf der Datenebene, Exporte werden nach 30 Tagen automatisch gelöscht, und Ihre ersten 500 Zeilen sind gratis, ohne Kreditkarte.