CDW Produkt-Scraper

Eine Kategorie-URL rein,
eine Zeile je Produkt raus.

CDW ist ein Technologie-Reseller, und anders als bei den übrigen Katalogen auf diesem Schema müssen Sie ihm Produkte nicht einzeln vorlegen. Geben Sie ihm eine Kategorieseite, und Sie bekommen eine Zeile für jedes dort gelistete Produkt - mit Preis, CDW-Artikelnummer und Hersteller-Artikelnummer in jeder einzelnen.

einmalig 500 Zeilen gratisdanach 0,002 $ pro Zeileeine Kategorie-URL wird zu vielen ZeilenCSV · JSON · Excel
So funktioniert es

Eine Liste von URLs rein, eine Tabelle raus.

  1. SCHRITT 1Melden Sie sich auf der Plattform an.
  2. SCHRITT 2Öffnen Sie den CDW Products Scraper.
  3. SCHRITT 3Fügen Sie die gewünschten CDW-URLs ein, eine pro Zeile - eine Kategorieseite liefert jedes Produkt darauf, eine Produktseite liefert eine Zeile.
  4. SCHRITT 4Wählen Sie Ihr Ausgabeformat (CSV / JSON / XLSX).
  5. SCHRITT 5Starten Sie den Job.
  6. SCHRITT 6Laden Sie die Ergebnisse herunter - siebzehn Spalten je Zeile.
Was Sie erwartet

Was Sie wissen sollten, bevor Sie starten.

Eine Kategorie-URL fächert sich in eine Zeile je Produkt auf

Das ist der nützliche Unterschied. Unser Lauf übermittelte eine einzige Kategorieseite für 2-in-1-Notebooks und bekam 24 Zeilen zurück, alle mit ok, alle mit derselben query, jede mit eigener product_url. Die anderen Katalog-Scraper auf diesem Schema liefern eine Zeile je übermittelter URL. Hier kann eine URL ein ganzes Regal sein - und die veröffentlichte Beispieleingabe dieses Dienstes ist selbst eine Kategorieseite.

Der Preis ist echt, und er steht nicht im Seitenquelltext

Alle 24 Zeilen trugen parsed_price, price und currency. Rufen Sie dieselbe Produktseite selbst ab, und Sie finden im Markup beide Identifikatoren und den Produktnamen - und nirgends einen Geldbetrag, auch keinen Block mit strukturierten Daten. Der Preis wird im Browser gerendert. Genau deshalb liefert ein Dienst, der die Seite rendert, einen Preis, und eine gewöhnliche HTTP-Anfrage nicht.

Zwei Artikelnummern, und sie sind nicht dieselbe

sku_code ist CDWs eigene Artikelnummer - sie ist zugleich das letzte Segment der Produkt-URL und die ID in der Bild-URL. sku ist die Artikelnummer des Herstellers. Auf unseren Zeilen waren das verschiedene Werte, und beide stehen auf der Live-Seite. Prüfen Sie beide, bevor Sie einen Verknüpfungsschlüssel wählen: die Herstellernummer ist die, die den Wechsel zu einem anderen Reseller übersteht.

Fünf der siebzehn Spalten kamen leer zurück

brand, rating, reviews, description und availability waren auf allen 24 Zeilen leer. Eine Reseller-Listenseite trägt Preis und Artikelnummern statt Verbraucherbewertungs-Beiwerk, planen Sie den Importer also nach dem, was ankommt, und nicht nach der Spaltenliste.

Das Schema änderte sich zwischen dem 1. und 3. Juli 2026

Unser ältester Lauf trägt eine elfspaltige Kopfzeile - kein parsed_price, kein sku_code, kein product_url, keine description, keine reviews, keine images. Jeder Lauf ab dem 3. Juli hat die unten dokumentierte siebzehnspaltige Form. Wenn Sie einen älteren CDW-Export haben, fehlen deshalb vier der erwarteten Spalten.

Blockaden kommen vor, und sie sind zeitweise

Zwei unserer Läufe kamen mit blocked (needs residential proxy) zurück, an demselben Tag, an dem andere vollständige Zeilen lieferten. Die Statusspalte sagt Ihnen, welche welche ist, eine blockierte Zeile ist also sichtbar statt still. Acht Läufe sind eine viel zu kleine Stichprobe für eine Erfolgsquote, also nennen wir keine - bauen Sie Wiederholungen ein.

Was Sie zurückbekommen

Siebzehn Spalten, zwölf davon gefüllt.

Aus der Kopfzeile eines echten Exports gelesen, in der Reihenfolge des Tabellenblatts. Die Angaben unten stammen aus unserem Lauf mit 24 Zeilen: wo hier steht, dass eine Spalte einen Wert trug, beschreibt das Zeilen, die wir tatsächlich haben.

query
Die CDW-URL, die Sie übermittelt haben. Bei einem Kategorielauf steht in jeder von dieser Kategorie erzeugten Zeile derselbe Wert, und daran unterscheiden Sie in einem gemeinsamen Export ein Regal vom nächsten. Behalten Sie sie - bei einer Auffächerung ist sie das Einzige, was die Zeilen gruppiert.
sku_code
CDWs eigene Artikelnummer. Auf allen 24 Zeilen unseres Kategorielaufs gefüllt. Sie ist zugleich das letzte Segment von product_url und die ID in der Bild-URL, die drei stimmen also überein und Sie können eine Zeile gegen sich selbst prüfen.
product_url
Die kanonische Produktseite. Bei einem Kategorielauf ist das das Produkt der jeweiligen Zeile - 24 Zeilen, 24 verschiedene Werte -, und genau das macht die Auffächerung nützlich statt bloß lang.
name
Der Produkttitel, wie die Liste ihn nennt. Rechnen Sie mit Reseller-Formulierungen, in denen die Konfiguration ausgeschrieben ist: Prozessor, Arbeitsspeicher und Speicher stehen eher im Namen als in eigenen Feldern.
description
Vorgesehen für den längeren Produkttext. Auf allen 24 Zeilen leer. Eine Kategorieliste druckt keinen; eine Produktseite vielleicht schon.
parsed_price
Der Preis als reine Zahl. Auf allen 24 Zeilen gefüllt. Das ist der zum Rechnen - und im Hinweis unten steht, warum es ihn überhaupt gibt, wo die Seite ihn doch nicht ausliefert.
price
Derselbe Preis wie angezeigt, mit Symbol und Tausendertrennzeichen. Nehmen Sie ihn, wenn Sie einem Kunden genau zeigen müssen, was CDW gezeigt hat; nehmen Sie parsed_price zum Rechnen.
currency
Die Währung, in der der Preis angegeben ist. Auf allen 24 Zeilen gefüllt. Lesen Sie sie aus, statt sie anzunehmen - ein Reseller mit internationalen Shops antwortet nicht immer in derselben.
availability
Vorgesehen für den Lagerstatus. Auf allen 24 Zeilen leer. Behandeln Sie das Fehlen als „die Liste veröffentlicht keinen“ und nicht als „das Produkt ist nicht verfügbar“.
rating
Vorgesehen für eine Durchschnittsbewertung. Auf allen 24 Zeilen leer. Eine an Geschäftskunden gerichtete Reseller-Liste führt in der Regel keine Verbraucherbewertungen.
reviews
Vorgesehen für die Anzahl der Rezensionen, mit demselben Vorbehalt wie rating. Auf allen 24 Zeilen leer.
images
Jedes Bild, das die Liste trägt. Auf allen 24 Zeilen gefüllt. Erwähnenswert: die Bild-URL enthält eine Darstellungsvorgabe, und die unterschied sich zwischen unserem Kategorielauf und unserem Produktlauf - dasselbe Produkt, zwei verschiedene Bildgrößen. Behandeln Sie die URL nicht als feste Identität; stabil ist die ID darin.
brand
Vorgesehen für den Hersteller. Auf allen 24 Zeilen leer, obwohl der Herstellername in der Regel das erste Wort von name ist. Wenn Sie nach Marke gruppieren wollen, parsen Sie sie aus dem Namen.
sku
Die Artikelnummer des Herstellers, und ein anderer Wert als sku_code. Das ist die Spalte, über die man zusammenführt, wenn man fragt, ob ein anderer Reseller dasselbe physische Produkt listet.
url
Die Adresse, aus der die Zeile entstanden ist. In unserem Kategorielauf war das product_url und nicht query - die Zeile zeigt auf ihr eigenes Produkt, nicht auf das Regal, aus dem sie stammt.
image
Das Hauptbild für sich, damit der häufige Fall ohne String-Aufteilung auskommt. Derselbe Vorbehalt zur Darstellungsvorgabe wie bei images.
status
Ein Kennzeichen je Zeile, geschrieben von unserem Exporter und nicht von CDW. Über unsere acht Läufe hinweg nahm es vier Werte an: ok, blocked (needs residential proxy), no response (proxy) und http 404. Gleichen Sie über diese Spalte ab - gerade bei einer Auffächerung sagt die Zeilenzahl allein nichts.

Siebzehn Spalten pro Zeile · CSV, JSON oder Excel

Zwei Dinge an dieser Tabelle sollten Sie lesen, bevor Sie dagegen bauen. Erstens: die Preise sind echt. Alle 24 Zeilen unseres Kategorielaufs trugen eine Zahl, einen formatierten Preis und eine Währung - dies ist der eine Katalog dieser Familie, dessen Geldspalten gefüllt ankommen. Ruft man dieselbe Produktseite aber direkt ab, kommen rund 57 KB HTML zurück, die beide Artikelnummern und den Produktnamen enthalten und überhaupt keinen Preis, ohne einen Block mit strukturierten Daten, aus dem sich einer lesen ließe. Die Zahl wird im Browser gerendert. Unser Export hat sie, weil der Dienst die Seite rendert, und ein auf HTTP-Bibliothek und HTML-Parser gebauter Scraper käme mit leeren Händen zurück und sähe dabei aus, als funktioniere er. Zweitens: das Schema hat sich bewegt. Unser Lauf vom 1. Juli trägt eine elfspaltige Kopfzeile - query, name, brand, price, currency, sku, availability, rating, url, image, status - ohne parsed_price, sku_code, product_url, description, reviews oder images. Alles ab dem 3. Juli hat die siebzehnspaltige Form von oben. Wenn Sie einen älteren Export abgleichen, ist das der Unterschied.

Typische Workflows

Wofür eine Auffächerung gut ist.

Kategorie-Preisdurchlauf

Ein ganzes Regal in einer Anfrage auspreisen

Übermitteln Sie die Kategorieseiten, die Sie interessieren, statt Produkte aufzuzählen. Eine URL lieferte in unserem Lauf zwei Dutzend ausgepreiste Zeilen, ein wöchentlicher Durchlauf über eine Handvoll Kategorien ist also ein kleiner Job, der eine echte Preisreihe erzeugt. Das ist der Workflow, für den dieser Dienst gebaut ist.

Preisgestaltung · Monitoring
Reseller-Vergleich

Dieselbe Hardware bei einem anderen Reseller finden

sku ist die Artikelnummer des Herstellers, sie übersteht also den Wechsel von CDW in den Katalog eines Wettbewerbers, was CDWs eigene sku_code nicht tut. Kombiniert mit parsed_price können Sie beantworten, wer bei einem identischen Teil günstiger ist - statt bei einem ähnlich klingenden Namen.

Beschaffung · Sourcing
Konfigurationsabgleich

Die Spezifikation aus dem Produktnamen lesen

Reseller-Listen packen die Konfiguration in den Titel - Prozessor, Arbeitsspeicher, Speicher. Da description leer ist, lebt dieses Detail in name, und wer es parst, bekommt eine vergleichbare Spezifikationstabelle über eine ganze Kategorie, ohne eine einzige Seite zu öffnen.

Kategorie-Recherche · Sortiment
Katalogabgleich

Ihre Einkaufsdaten in Reihe bringen

sku_code ist die Nummer, die CDW im eigenen System verwendet, und damit die, gegen die man Angebote und Rechnungen abgleicht. Behalten Sie beide Identifikator-Spalten, und Sie können mit dem Reseller in dessen Nummerierung sprechen und mit Ihrem Anlagenverzeichnis in der des Herstellers.

Einkauf · Datensätze
Preise

Zahlen Sie nur, was Sie tatsächlich nutzen.

Gratis-Kontingent

Die ersten 500 Zeilen sind gratis

Einmalig, bei der Anmeldung. Keine Karte, und nichts, was danach gekündigt werden müsste.

Einmalig, bei der Anmeldung
Preis

danach 0,002 $ pro Zeile

Abgerechnet nach tatsächlich gelieferten Zeilen - was hier mehr zählt als anderswo, weil eine Kategorie-URL Dutzende Zeilen erzeugen kann. Unser Lauf mit 24 Zeilen kostete 24 Zeilen, nicht eine.

Abgerechnet nach gelieferten Zeilen
Kein Abo

Nichts Wiederkehrendes

Guthaben verfällt nicht im Monatsrhythmus. Fahren Sie im März einen Kategoriedurchlauf und danach nichts mehr bis September, wenn die Arbeit so aussieht.

Kein monatlicher Verfall
10 % Rabatt auf Ihren ersten bezahlten Lauf.Verwenden Sie beim Checkout den Code LIVESCRAPER10.
Registrieren
Passt gut zusammen mit

Andere Kataloge, dieselben siebzehn Spalten.

Das Rechtliche

Ist es legal, CDW zu scrapen?

Preise und Artikelnummern auf einer öffentlich erreichbaren Liste sind gewöhnliche Wettbewerbsinformationen. Die hier erwähnenswerten Vorbehalte betreffen das Tempo und das Lesen der erklärten Präferenzen der Website.

Ein Preis, ein Produktname und eine Artikelnummer sind Fakten über zum Verkauf angebotene Waren. Sie von einer Seite zu lesen, die jedem Besucher ausgeliefert wird, ist dieselbe Tätigkeit, die ein Einkäufer von Hand ausführt, nur in nützlichem Tempo. Nichts in den siebzehn Spalten beschreibt eine Person: kein Name, keine E-Mail-Adresse, keine Telefonnummer, kein Konto - die datenschutzrechtlichen Fragen, die unsere personenbezogenen Dienste prägen, stellen sich hier also nicht.

Zwei Dinge sind für diese Website spezifisch. Erstens das Tempo. Eine Kategorie-URL, die sich in zwei Dutzend Zeilen auffächert, leistet pro Anfrage mehr als ein einzelner Produktabruf, und zwei unserer eigenen Läufe kamen an einem Tag blockiert zurück, an dem andere durchkamen. Wir laufen in rücksichtsvollem Tempo und machen eine Blockade in der Statusspalte sichtbar, statt sie in Grund und Boden zu wiederholen; planen Sie entsprechend und behandeln Sie eine Auffächerung nicht als kostenlosen Multiplikator. Zweitens die erklärten Präferenzen der Website. CDWs robots.txt liefert einem einfachen Client 403 und einem Browser-User-Agent 200 - wir berichten das, statt so zu tun, als hätte sich die Datei sauber lesen lassen. Mit Browser-User-Agent gelesen enthält sie keinen pauschalen Ausschluss für allgemeine Crawler, und weder der Produkt- noch der Kategoriepfad, den wir verwendet haben, ist gesperrt.

Unsere eigenen Bedingungen sind dieselben wie bei jedem anderen Dienst hier. Nur öffentlich zugängliche Seiten, nichts hinter einem Login, keine Tracker Dritter auf der Datenebene, und Exporte werden nach 30 Tagen automatisch gelöscht. Ihre ersten 500 Zeilen sind gratis und brauchen keine Kreditkarte.

livescraper.app · was einen Lauf prägt
Eine Kategorie-URL kann zu Dutzenden Zeilen werden
Die Seite wird gerendert, nicht nur abgerufen
Blockaden sind zeitweise - die Statusspalte zeigt sie
Nur anonymer Zugang
Exporte werden nach 30 Tagen automatisch gelöscht
Der Preis steht nicht im Seitenquelltext. Erst das Rendering erzeugt ihn, und genau dafür gibt es diesen Dienst.
Häufige Fragen

Was Leute fragen, bevor sie sich anmelden.

Kann ich eine Kategorie-URL statt einzelner Produkte übermitteln?+
Ja, und genau dafür ist er gedacht. Unser Lauf übermittelte eine Kategorieseite für 2-in-1-Notebooks und bekam 24 Zeilen zurück - alle mit ok, alle mit derselben query, jede mit eigener product_url. Die veröffentlichte Beispieleingabe dieses Dienstes ist selbst eine Kategorieseite. Eine Produkt-URL funktioniert ebenfalls und liefert eine einzelne Zeile.
Enthält der Export Preise?+
Ja. Alle 24 Zeilen unseres Kategorielaufs trugen parsed_price, price und currency. Damit ist CDW unter den Katalogen auf diesem Schema ungewöhnlich, wo die Geldspalten oft aus jeweils eigenen Gründen leer bleiben.
Warum kann ich die Seite nicht einfach abrufen und den Preis selbst lesen?+
Weil er nicht da ist. Ein Abruf derselben Produktseite liefert rund 57 KB HTML mit beiden Artikelnummern und dem Produktnamen, ohne irgendwo einen Geldbetrag und ohne Block mit strukturierten Daten, aus dem sich einer lesen ließe. Der Preis wird danach im Browser gerendert. Ein auf HTTP-Bibliothek und HTML-Parser gebauter Scraper sieht aus, als funktioniere er, und liefert eine leere Preisspalte.
Welche Spalten kommen tatsächlich gefüllt zurück?+
Zwölf der siebzehn, in unserem Lauf mit 24 Zeilen: query, sku_code, product_url, name, parsed_price, price, currency, images, sku, url, image und status. Auf allen 24 leer: description, availability, rating, reviews und brand.
Warum gibt es zwei Artikelnummern?+
Es sind verschiedene Dinge. sku_code ist CDWs eigene Artikelnummer - derselbe Wert, mit dem die Produkt-URL endet und der in der Bild-URL steht - und sku ist die des Herstellers. Nehmen Sie CDWs Nummer, um mit CDW über ein Angebot zu sprechen, und die des Herstellers, um dasselbe physische Produkt im Katalog eines anderen Resellers zu finden.
Mein älterer CDW-Export hat weniger Spalten. Warum?+
Das Schema hat sich geändert. Unser Lauf vom 1. Juli 2026 trägt eine elfspaltige Kopfzeile ohne parsed_price, sku_code, product_url, description, reviews oder images. Jeder Lauf ab dem 3. Juli hat die siebzehnspaltige Form. Wenn Sie Alt gegen Neu abgleichen, ist das der Unterschied.
Was bedeutet die Spalte status?+
Sie wird von unserem Exporter geschrieben, nicht von CDW, und meldet, ob die Zeile abgerufen wurde. Über unsere acht Läufe hinweg nahm sie vier Werte an: ok, blocked (needs residential proxy), no response (proxy) und http 404 - letzteres bei einer Platzhalter-Adresse, die es nicht gibt. Gleichen Sie über diese Spalte ab und nicht über die Zeilenzahl, die eine Auffächerung für sich genommen bedeutungslos macht.
Was kostet es?+
Ihre ersten 500 Zeilen sind gratis, einmalig, ohne Karte. Danach sind es 0,002 $ pro Zeile, abgerechnet nach tatsächlich gelieferten Zeilen. Bei einer Auffächerung lohnt sich Planung: unsere eine Kategorie-URL erzeugte 24 Zeilen, und 24 Zeilen würde sie kosten.
In welchen Formaten kann ich exportieren?+
CSV, JSON oder Excel. Die siebzehn Spalten und ihre Reihenfolge sind in allen dreien gleich.

Ein Regal auspreisen, nicht ein Produkt.

Eine Kategorie-URL, eine Zeile für jedes Produkt darauf, mit dem Preis und beiden Artikelnummern in jeder. Ihre ersten 500 Zeilen sind gratis, danach je 0,002 $.

Sofort aktiv · keine Karte erforderlich

CDW-Produktdaten scrapen

CDW ist ein Technologie-Reseller, der Hardware, Software und Dienstleistungen an Unternehmen, Behörden und Bildungseinrichtungen verkauft. Zwei Dinge machen das Scrapen anders als bei den übrigen Katalogen mit diesem siebzehnspaltigen Schema, und beide sollte man kennen, bevor man einen Importer schreibt. Das erste ist die Auffächerung einer Kategorie-URL. Unser Lauf übermittelte eine einzige Kategorieseite für 2-in-1-Notebooks und erhielt vierundzwanzig Zeilen, jede mit Erfolg gemeldet, jede mit der übermittelten URL in query und einer eigenen, verschiedenen product_url. Überall sonst in dieser Familie bedeutet eine URL eine Zeile. Hier kann eine URL ein ganzes Regal sein, und die vom Anbieter veröffentlichte Beispieleingabe für diesen Dienst ist eine Kategorieseite statt einer Produktseite - die Auffächerung ist der vorgesehene Workflow, kein Nebeneffekt.

Das zweite ist der Preis. Alle vierundzwanzig Zeilen trugen eine berechenbare Zahl, einen formatierten Preis und eine Währung, was CDW hier ungewöhnlich macht: auf unseren anderen Katalogseiten sind die Geldspalten aus jeweils eigenen Gründen leer. Interessant ist, wo dieser Preis nicht steht. Ruft man dieselbe Produktseite direkt ab, kommen rund 57 KB HTML zurück, die CDWs Artikelnummer, die Artikelnummer des Herstellers und den vollständigen Produktnamen enthalten - und überhaupt keinen Geldbetrag, ohne Block mit strukturierten Daten, aus dem sich einer lesen ließe. Die Zahl wird im Browser gerendert, nachdem das Markup angekommen ist. Ein auf HTTP-Bibliothek und HTML-Parser gebauter Scraper findet die Identifikatoren, verfehlt den Preis vollständig und macht dabei ganz den Eindruck zu funktionieren. Dieser Dienst lädt die Seite so, wie ein Browser es tut, und genau deshalb ist die Spalte gefüllt.

Die Identifikator-Spalten lohnen Aufmerksamkeit. sku_code ist CDWs eigene Artikelnummer, und sie ist zugleich das letzte Segment der Produkt-URL und die in der Bild-URL eingebettete ID, eine Zeile lässt sich also gegen sich selbst prüfen. sku ist die Artikelnummer des Herstellers und ein wirklich anderer Wert. Die Herstellernummer übersteht den Wechsel zu einem anderen Reseller, sie ist also die Spalte, über die man zusammenführt, wenn man fragt, ob jemand anderes dieselbe physische Hardware listet; CDWs Nummer ist die, die gegen ein Angebot abgleicht. Fünf Spalten kamen auf jeder Zeile leer zurück - brand, rating, reviews, description und availability -, und so sieht eine Geschäftsliste aus: Artikelnummern und Preis statt Verbraucherbewertungs-Beiwerk. Der Hersteller ist meist das erste Wort von name, falls Sie danach gruppieren müssen.

Zwei Vorbehalte, ausgesprochen statt vergraben. Das Schema änderte sich zwischen dem 1. und 3. Juli 2026: unser ältester Lauf trägt eine elfspaltige Kopfzeile ohne parsed_price, sku_code, product_url, description, reviews oder images, und alles danach hat die siebzehnspaltige Form. Wenn Sie einen älteren Export halten, passen deshalb die Spalten nicht zusammen. Und Blockaden sind real und zeitweise - zwei unserer acht Läufe lieferten blocked (needs residential proxy) an demselben Tag, an dem andere vollständige Zeilen lieferten, die Statusspalte zählt also, und ein Zeitplan sollte Wiederholungen enthalten. Acht Läufe sind eine viel zu kleine Stichprobe, um daraus eine Erfolgsquote zu nennen, und wir nennen keine. Zum Zugang: CDWs robots.txt liefert einem einfachen Client 403 und einem Browser-User-Agent 200, was wir berichten statt zu beschönigen; so gelesen enthält sie keinen pauschalen Ausschluss, und weder der Produkt- noch der Kategoriepfad, den wir verwendet haben, ist gesperrt. Nur öffentlich zugängliche Seiten, keine Tracker Dritter auf der Datenebene, und Exporte werden nach 30 Tagen automatisch gelöscht. Ihre ersten 500 Zeilen sind gratis und brauchen keine Kreditkarte.