Vistaprint Produkt-Scraper

Ein Druckkatalog, der
keinen einzelnen Preis hat.

Vistaprint verkauft Druck nach Menge - fünfzig Visitenkarten, dann hundert, dann fünfhundert, jede zu ihrem eigenen Satz. Eine Produktseite nennt also einen Namen, eine SKU, eine Bewertung und eine Beschreibung, und überhaupt keinen Preis. Dieser Scraper liefert die siebzehn Spalten; sechs davon kommen leer zurück, und wir sagen Ihnen lieber vor der Anmeldung welche als danach.

einmalig 500 Zeilen gratisdanach 0,002 $ pro Zeileelf Spalten gefüllt, sechs leerCSV · JSON · Excel
So funktioniert es

Eine Liste von URLs rein, eine Tabelle raus.

  1. SCHRITT 1Melden Sie sich auf der Plattform an.
  2. SCHRITT 2Öffnen Sie den Vistaprint Products Scraper.
  3. SCHRITT 3Fügen Sie die gewünschten Vistaprint-Produkt-URLs ein, eine pro Zeile - keine Kategorie- oder Suchseiten.
  4. SCHRITT 4Wählen Sie Ihr Ausgabeformat (CSV / JSON / XLSX).
  5. SCHRITT 5Starten Sie den Job.
  6. SCHRITT 6Laden Sie die Ergebnisse herunter - eine Zeile je URL, siebzehn Spalten.
Was Sie erwartet

Was Sie wissen sollten, bevor Sie starten.

Die Preisspalten kommen leer zurück

In beiden Läufen, die echte Vistaprint-Zeilen lieferten, waren price, parsed_price, currency und availability sämtlich leer. Das ist keine Lücke im Scraper. Rufen Sie eine Produktseite ab und lesen Sie ihre strukturierten Daten: der Product-Block trägt Name, Beschreibung, SKU, MPN und Marke, und es gibt darin keinen Angebots-Knoten und nirgends einen Preis. Vistaprint kalkuliert nach Menge und Veredelung, die Seite hat also keine einzelne Zahl, die in eine Zelle passt.

Was sie liefert, ist Identität

Name, Marke, SKU, Bewertung, Beschreibung und Bild-URLs kamen auf jeder echten Produktzeile gefüllt zurück. Das reicht, um einen Vistaprint-Artikel gegen Ihren eigenen Katalog abzugleichen, um zu verfolgen, welche Produkte es gibt und wie sie beschrieben werden, und um Bildmaterial zu ziehen - es reicht nur nicht für einen Preisvergleich.

Geben Sie ihr Produktseiten, keine Kategorie- oder Suchseiten

Wir haben Belege für beides. Eine Produkt-URL lieferte eine vollständige Zeile. Die Kategorieseite eine Ebene darüber lieferte no product data found, und eine /search?q=…-URL lieferte status: ok mit name als „Search Results“ und allen anderen Feldern leer - ein Seitentitel, kein Produkt. Vistaprints eigene robots.txt verbietet /search zudem für alle Crawler.

Vistaprint wehrt manche Anfragen ab

Von den acht Läufen, die wir haben, kamen drei mit blocked (needs residential proxy) zurück. Einer davon betraf dieselbe Visitenkarten-URL, die acht Tage später funktionierte. Die Blockade ist also real und sie ist zeitweise; wir nennen Ihnen aus acht Läufen keine Erfolgsquote, und Sie sollten in jeden Zeitplan Wiederholungen einbauen.

Teilen Sie das Bilderfeld nicht an Kommas

image und images enthielten auf beiden echten Zeilen denselben Wert, und dieser Wert ist eine Cloudinary-Transform-URL - c_scale,dpr_auto,f_auto,q_auto:best und so weiter. Die Kommas gehören zur URL. Wer daran trennt, erhält Bruchstücke, die ins Leere führen. Eine unserer beiden Zeilen trug eine 1.697 Zeichen lange Bild-URL, geben Sie der Spalte also Platz.

Jede Zeile sagt, was passiert ist

Die letzte Spalte ist status, geschrieben von unserem Exporter und nicht von der Website. Über unsere acht Läufe hinweg nahm sie vier verschiedene Werte an - ok, blocked (needs residential proxy), no product data found und http 404 -, eine fehlgeschlagene Zeile kommt also trotzdem an und trägt den Grund.

Was Sie zurückbekommen

Siebzehn Spalten, elf davon gefüllt.

Aus der Kopfzeile eines echten Exports gelesen, in der Reihenfolge des Tabellenblatts. Wo wir beobachtet haben, dass eine Spalte einen Wert trägt, steht hier, wie dieser Wert aussah. Wo sie in jeder Zeile leer war, steht das stattdessen.

query
Die Vistaprint-URL, die Sie übermittelt haben, in jeder Zeile wiederholt, damit ein Export über viele Produkte trennbar bleibt. In allen unseren Zeilen stimmte sie exakt mit url überein.
sku_code
Der Produktcode. Auf beiden echten Zeilen war er identisch mit sku, in der Form PRD- gefolgt von acht alphanumerischen Zeichen. Zwei Identifikator-Spalten, ein Wert - nehmen Sie eine der beiden, prüfen Sie aber beide, wenn Sie verknüpfen, denn in dieser Schema-Familie werden sie unabhängig gefüllt.
product_url
Vorgesehen für die kanonische Produktseite. Nehmen Sie stattdessen url.
name
Der Produkttitel, wie die Seite ihn nennt - „Standard Business Cards“ auf einer unserer Zeilen, „VistaPrint® Printed Baseball Cap“ auf der anderen. Beachten Sie das Markenzeichen: es steht so in der Quelle und überlebt bis in die Zelle.
description
Die Marketing-Beschreibung der Seite, auf unseren Zeilen rund 150–180 Zeichen. Es lohnt sich, sie zu lesen statt zu verwerfen: auf der Visitenkarten-Zeile war die einzige Preisinformation im gesamten Datensatz eine Formulierung in diesem Text, keine Zahl in einer Preisspalte.
parsed_price
Vorgesehen für den Preis als reine Zahl. Siehe den Hinweis unter der Tabelle.
price
Vorgesehen für den Preis wie angezeigt.
currency
Vorgesehen für die Währung, in der der Preis angegeben ist.
availability
Vorgesehen für den Lagerstatus. Auftragsdruck kennt keinen Lagerstand, wie Lagerware ihn kennt.
rating
Die Durchschnittsbewertung, und eines der Felder, das tatsächlich zurückkommt - „4.7“ und „4.3“ auf unseren beiden Zeilen. Sie kommt als Zeichenkette an, nicht als Zahl, wandeln Sie sie also um, bevor Sie danach sortieren.
reviews
Vorgesehen für die Anzahl der Rezensionen. Auf beiden echten Zeilen leer, obwohl die strukturierten Daten der Produktseite neben der Bewertung sehr wohl eine Rezensionszahl veröffentlichen. Wir halten das als Lücke fest, statt es wegzuerklären.
images
Jedes Bild, das die Seite trägt. Auf beiden echten Zeilen identisch mit image. Nicht an Kommas trennen - die Kommas gehören zur Cloudinary-Transformation.
brand
Hersteller oder Marke. Auf beiden unserer Zeilen „Vistaprint“, was man von einer Eigenmarken-Druckerei erwartet; behandeln Sie einen abweichenden Wert als Information und nicht als Fehler.
sku
Die Artikelnummer. Auf beiden echten Zeilen identisch mit sku_code, und der nützlichste Verknüpfungsschlüssel im Datensatz - es ist genau der Wert, den die strukturierten Daten der Produktseite als ihre SKU veröffentlichen.
url
Die Adresse, aus der die Zeile entstanden ist. In jeder Zeile, die wir haben, gleich query, woran Sie sehen, dass diese Anfragen ohne Weiterleitung beantwortet wurden.
image
Das Hauptbild für sich. Eine Cloudinary-URL auf cms.cloudinary.vpsvc.com, die einen gerenderten Vorschau-Aufruf von rendering.documents.cimpress.io umschließt - das Bildmaterial wird auf Anfrage erzeugt und nicht als Foto gespeichert. Eines unserer Bilder lief über 1.697 Zeichen, eine Spalte fester Breite schneidet es also ab.
status
Ein Kennzeichen je Zeile, geschrieben von unserem Exporter und nicht von Vistaprint. Über unsere acht Läufe hinweg nahm es vier Werte an: ok, blocked (needs residential proxy), no product data found und http 404. Gleichen Sie über diese Spalte ab und nicht über die Zeilenzahl.

Siebzehn Spalten pro Zeile · CSV, JSON oder Excel

Warum die vier Preisspalten leer sind, klar gesagt. Wir haben acht Läufe; zwei lieferten echte Vistaprint-Produktzeilen, und in beiden waren price, parsed_price, currency und availability leere Zeichenketten. Das ist kein Fehler des Scrapers. Ruft man eine der beiden Produktseiten direkt ab, kommen rund 745–843 KB serverseitig gerendertes HTML zurück, dessen ld+json einen Product-Block mit Name, Beschreibung, SKU, MPN und Marke enthält - und keinen Angebots-Knoten und keinerlei Preis. Vistaprint kalkuliert nach Menge, Material und Veredelung, es gibt also keinen einzelnen Produktpreis, den die Seite veröffentlichen oder den wir lesen könnten. Bewertung und SKU in genau diesen strukturierten Daten stimmen exakt mit unserem Export überein, daran erkennen wir, dass die Zeilen echt sind und kein Parser-Zufall. Wenn Ihre Arbeit Vistaprint-Preise braucht, liefert dieser Dienst sie nicht, und keine Einstellung ändert das.

Typische Workflows

Wofür Identitätsdaten gut sind.

Katalogabgleich

Ihre Datensätze gegen deren stellen

sku kommt in sauberer PRD--Form an und ist derselbe Wert, den die Produktseite als ihre SKU veröffentlicht, was ihn zu einem verlässlichen Verknüpfungsschlüssel macht. Kombiniert mit name und brand können Sie eine Liste von Vistaprint-Artikeln gegen Ihre eigene abgleichen, ohne über Fließtext zu matchen.

E-Commerce-Ops · Katalog
Sortimentsverfolgung

Beobachten, was es gibt, nicht was es kostet

Fahren Sie eine Menge von Produkt-URLs nach Zeitplan und behalten Sie name, description und rating samt Laufdatum. Produkte werden weit häufiger umbenannt, neu positioniert und neu beschrieben, als irgendwer ankündigt, und die Reihe zeigt es.

Kategorie-Recherche · Sortiment
Bild und Text

Beschreibung und gerendertes Bild ziehen

description und image kommen gefüllt zurück. Das Bild ist ein Live-Render von Cloudinary und kein gespeichertes Foto, behandeln Sie die URL also als das Artefakt und holen Sie sie ab, wenn Sie die Datei brauchen.

Content · Anreicherung
Bewertungsverlauf

Die Bewertung über die Zeit verfolgen

rating gehört zu den Feldern, die zuverlässig ankommen. Es ist eine Zeichenkette, wandeln Sie es also zuerst um. Denken Sie daran, dass reviews leer bleibt: Sie haben die Note ohne die Stichprobe dahinter - genug für eine Verlaufslinie, nicht genug, um Produkte gegeneinander zu ranken.

Produktrecherche · Bewertungen
Preise

Zahlen Sie nur, was Sie tatsächlich nutzen.

Gratis-Kontingent

Die ersten 500 Zeilen sind gratis

Einmalig, bei der Anmeldung. Keine Karte, und nichts, was danach gekündigt werden müsste.

Einmalig, bei der Anmeldung
Preis

danach 0,002 $ pro Zeile

Abgerechnet nach tatsächlich gelieferten Zeilen. Eine Zeile, die mit einem anderen als einem erfolgreichen status zurückkommt, ist keine Zeile mit Produktdaten und wird auch nicht als solche berechnet.

Abgerechnet nach gelieferten Zeilen
Kein Abo

Nichts Wiederkehrendes

Guthaben verfällt nicht im Monatsrhythmus. Fahren Sie im März einen Katalogdurchlauf und danach nichts mehr bis September, wenn die Arbeit so aussieht.

Kein monatlicher Verfall
10 % Rabatt auf Ihren ersten bezahlten Lauf.Verwenden Sie beim Checkout den Code LIVESCRAPER10.
Registrieren
Passt gut zusammen mit

Andere Kataloge, dieselben siebzehn Spalten.

Das Rechtliche

Ist es legal, Vistaprint zu scrapen?

Produktfakten auf einer öffentlich erreichbaren Seite sind gewöhnliche Wettbewerbsinformationen. Die hier erwähnenswerten Vorbehalte betreffen, welche Seiten Sie anfragen und was Sie mit dem Bildmaterial tun.

Ein Produktname, eine Marke, eine SKU und eine Bewertung sind Fakten über zum Verkauf angebotene Waren. Sie von einer Seite zu lesen, die jedem Besucher ausgeliefert wird, ist dieselbe Tätigkeit, die ein Einkäufer von Hand ausführt, nur in nützlichem Tempo. Nichts in den siebzehn Spalten beschreibt eine Person: kein Name, keine E-Mail-Adresse, keine Telefonnummer, kein Konto - die datenschutzrechtlichen Fragen, die unsere personenbezogenen Dienste prägen, stellen sich hier also nicht.

Zwei Vorbehalte sind für diese Website spezifisch. Erstens, welche Seiten Sie anfragen: Vistaprints robots.txt enthält für allgemeine Crawler kein pauschales Disallow: /, und die von uns geprüften Produktpfade sind nicht gesperrt - /search aber schon, für jeden User-Agent. Das ist deshalb wichtig, weil in den veröffentlichten Beispieleingaben für diesen Dienst eine Such-URL vorkommt und einer unserer eigenen Läufe eine solche übermittelt hat. Sie kam ohnehin mit einem Seitentitel und ohne Produkt zurück, Rat und Rücksicht weisen also in dieselbe Richtung: übermitteln Sie Produkt-URLs. Zweitens das Bildmaterial: das Bildfeld führt zu einer Vorschau, die Vistaprints eigene Pipeline erzeugt, und diese Renderings und die Beschreibungen daneben sind urheberrechtlich geschütztes Material. Sie intern zum Abgleichen, Anreichern oder Überwachen eines Katalogs zu nutzen, ist gängige Praxis; sie als eigene zu veröffentlichen, ist eine andere Frage mit einer anderen Antwort.

Unsere eigenen Bedingungen sind dieselben wie bei jedem anderen Dienst hier. Nur öffentlich zugängliche Seiten, nichts hinter einem Login, keine Tracker Dritter auf der Datenebene, und Exporte werden nach 30 Tagen automatisch gelöscht. Ihre ersten 500 Zeilen sind gratis und brauchen keine Kreditkarte.

livescraper.app · was einen Lauf prägt
Eine Produkt-URL je Zeile
Produktseiten, keine Kategorie- oder Suchseiten
Keine Preisdaten - die Seite veröffentlicht keine
Nur anonymer Zugang
Exporte werden nach 30 Tagen automatisch gelöscht
Das eine, was dieser Dienst Ihnen nicht geben kann, ist ein Vistaprint-Preis, und das liegt an der Quelle und nicht am Scraper.
Häufige Fragen

Was Leute fragen, bevor sie sich anmelden.

Enthält der Export Vistaprint-Preise?+
Nein. In beiden Läufen, die echte Produktzeilen lieferten, waren price, parsed_price, currency und availability leer. Der Grund liegt in der Quelle: Rufen Sie eine Vistaprint-Produktseite ab, und ihre strukturierten Daten enthalten einen Product-Block mit Name, Beschreibung, SKU, MPN und Marke - und keinen Angebots-Knoten und überhaupt keinen Preis. Vistaprint kalkuliert nach Menge und Veredelung, es gibt auf der Seite also keinen einzelnen Preis. Keine Einstellung ändert das.
Welche Spalten kommen tatsächlich gefüllt zurück?+
Elf der siebzehn, auf den echten Zeilen, die wir haben: query, name, brand, sku, sku_code, rating, url, description, image, images und status. Die sechs, die in jeder Zeile leer waren, sind price, parsed_price, currency, availability, reviews und product_url.
Welche Spalten enthält der Export?+
Siebzehn, in dieser Reihenfolge: query, sku_code, product_url, name, description, parsed_price, price, currency, availability, rating, reviews, images, brand, sku, url, image und status. Eine Zeile je übermittelter Produkt-URL.
Kann ich eine Kategorieseite oder eine Such-URL übermitteln?+
Sie können, aber Sie bekommen damit keine Produkte. Eine Kategorieseite lieferte in unseren Läufen no product data found, und eine /search?q=…-URL lieferte status: ok mit name als „Search Results“ und allen anderen Feldern leer. Vistaprints robots.txt verbietet /search zudem für alle Crawler. Übermitteln Sie Produkt-URLs.
Werden meine Anfragen blockiert?+
Manchmal. Drei der acht Läufe, die wir haben, kamen mit blocked (needs residential proxy) zurück, und einer davon betraf dieselbe URL, die acht Tage später funktionierte. Acht Läufe sind eine viel zu kleine Stichprobe, um daraus eine Erfolgsquote zu nennen, also nennen wir keine - planen Sie aber Wiederholungen ein, statt einen glatten Durchlauf vorauszusetzen.
Warum sind sku und sku_code gleich, und image und images auch?+
Auf beiden unserer echten Zeilen trugen sie identische Werte - PRD- plus acht alphanumerische Zeichen beim Identifikator und eine Cloudinary-URL beim Bild. Das Schema behält die Paare, weil es mit anderen Katalogen geteilt wird, in denen sich die beiden Hälften unterscheiden, prüfen Sie also beide, bevor Sie einen Verknüpfungsschlüssel wählen. Eine Warnung: images enthält Kommas, die zur Cloudinary-Transformation gehören, ein Trennen an Kommas zerstört die URL.
Was bedeutet die Spalte status?+
Sie wird von unserem Exporter geschrieben, nicht von Vistaprint, und meldet, ob die Zeile abgerufen wurde. Über unsere acht Läufe hinweg nahm sie vier Werte an: ok, blocked (needs residential proxy), no product data found und http 404. Eine fehlgeschlagene Zeile kommt trotzdem an und trägt ihren Grund, Sie können also gegen Ihre Eingabeliste abgleichen.
Was kostet es?+
Ihre ersten 500 Zeilen sind gratis, einmalig, ohne Karte. Danach sind es 0,002 $ pro Zeile, abgerechnet nach tatsächlich gelieferten Zeilen, ohne Abo und ohne monatlichen Verfall von Guthaben.
In welchen Formaten kann ich exportieren?+
CSV, JSON oder Excel. Die siebzehn Spalten und ihre Reihenfolge sind in allen dreien gleich.

Den Katalog als Tabelle holen.

Name, Marke, SKU, Bewertung, Beschreibung und Bilder für jede übermittelte Produkt-URL - und eine ehrliche leere Zelle dort, wo Vistaprint keinen Preis veröffentlicht. Ihre ersten 500 Zeilen sind gratis, danach je 0,002 $.

Sofort aktiv · keine Karte erforderlich

Vistaprint-Produktdaten scrapen

Vistaprint verkauft individualisierte Druck- und Werbeartikel - Visitenkarten, Flyer, Beschilderung, bedruckte Kleidung und Taschen - an kleine Unternehmen, und es verkauft sie nach Menge. Dieses Geschäftsmodell ist das Wichtigste, was man vor dem Scrapen verstehen muss, denn es entscheidet, was eine Produktseite sagen kann und was nicht. Fünfzig Visitenkarten, zweihundert, tausend, auf dem einen oder anderen Material, mit der einen oder anderen Veredelung, sind alles verschiedene Preise für ein Produkt. Auf der Seite steht deshalb kein einzelner Preis.

Das ist keine Vermutung. Beide Läufe hinter dieser Seite, die echte Vistaprint-Zeilen lieferten, kamen mit leerem price, parsed_price, currency und availability zurück, und ein direkter Abruf derselben zwei Produktseiten erklärt es: jede liefert rund 745–843 KB serverseitig gerendertes HTML - dies ist keine JavaScript-Hülle, anders als bei manchen Katalogen dieser Familie - dessen ld+json einen Product-Block mit Name, Beschreibung, SKU, MPN und Marke trägt, und keinen Angebots-Knoten und nirgends einen Preis. Bewertung und SKU in diesen strukturierten Daten stimmen exakt mit unserem Export überein, daran erkennen wir, dass die Zeilen echt sind und die leeren Zellen der Quelle gehören und nicht uns.

Was zurückkommt, ist Identität. Über die echten Zeilen hinweg, die wir haben, waren elf der siebzehn Spalten gefüllt: die übermittelte URL, der Produktname, die Marke, beide Identifikatorfelder, die Bewertung, die aufgelöste URL, die Beschreibung, beide Bildfelder und der Status. Der Identifikator kommt als PRD- gefolgt von acht alphanumerischen Zeichen an und stimmt mit dem überein, was die strukturierten Daten der Seite als ihre SKU nennen, was ihn zu einem verlässlichen Verknüpfungsschlüssel gegen Ihre Datensätze macht. Das Bild ist eine Cloudinary-URL, die eine auf Anfrage gerenderte Vorschau umschließt und kein gespeichertes Foto, und eines unserer Bilder lief über 1.697 Zeichen - lang genug, um in einer Spalte fester Breite abgeschnitten zu werden, und mit Kommas innerhalb der Transformation, die die URL zerstören, wenn Sie das Feld daran trennen.

Zwei praktische Hinweise. Übermitteln Sie Produkt-URLs: in unseren Läufen lieferte eine Kategorieseite no product data found und eine Such-URL eine Zeile, deren name „Search Results“ lautete und in der alles andere leer war, und Vistaprints robots.txt verbietet /search für alle Crawler - der rücksichtsvolle und der nützliche Weg stimmen also überein. Und rechnen Sie mit zeitweiser Blockade: drei unserer acht Läufe lieferten blocked (needs residential proxy), darunter einer auf einer URL, die acht Tage später funktionierte. Acht Läufe sind eine zu kleine Stichprobe, um daraus eine Erfolgsquote zu nennen, also nennen wir keine - bauen Sie stattdessen Wiederholungen ein. Nur öffentlich zugängliche Seiten, keine Tracker Dritter auf der Datenebene, und Exporte werden nach 30 Tagen automatisch gelöscht. Ihre ersten 500 Zeilen sind gratis und brauchen keine Kreditkarte.