Extracteur de produits Vistaprint

Un catalogue d'imprimerie qui
n'a pas de prix unique.

Vistaprint vend l'impression à la quantité - cinquante cartes de visite, puis cent, puis cinq cents, chaque palier à son tarif. Une page produit affiche donc un nom, un SKU, une note et une description, et aucun prix. Ce service renvoie les dix-sept colonnes ; six d'entre elles reviennent vides, et nous préférons vous dire lesquelles avant votre inscription plutôt qu'après.

500 lignes gratuites, une seule foispuis 0,002 $ par ligneonze colonnes remplies, six videsCSV · JSON · Excel
Comment ça marche

Une liste d'URL entre, un tableur sort.

  1. ÉTAPE 1Connectez-vous à la plateforme.
  2. ÉTAPE 2Ouvrez le Vistaprint Products Scraper.
  3. ÉTAPE 3Collez les URL produit Vistaprint voulues, une par ligne - pas de pages de catégorie ni de recherche.
  4. ÉTAPE 4Choisissez votre format de sortie (CSV / JSON / XLSX).
  5. ÉTAPE 5Lancez la tâche.
  6. ÉTAPE 6Téléchargez les résultats - une ligne par URL, dix-sept colonnes.
À quoi s'attendre

Ce qu'il faut savoir avant de lancer.

Les colonnes de prix reviennent vides

Sur les deux exécutions ayant renvoyé de vraies lignes Vistaprint, price, parsed_price, currency et availability étaient toutes vides. Ce n'est pas une lacune du scraper. Demandez une page produit et lisez ses données structurées : le bloc Product porte nom, description, SKU, MPN et marque, et il n'y a aucun nœud d'offre ni aucun prix nulle part. Vistaprint chiffre à la quantité et à la finition : la page n'a pas de chiffre unique à mettre dans une cellule.

Ce qu'elle renvoie, c'est l'identité

Nom, marque, SKU, note, description et URL d'image sont revenus remplis sur chaque ligne produit réelle. C'est assez pour rapprocher un article Vistaprint de votre propre catalogue, pour suivre quels produits existent et comment ils sont décrits, et pour récupérer les visuels - ce n'est simplement pas assez pour construire une comparaison de prix.

Donnez-lui des pages produit, pas des pages de catégorie ou de recherche

Nous avons la preuve dans les deux sens. Une URL produit a renvoyé une ligne complète. La page de catégorie au niveau au-dessus a renvoyé no product data found, et une URL /search?q=… a renvoyé status: ok avec name valant « Search Results » et tous les autres champs vides - un titre de page, pas un produit. Le robots.txt de Vistaprint interdit d'ailleurs /search à tous les robots.

Vistaprint repousse certaines requêtes

Sur les huit exécutions dont nous disposons, trois sont revenues avec blocked (needs residential proxy). L'une d'elles portait sur la même URL de cartes de visite qui a réussi huit jours plus tard. Le blocage est donc réel et intermittent ; nous n'allons pas vous citer un taux de réussite tiré de huit exécutions, et vous devriez prévoir des reprises dans tout planning.

Ne découpez pas le champ images sur les virgules

image et images portaient la même valeur sur les deux lignes réelles, et cette valeur est une URL de transformation Cloudinary - c_scale,dpr_auto,f_auto,q_auto:best et ainsi de suite. Les virgules appartiennent à l'URL. Les utiliser comme séparateur produit des fragments qui ne résolvent rien. L'une de nos deux lignes portait une URL d'image de 1 697 caractères : donnez de la place à la colonne.

Chaque ligne dit ce qui s'est passé

La dernière colonne est status, écrite par notre exportateur et non par le site. Sur nos huit exécutions elle a pris quatre valeurs distinctes - ok, blocked (needs residential proxy), no product data found et http 404 - donc une ligne en échec arrive quand même, avec le motif.

Ce que vous récupérez

Dix-sept colonnes, onze d'entre elles remplies.

Lues dans la ligne d'en-tête d'un véritable export, dans l'ordre de la feuille. Là où nous avons observé une colonne porter une valeur, l'entrée dit à quoi cette valeur ressemblait. Là où nous l'avons observée vide sur chaque ligne, elle le dit à la place.

query
L'URL Vistaprint que vous avez soumise, répétée sur chaque ligne pour qu'un export portant sur de nombreux produits reste séparable. Sur toutes nos lignes, elle correspondait exactement à url.
sku_code
Le code produit. Sur les deux lignes réelles il était identique à sku, sous la forme PRD- suivi de huit caractères alphanumériques. Deux colonnes d'identifiant, une valeur - prenez l'une ou l'autre, mais vérifiez les deux si vous faites une jointure, car dans cette famille de schémas elles sont remplies indépendamment.
product_url
Prévue pour porter la page produit canonique. Utilisez url à la place.
name
Le titre du produit tel que la page l'énonce - « Standard Business Cards » sur l'une de nos lignes, « VistaPrint® Printed Baseball Cap » sur l'autre. Notez le signe de marque déposée : il est dans la source et il survit jusque dans la cellule.
description
La description commerciale de la page, environ 150 à 180 caractères sur nos lignes. Elle mérite d'être lue plutôt qu'écartée : sur la ligne des cartes de visite, la seule information de prix de tout l'enregistrement était une formule à l'intérieur de ce texte, pas un nombre dans une colonne de prix.
parsed_price
Prévue pour porter le prix sous forme de nombre brut. Voyez la note sous le tableau.
price
Prévue pour porter le prix tel qu'affiché.
currency
Prévue pour porter la devise dans laquelle le prix est libellé.
availability
Prévue pour porter l'état du stock. L'impression à la commande n'a pas d'état de stock comme en a une marchandise stockée.
rating
La note moyenne, et l'un des champs qui reviennent bel et bien - « 4.7 » et « 4.3 » sur nos deux lignes. Elle arrive sous forme de chaîne de caractères, pas de nombre : convertissez-la avant de trier dessus.
reviews
Prévue pour porter le nombre d'avis. Vide sur les deux lignes réelles, alors même que les données structurées de la page produit publient bien un nombre d'avis à côté de la note. Nous l'enregistrons comme une lacune plutôt que de l'expliquer pour l'écarter.
images
Toutes les images que porte la page. Sur les deux lignes réelles, identique à image. Ne la découpez pas sur les virgules - les virgules font partie de la transformation Cloudinary.
brand
Le fabricant ou la marque. « Vistaprint » sur nos deux lignes, ce à quoi on s'attend d'un imprimeur en marque propre ; traitez une valeur différente comme une information et non comme une erreur.
sku
La référence article. Identique à sku_code sur les deux lignes réelles, et la clé de jointure la plus utile de l'enregistrement - c'est la valeur que les données structurées de la page publient comme son SKU.
url
L'adresse d'où la ligne a été produite. Égale à query sur chaque ligne que nous détenons, ce qui indique que ces requêtes ont été servies sans redirection.
image
L'image principale isolée. Une URL Cloudinary sur cms.cloudinary.vpsvc.com enveloppant un aperçu rendu depuis rendering.documents.cimpress.io - le visuel est généré à la demande plutôt que stocké comme photographie. L'une des nôtres atteignait 1 697 caractères : une colonne de largeur fixe la tronquera.
status
Un indicateur par ligne écrit par notre exportateur, pas par Vistaprint. Sur nos huit exécutions il a pris quatre valeurs : ok, blocked (needs residential proxy), no product data found et http 404. Rapprochez sur cette colonne plutôt que sur le nombre de lignes.

Dix-sept colonnes par ligne · CSV, JSON ou Excel

Pourquoi les quatre colonnes de prix sont vides, dit sans détour. Nous détenons huit exécutions ; deux ont renvoyé de vraies lignes produit Vistaprint, et sur les deux price, parsed_price, currency et availability étaient des chaînes vides. Ce n'est pas un défaut du scraper. Demander directement l'une ou l'autre de ces pages produit renvoie environ 745 à 843 Ko de HTML rendu côté serveur dont le ld+json contient un bloc Product avec nom, description, SKU, MPN et marque - et aucun nœud d'offre ni aucun prix d'aucune sorte. Vistaprint chiffre à la quantité, au support et à la finition : il n'existe donc pas de prix produit unique que la page puisse publier ni que nous puissions lire. La note et le SKU de ces mêmes données structurées correspondent exactement à notre export, et c'est ainsi que nous savons que les lignes sont authentiques et non un accident d'analyse. Si votre travail a besoin des prix Vistaprint, ce service ne les fournira pas, et aucun réglage n'y changera rien.

Usages courants

À quoi servent les données d'identité.

Rapprochement de catalogues

Aligner vos fiches sur les leurs

sku arrive sous une forme PRD- propre et c'est la valeur même que la page produit publie comme son SKU, ce qui en fait une clé de jointure fiable. Associez-la à name et brand et vous pouvez rapprocher une liste d'articles Vistaprint de la vôtre sans faire correspondre du texte libre.

Ops e-commerce · Catalogue
Suivi d'assortiment

Surveiller ce qui existe, pas ce que ça coûte

Lancez un jeu d'URL produit selon un calendrier et conservez name, description et rating avec la date d'exécution. Les produits sont renommés, repositionnés et redécrits bien plus souvent que quiconque ne l'annonce, et la série le montre.

Étude de catégorie · Assortiment
Visuel et texte

Récupérer la description et l'image rendue

description et image reviennent remplis. L'image est un rendu Cloudinary en direct et non une photographie stockée : traitez l'URL comme l'artefact et récupérez-la quand vous avez besoin du fichier.

Contenu · Enrichissement
Relevés de note

Suivre la note dans le temps

rating fait partie des champs qui arrivent de façon fiable. C'est une chaîne, convertissez-la d'abord. N'oubliez pas que reviews revient vide : vous avez la note sans l'effectif derrière - assez pour une courbe de tendance, pas assez pour classer des produits entre eux.

Étude produit · Avis
Tarifs

Ne payez que ce que vous utilisez réellement.

Offre gratuite

Les 500 premières lignes sont gratuites

Une seule fois, à l'inscription. Sans carte, et sans rien à résilier ensuite.

Une seule fois, à l'inscription
Tarif

puis 0,002 $ par ligne

Facturé sur les lignes réellement renvoyées. Une ligne qui revient avec un status autre qu'un succès n'est pas une ligne de données produit, et ne vous est pas facturée comme telle.

Facturé sur les lignes renvoyées
Sans abonnement

Rien de récurrent

Les crédits n'expirent pas au rythme mensuel. Lancez un balayage de catalogue en mars puis plus rien jusqu'en septembre si le travail a cette forme.

Aucune expiration mensuelle
10 % de remise sur votre première exécution payante.Utilisez le code LIVESCRAPER10 au paiement.
S'inscrire
S'associe bien avec

D'autres catalogues, les mêmes dix-sept colonnes.

Le volet juridique

Est-il légal de scraper Vistaprint ?

Des faits produit sur une page accessible au public relèvent de l'information concurrentielle ordinaire. Les réserves à signaler ici portent sur les pages que vous demandez et sur l'usage que vous faites des visuels.

Un nom de produit, une marque, un SKU et une note sont des faits sur des biens mis en vente. Les lire sur une page servie à tout visiteur, c'est la même activité qu'un acheteur mène à la main, à une vitesse utile. Rien dans les dix-sept colonnes ne décrit une personne : ni nom, ni adresse e-mail, ni téléphone, ni compte - les questions de protection des données qui façonnent nos services portant sur des personnes ne se posent donc pas ici.

Deux réserves sont propres à ce site. D'abord, les pages que vous demandez : le robots.txt de Vistaprint ne comporte pas de Disallow: / général pour les robots ordinaires, et les chemins produit que nous avons testés ne sont pas interdits - mais /search l'est, pour tous les agents. Cela compte parce qu'une URL de recherche figure dans les exemples d'entrée publiés pour ce service, et que l'une de nos propres exécutions en a soumis une. Elle est revenue avec un titre de page et aucun produit de toute façon : le conseil et la courtoisie pointent donc dans le même sens, soumettez des URL produit. Ensuite, les visuels : le champ image résout vers un aperçu généré par la propre chaîne de rendu de Vistaprint, et ces rendus comme les descriptions qui les accompagnent sont l'œuvre protégée de quelqu'un. Les exploiter en interne pour rapprocher, enrichir ou surveiller un catalogue est une pratique courante ; les republier comme les vôtres est une autre question, avec une autre réponse.

Nos propres conditions sont les mêmes que pour tous les autres services d'ici. Uniquement des pages accessibles au public, rien derrière une connexion, aucun traqueur tiers sur la couche de données, et les exports sont supprimés automatiquement au bout de 30 jours. Vos 500 premières lignes sont gratuites et n'exigent pas de carte.

livescraper.app · ce qui encadre une exécution
Une URL produit par ligne
Des pages produit, pas de catégorie ni de recherche
Aucune donnée de prix - la page n'en publie pas
Accès anonyme uniquement
Les exports sont supprimés au bout de 30 jours
La seule chose que ce service ne peut pas vous donner, c'est un prix Vistaprint, et cela tient à la source plutôt qu'au scraper.
Questions fréquentes

Ce que l'on demande avant de s'inscrire.

L'export contient-il les prix Vistaprint ?+
Non. Sur les deux exécutions ayant renvoyé de vraies lignes produit, price, parsed_price, currency et availability étaient vides. La raison est dans la source : demandez une page produit Vistaprint et ses données structurées contiennent un bloc Product avec nom, description, SKU, MPN et marque, et aucun nœud d'offre ni aucun prix. Vistaprint chiffre à la quantité et à la finition : il n'y a pas de prix unique sur la page. Aucun réglage n'y changera rien.
Quelles colonnes reviennent réellement remplies ?+
Onze des dix-sept, sur les lignes réelles que nous détenons : query, name, brand, sku, sku_code, rating, url, description, image, images et status. Les six vides sur chaque ligne sont price, parsed_price, currency, availability, reviews et product_url.
Quelles colonnes l'export contient-il ?+
Dix-sept, dans cet ordre : query, sku_code, product_url, name, description, parsed_price, price, currency, availability, rating, reviews, images, brand, sku, url, image et status. Une ligne par URL produit soumise.
Puis-je soumettre une page de catégorie ou une URL de recherche ?+
Vous pouvez, mais cela ne vous donnera pas de produits. Une page de catégorie a renvoyé no product data found dans nos exécutions, et une URL /search?q=… a renvoyé status: ok avec name valant « Search Results » et tous les autres champs vides. Le robots.txt de Vistaprint interdit d'ailleurs /search à tous les robots. Soumettez des URL produit.
Mes requêtes vont-elles être bloquées ?+
Parfois. Trois des huit exécutions que nous détenons sont revenues avec blocked (needs residential proxy), et l'une d'elles portait sur la même URL qui a réussi huit jours plus tard. Huit exécutions constituent un échantillon bien trop petit pour en tirer un taux de réussite, nous n'en citerons donc pas - mais prévoyez des reprises plutôt que de supposer un passage sans accroc.
Pourquoi sku et sku_code sont-ils identiques, et image et images aussi ?+
Sur nos deux lignes réelles ils portaient des valeurs identiques - PRD- plus huit alphanumériques pour l'identifiant, et une URL Cloudinary pour l'image. Le schéma conserve les paires parce qu'il est partagé avec d'autres catalogues où les deux moitiés diffèrent : vérifiez donc les deux avant de choisir une clé de jointure. Un avertissement : images contient des virgules qui appartiennent à la transformation Cloudinary, découper ce champ sur une virgule cassera l'URL.
Que signifie la colonne status ?+
Elle est écrite par notre exportateur, pas par Vistaprint, et signale si cette ligne a été récupérée. Sur nos huit exécutions elle a pris quatre valeurs : ok, blocked (needs residential proxy), no product data found et http 404. Une ligne en échec arrive quand même avec son motif : vous pouvez rapprocher de votre liste d'entrée.
Combien ça coûte ?+
Vos 500 premières lignes sont gratuites, une seule fois, sans carte. Ensuite c'est 0,002 $ par ligne, facturé sur les lignes réellement renvoyées, sans abonnement et sans expiration mensuelle des crédits.
Dans quels formats puis-je exporter ?+
CSV, JSON ou Excel. Les dix-sept colonnes et leur ordre sont identiques dans les trois.

Récupérez le catalogue sous forme de tableau.

Nom, marque, SKU, note, description et images pour chaque URL produit soumise - et une cellule vide honnête là où Vistaprint ne publie aucun prix. Vos 500 premières lignes sont gratuites, puis 0,002 $ l'unité.

Actif immédiatement · sans carte bancaire

Extraire les données produit de Vistaprint

Vistaprint vend de l'impression et des articles promotionnels personnalisés - cartes de visite, flyers, signalétique, vêtements et sacs marqués - à de petites entreprises, et il les vend à la quantité. Ce modèle commercial est la chose la plus importante à comprendre avant de le scraper, car il décide de ce qu'une page produit peut et ne peut pas vous dire. Cinquante cartes de visite, deux cents, mille, sur tel ou tel support, avec telle ou telle finition, sont autant de prix différents pour un même produit. Il n'y a donc pas de prix unique sur la page.

Ce n'est pas une supposition. Les deux exécutions derrière cette page ayant renvoyé de vraies lignes Vistaprint sont revenues avec price, parsed_price, currency et availability vides, et demander directement ces deux mêmes pages produit l'explique : chacune renvoie environ 745 à 843 Ko de HTML rendu côté serveur - ce n'est pas une coquille JavaScript, contrairement à certains catalogues de cette famille - dont le ld+json porte un bloc Product avec nom, description, SKU, MPN et marque, et aucun nœud d'offre ni aucun prix nulle part. La note et le SKU publiés dans ces données structurées correspondent exactement à notre export, et c'est ainsi que nous savons que les lignes sont authentiques et que les cellules vides appartiennent à la source, pas à nous.

Ce qui revient, c'est l'identité. Sur les lignes réelles que nous détenons, onze des dix-sept colonnes étaient remplies : l'URL soumise, le nom du produit, la marque, les deux champs d'identifiant, la note, l'URL résolue, la description, les deux champs d'image et le statut. L'identifiant arrive sous la forme PRD- suivi de huit alphanumériques et correspond à ce que les données structurées de la page appellent son SKU, ce qui en fait une clé de jointure fiable contre vos fiches. L'image est une URL Cloudinary enveloppant un aperçu rendu à la demande plutôt qu'une photographie stockée, et l'une des nôtres atteignait 1 697 caractères - assez longue pour être tronquée dans une colonne de largeur fixe, et porteuse de virgules internes à la transformation qui corrompront l'URL si vous découpez le champ dessus.

Deux précautions pratiques. Soumettez des URL produit : dans nos exécutions, une page de catégorie a renvoyé no product data found et une URL de recherche a renvoyé une ligne dont le name valait « Search Results » avec tout le reste vide, et le robots.txt de Vistaprint interdit /search à tous les robots - la voie courtoise et la voie utile coïncident donc. Et attendez-vous à un blocage intermittent : trois de nos huit exécutions ont renvoyé blocked (needs residential proxy), dont une sur une URL qui a réussi huit jours plus tard. Huit exécutions forment un échantillon trop petit pour en tirer un taux de réussite, nous n'en citons donc aucun - prévoyez des reprises à la place. Uniquement des pages accessibles au public, aucun traqueur tiers sur la couche de données, et les exports sont supprimés automatiquement au bout de 30 jours. Vos 500 premières lignes sont gratuites et n'exigent pas de carte.