Extracteur de produits Waxie

Deux références article,
et aucun prix.

Waxie est un grossiste en produits d'hygiène et d'entretien : ses pages article portent donc ce dont un système d'achat a besoin - un nom de produit, une description, la référence du distributeur et celle du fabricant - et n'affichent un prix qu'à un compte connecté. Ce service renvoie les dix-sept colonnes. Les champs d'identité reviennent, les champs monétaires non, et nous vous disons lesquels avant votre inscription.

500 lignes gratuites, une seule foispuis 0,002 $ par lignedeux colonnes d'identifiant distinctesCSV · JSON · Excel
Comment ça marche

Une liste d'URL entre, un tableur sort.

  1. ÉTAPE 1Connectez-vous à la plateforme.
  2. ÉTAPE 2Ouvrez le Waxie Products Scraper.
  3. ÉTAPE 3Collez les URL d'article Waxie voulues, une par ligne.
  4. ÉTAPE 4Choisissez votre format de sortie (CSV / JSON / XLSX).
  5. ÉTAPE 5Lancez la tâche.
  6. ÉTAPE 6Téléchargez les résultats - une ligne par URL, dix-sept colonnes.
À quoi s'attendre

Ce qu'il faut savoir avant de lancer.

Les deux colonnes d'identifiant portent des numéros différents

C'est là l'intérêt d'un distributeur. Sur notre ligne réelle, sku_code valait 1033704 - la référence article propre à Waxie - et sku valait 80009, que la page désigne en toutes lettres comme Manufacturer Item. Les deux figurent sur la page en ligne et les deux figurent dans l'export. Chaque page de cette famille vous dit de vérifier les deux avant de choisir une clé de jointure ; voici le cas qui montre pourquoi.

Les colonnes de prix reviennent vides

price, parsed_price, currency et availability étaient vides sur nos deux lignes réelles. Récupérez la page article vous-même et vous verrez pourquoi : un visiteur anonyme obtient le produit et une invitation à se connecter, pas un chiffre. La note de service publiée par Waxie dit la même chose - un site de gros où certaines données ne se lisent pas sans connexion. Nous ne nous connectons pas, donc nous ne les avons pas.

Les prix sont par agence, pas par catalogue

Les URL d'article portent un warehouse-id. C'est un grossiste qui chiffre contre le stock d'une agence précise et les conditions d'un compte précis, seconde raison pour laquelle il n'existe pas de chiffre public unique à lire - même le prix affiché après connexion dépend de qui demande et d'où.

Deux exécutions, la même URL, une complétude différente

Nos deux exécutions réussies ont soumis le même article à cinq minutes d'intervalle et ont toutes deux renvoyé status: ok. La première est revenue avec le nom du produit et rien d'autre ; la seconde a ajouté la description, les deux identifiants et l'URL canonique. Même page, même jour, profondeur différente - traitez donc une ligne maigre comme quelque chose à relancer plutôt que comme la preuve que le champ est absent.

Le fabricant est sur la page mais pas dans la colonne marque

La page article en ligne nomme son fabricant, et notre colonne brand était vide malgré tout sur les deux lignes réelles. Nous l'enregistrons comme une lacune plutôt que de l'expliquer pour l'écarter. En attendant, le nom du fabricant tend à apparaître dans le texte de description.

Chaque ligne dit ce qui s'est passé

La dernière colonne est status, écrite par notre exportateur et non par le site. Sur nos quatre exécutions elle a pris deux valeurs - ok et http 404, cette dernière sur une adresse fictive qui n'existe pas - donc une ligne en échec arrive quand même, avec le motif.

Ce que vous récupérez

Dix-sept colonnes, huit d'entre elles remplies.

Lues dans la ligne d'en-tête d'un véritable export, dans l'ordre de la feuille. Là où nous avons observé une colonne porter une valeur, l'entrée dit à quoi cette valeur ressemblait. Là où nous l'avons observée vide sur chaque ligne, elle le dit à la place.

query
L'URL Waxie que vous avez soumise, répétée sur chaque ligne pour qu'un export couvrant plusieurs articles reste séparable. Sur toutes nos lignes, elle correspondait exactement à url.
sku_code
La référence article propre à Waxie - 1033704 sur notre ligne réelle, le numéro par lequel la page article commence. C'est celui à utiliser quand vous parlez d'une commande avec Waxie.
product_url
La page article canonique. Remplie sur notre exécution la plus complète et égale là à l'URL soumise ; vide sur l'exécution plus maigre du même article, ce qui explique en partie pourquoi cette incohérence mérite d'être connue.
name
Le titre du produit tel que l'énonce la page - WAXIE MULTI-TASK WIPES BUCKETS sur notre ligne. Attendez-vous à une abréviation de distributeur en capitales plutôt qu'à de la prose marketing.
description
Le texte long du produit. Sur notre ligne il portait le détail du conditionnement - la quantité par carton et l'usage de l'article - ce qui, dans un catalogue de gros, est souvent le seul endroit où la taille du lot est écrite. Donnez-lui une colonne large ou un type texte.
parsed_price
Prévue pour porter le prix sous forme de nombre brut. Voyez la note sous le tableau.
price
Prévue pour porter le prix tel qu'affiché.
currency
Prévue pour porter la devise.
availability
Prévue pour porter l'état du stock. Le stock est ici par agence - les URL portent un identifiant d'entrepôt - et le stock d'une agence n'est pas publié à un visiteur anonyme.
rating
Prévue pour porter une note moyenne. Un catalogue de gros destiné à des acheteurs professionnels ne porte généralement pas de notes de consommateurs : écrivez l'importateur pour qu'il accepte la cellule vide.
reviews
Prévue pour porter le nombre d'avis, avec la même réserve que rating.
images
Prévue pour porter toutes les images de la page.
brand
Prévue pour porter le fabricant. Vide sur les deux lignes réelles, alors même que la page article en ligne imprime un nom de fabricant. Enregistrée comme une lacune ; regardez dans description si vous en avez besoin.
sku
La référence article du fabricant - 80009 sur notre ligne réelle, et désignée comme telle sur la page. Différente de sku_code ci-dessus, et celle à utiliser pour rapprocher le même produit physique chez deux distributeurs différents.
url
L'adresse d'où la ligne a été produite. Égale à query sur chaque ligne que nous détenons, ce qui indique que ces requêtes ont été servies sans redirection.
image
Prévue pour porter l'image principale isolée.
status
Un indicateur par ligne écrit par notre exportateur, pas par Waxie. Sur nos quatre exécutions il a pris deux valeurs : ok et http 404. Rapprochez sur cette colonne plutôt que sur le nombre de lignes.

Dix-sept colonnes par ligne · CSV, JSON ou Excel

Pourquoi les colonnes monétaires sont vides, dit sans détour. Nous détenons quatre exécutions de ce service. Deux ont soumis un véritable article Waxie et renvoyé status: ok ; deux ont soumis une adresse fictive qui n'existe pas et renvoyé http 404. Sur les deux lignes réelles, price, parsed_price, currency et availability étaient des chaînes vides - tout comme rating, reviews, brand, image et images. C'est une propriété de la source et non un défaut d'ici : récupérer la page article directement renvoie une page fonctionnelle d'environ 131 Ko montrant le produit, les deux références et une invitation à se connecter, et aucun prix pour qui n'est pas connecté. La propre note de service publiée par Waxie la décrit comme un site de gros où certaines données ne se lisent pas sans connexion, soit le même fait vu de l'autre côté. Une réserve de plus mérite votre attention : nos deux exécutions réussies portaient sur la même URL à cinq minutes d'intervalle, et la première n'a renvoyé que le nom du produit tandis que la seconde a renvoyé la description, les deux identifiants et l'URL canonique. Même page, même jour, profondeur différente. Relancez une ligne maigre avant de conclure qu'un champ est vide.

Usages courants

Ce que deux identifiants permettent.

Rapprochement inter-distributeurs

Retrouver le même produit dans le catalogue d'un autre

sku est la référence du fabricant : elle survit au passage d'un distributeur à l'autre, ce que sku_code ne fait pas. C'est la clé de jointure pour demander si l'article que vous achetez chez Waxie est celui qu'un concurrent référence - une question à laquelle un rapprochement par nom ne répond pas de façon fiable sur des libellés commerciaux en capitales.

Achats · Sourcing
Rapprochement de catalogue

Aligner vos écritures d'achat sur les leurs

sku_code est le numéro que Waxie utilise dans son propre système, c'est donc celui contre lequel rapprocher commandes et factures. Conservez les deux colonnes et vous pourrez parler au distributeur dans sa numérotation et à votre propre base dans celle du fabricant.

Achats · Écritures
Saisie du conditionnement

Extraire la quantité par carton de la description

Dans un catalogue de gros, le détail du conditionnement est fréquemment écrit dans le texte produit plutôt qu'exposé comme un champ, et notre ligne n'a pas fait exception. description est l'endroit d'où l'analyser si votre système a besoin d'une quantité par carton à côté de l'article.

Ops e-commerce · Catalogue
Suivi d'assortiment

Surveiller ce qu'un distributeur référence

Lancez un jeu d'URL d'article selon un calendrier et conservez name, description et les deux identifiants avec la date d'exécution. Vous n'obtiendrez pas de mouvement de prix ainsi, mais vous verrez des produits renommés, redécrits ou retirés, ce qu'un grossiste annonce rarement.

Étude de catégorie · Assortiment
Tarifs

Ne payez que ce que vous utilisez réellement.

Offre gratuite

Les 500 premières lignes sont gratuites

Une seule fois, à l'inscription. Sans carte, et sans rien à résilier ensuite.

Une seule fois, à l'inscription
Tarif

puis 0,002 $ par ligne

Facturé sur les lignes réellement renvoyées. Une ligne qui revient avec un status autre qu'un succès n'est pas une ligne de données produit, et ne vous est pas facturée comme telle.

Facturé sur les lignes renvoyées
Sans abonnement

Rien de récurrent

Les crédits n'expirent pas au rythme mensuel. Lancez un balayage de catalogue en mars puis plus rien jusqu'en septembre si le travail a cette forme.

Aucune expiration mensuelle
10 % de remise sur votre première exécution payante.Utilisez le code LIVESCRAPER10 au paiement.
S'inscrire
S'associe bien avec

D'autres catalogues, les mêmes dix-sept colonnes.

Le volet juridique

Est-il légal de scraper Waxie ?

Des faits produit sur une page accessible au public relèvent de l'information concurrentielle ordinaire. Les réserves à signaler ici portent sur la frontière de la connexion et sur un site qui ne publie pas de fichier robots.

Un nom de produit, une description et une référence article sont des faits sur des biens mis en vente. Les lire sur une page servie à tout visiteur, c'est la même activité qu'un acheteur mène à la main, à une vitesse utile. Rien dans les dix-sept colonnes ne décrit une personne : ni nom, ni adresse e-mail, ni téléphone, ni compte - les questions de protection des données qui façonnent nos services portant sur des personnes ne se posent donc pas ici.

La frontière qui compte sur ce site, c'est la connexion. Waxie est un grossiste, et les prix, le stock d'agence et les conditions de compte sont derrière sa connexion Web@Work - la propre note publiée du service le dit. Nous ne nous connectons pas, nous n'utilisons les identifiants de personne et nous ne contournons pas l'invitation : ce que ce service atteint est ce qu'atteint un visiteur anonyme. C'est une limite réelle et non temporaire : si le chiffre dont vous avez besoin n'apparaît qu'une fois connecté sous un compte donné, rien ici ne le produira. Autant être franc aussi sur le second point - shop.waxie.com ne sert aucun robots.txt, la requête renvoie 404. Nous lisons cela comme l'absence d'instruction et non comme une permission, et c'est pourquoi ce service reste sur le même terrain que partout ailleurs : pages publiques, anonyme, à un rythme mesuré.

Nos propres conditions sont les mêmes que pour tous les autres services d'ici. Uniquement des pages accessibles au public, rien derrière une connexion, aucun traqueur tiers sur la couche de données, et les exports sont supprimés automatiquement au bout de 30 jours. Vos 500 premières lignes sont gratuites et n'exigent pas de carte.

livescraper.app · ce qui encadre une exécution
Une URL d'article par ligne
Accès anonyme uniquement
Les prix restent derrière la connexion Web@Work
Aucun robots.txt publié sur le site
Les exports sont supprimés au bout de 30 jours
Un grossiste chiffre par compte et par agence. Ce service est le visiteur anonyme : il ne voit donc ni l'un ni l'autre.
Questions fréquentes

Ce que l'on demande avant de s'inscrire.

L'export contient-il les prix Waxie ?+
Non. price, parsed_price, currency et availability étaient vides sur nos deux lignes réelles. Waxie est un site de gros et n'affiche les prix qu'à un compte Web@Work connecté - sa propre note de service publiée indique que certaines données ne se lisent pas sans connexion. Nous ne nous connectons pas et n'utilisons les identifiants de personne : ce service voit ce que voit un visiteur anonyme. Aucun réglage n'y changera rien.
Pourquoi deux références article, et laquelle utiliser ?+
Ce sont deux choses différentes. sku_code est la référence article propre à Waxie - 1033704 sur notre ligne - et sku est celle du fabricant, 80009, que la page désigne comme l'article du fabricant. Utilisez sku_code pour parler d'une commande avec Waxie, et sku pour retrouver le même produit physique dans le catalogue d'un autre.
Quelles colonnes reviennent réellement remplies ?+
Sur la plus complète de nos deux lignes réelles : query, sku_code, product_url, name, description, sku, url et status. Vides sur chaque ligne que nous détenons : parsed_price, price, currency, availability, rating, reviews, images, brand et image.
Pourquoi deux exécutions de la même URL ont-elles renvoyé des quantités différentes ?+
Nous l'ignorons, et nous préférons vous dire que c'est arrivé plutôt que de le cacher. Nos deux exécutions réussies ont soumis le même article à cinq minutes d'intervalle et ont toutes deux signalé ok ; la première n'a renvoyé que le nom du produit et la seconde a ajouté la description, les deux identifiants et l'URL canonique. Le conseil pratique est de relancer une ligne maigre avant de conclure qu'un champ est vide pour ce produit.
Quelles colonnes l'export contient-il ?+
Dix-sept, dans cet ordre : query, sku_code, product_url, name, description, parsed_price, price, currency, availability, rating, reviews, images, brand, sku, url, image et status. Une ligne par URL d'article soumise.
La page nomme un fabricant - pourquoi la colonne marque est-elle vide ?+
Elle ne devrait pas l'être, et elle l'était, sur les deux lignes réelles. Nous l'enregistrons comme une lacune plutôt que de l'habiller. En attendant, le nom du fabricant tend à figurer dans description : c'est de là qu'il faut l'analyser.
Que signifie la colonne status ?+
Elle est écrite par notre exportateur, pas par Waxie, et signale si cette ligne a été récupérée. Sur nos quatre exécutions elle a pris deux valeurs : ok sur les deux requêtes d'article réel et http 404 sur deux exécutions ayant soumis une adresse fictive qui n'existe pas. Une ligne en échec arrive quand même avec son motif.
Combien ça coûte ?+
Vos 500 premières lignes sont gratuites, une seule fois, sans carte. Ensuite c'est 0,002 $ par ligne, facturé sur les lignes réellement renvoyées, sans abonnement et sans expiration mensuelle des crédits.
Dans quels formats puis-je exporter ?+
CSV, JSON ou Excel. Les dix-sept colonnes et leur ordre sont identiques dans les trois.

Récupérez le catalogue sous forme de tableau.

Nom, description et les deux références pour chaque URL Waxie soumise - et une cellule vide honnête là où le prix est derrière une connexion. Vos 500 premières lignes sont gratuites, puis 0,002 $ l'unité.

Actif immédiatement · sans carte bancaire

Extraire les données produit de Waxie

Waxie est un grossiste en produits d'hygiène et d'entretien qui vend à des comptes professionnels et non à des particuliers, et cela façonne ce qu'une page article peut vous dire. Les champs utiles sont ceux dont un système d'achat a besoin - un nom de produit, une description portant le détail du conditionnement, et deux références article distinctes - tandis que le prix, le stock d'agence et les conditions de compte sont derrière la connexion Web@Work. La propre note publiée du service le dit clairement : un site de gros B2B où certaines données ne se lisent pas sans connexion.

Les deux colonnes d'identifiant sont la raison pour laquelle cet export vaut la peine. Sur la ligne réelle que nous détenons, sku_code valait 1033704 - la référence article propre à Waxie, celle par laquelle la page commence et celle à citer sur une commande - et sku valait 80009, que la page désigne en toutes lettres comme la référence article du fabricant. Les deux valeurs figurent sur la page en ligne, et c'est ainsi que nous savons que la ligne est authentique plutôt qu'un accident d'analyse. Chaque scraper de cette famille conseille de vérifier les deux champs d'identifiant avant de choisir une clé de jointure ; Waxie est le cas qui montre pourquoi cela compte. La référence du fabricant est celle qui survit au passage d'un distributeur à un autre : c'est donc la colonne sur laquelle rapprocher quand vous demandez si deux catalogues référencent le même produit physique. Celle du distributeur est celle qui se rapproche des bons de commande.

Ce qui ne revient pas, c'est l'argent. price, parsed_price, currency et availability étaient vides sur nos deux lignes réelles, tout comme rating, reviews, brand, image et images. Récupérer la page article directement explique le premier groupe : elle renvoie une page fonctionnelle d'environ 131 Ko montrant le produit, les deux références et une invitation à se connecter, sans le moindre chiffre pour un visiteur non connecté. Les URL d'article portent en outre un identifiant d'entrepôt : même le prix affiché après connexion est donc borné à une agence et à un compte - il n'existe pas de nombre public unique que quiconque pourrait lire. Le brand vide, en revanche, est une véritable lacune et non une propriété de la source, car la page en ligne imprime bel et bien un fabricant, et nous l'enregistrons comme telle.

Une réserve de cohérence mérite d'être dite plutôt qu'enfouie. Nos deux exécutions réussies ont soumis la même URL d'article à cinq minutes d'intervalle et ont toutes deux signalé un succès, mais la première n'a renvoyé que le nom du produit tandis que la seconde a ajouté la description, les deux identifiants et l'URL canonique. Même page, même jour, profondeur différente. Relancez une ligne maigre avant de conclure qu'un champ est absent pour ce produit. Deux exécutions constituent par ailleurs un échantillon bien trop petit pour en tirer un taux de réussite, nous n'en citons donc aucun. Notons enfin que shop.waxie.com ne publie pas de robots.txt - la requête renvoie 404 - ce que nous traitons comme l'absence d'instruction et non comme une permission : uniquement des pages accessibles au public, anonyme, à un rythme mesuré, aucun traqueur tiers sur la couche de données, et les exports sont supprimés automatiquement au bout de 30 jours. Vos 500 premières lignes sont gratuites et n'exigent pas de carte.