Extractor de Productos de Waxie

Dos números de artículo,
y ningún precio.

Waxie es un mayorista de suministros de limpieza e higiene, así que sus páginas de artículo llevan lo que necesita un sistema de compras -un nombre de producto, una descripción, el número de artículo del distribuidor y el del fabricante- y solo muestran un precio a una cuenta con la sesión iniciada. Este servicio devuelve las diecisiete columnas. Los campos de identidad vuelven; los de dinero no, y te decimos cuáles antes de que te registres.

500 filas gratis por única vezdespués 0,002 $ por filados columnas de identificador distintasCSV · JSON · Excel
Cómo funciona

Una lista de URLs entra, una hoja de cálculo sale.

  1. PASO 1Inicia sesión en la plataforma.
  2. PASO 2Abre el Waxie Products Scraper.
  3. PASO 3Pega las URLs de artículo de Waxie que quieras, una por línea.
  4. PASO 4Elige tu formato de salida (CSV / JSON / XLSX).
  5. PASO 5Lanza el trabajo.
  6. PASO 6Descarga los resultados: una fila por URL, diecisiete columnas.
Qué esperar

Lo que conviene saber antes de lanzarlo.

Las dos columnas de identificador llevan números distintos

Esto es lo útil de un distribuidor. En nuestra fila real sku_code era 1033704 -el propio número de artículo de Waxie- y sku era 80009, que la página etiqueta con todas las letras como Manufacturer Item. Los dos están en la página en vivo y los dos están en la exportación. Todas las páginas de esta familia te dicen que revises ambos antes de elegir una clave de cruce; este es el caso que enseña por qué.

Las columnas de precio vuelven vacías

price, parsed_price, currency y availability estaban vacías en nuestras dos filas reales. Pide tú mismo la página de artículo y verás por qué: un visitante anónimo recibe el producto y un aviso de inicio de sesión, no una cifra. La nota de servicio publicada de Waxie dice lo mismo: un sitio mayorista donde algunos datos no se pueden leer sin login. No iniciamos sesión, así que no los tenemos.

Los precios son por sucursal, no por catálogo

Las URLs de artículo llevan un warehouse-id. Es un mayorista cotizando contra el stock de una sucursal concreta y las condiciones de una cuenta concreta, que es una segunda razón por la que no hay una única cifra pública que leer: incluso la cifra con sesión iniciada depende de quién pregunta y desde dónde.

Dos ejecuciones, la misma URL, distinta completitud

Nuestras dos ejecuciones correctas enviaron el mismo artículo con cinco minutos de diferencia y las dos devolvieron status: ok. La primera volvió con el nombre del producto y nada más; la segunda añadió la descripción, ambos identificadores y la URL canónica. Misma página, mismo día, distinta profundidad, así que trata una fila escasa como algo que reintentar y no como prueba de que el campo no existe.

El fabricante está en la página pero no en la columna de marca

La página de artículo en vivo nombra a su fabricante, y aun así nuestra columna brand estaba vacía en las dos filas reales. Lo registramos como una carencia en vez de explicarlo de largo. Mientras tanto, el nombre del fabricante suele aparecer dentro del texto de la descripción.

Cada fila dice qué pasó

La última columna es status, escrita por nuestro exportador y no por el sitio. A lo largo de nuestras cuatro ejecuciones tomó dos valores -ok y http 404, este último en una dirección de marcador que no existe-, así que una fila que falló llega igualmente con el motivo.

Lo que recibes

Diecisiete columnas, ocho de ellas con datos.

Leídas de la cabecera de una exportación real, en el orden de la hoja. Donde observamos que una columna lleva un valor, aquí se dice cómo era ese valor. Donde la observamos vacía en todas las filas, se dice eso en su lugar.

query
La URL de Waxie que enviaste, repetida en cada fila para que una exportación con muchos artículos siga siendo separable. En todas nuestras filas coincidía exactamente con url.
sku_code
El número de artículo propio de Waxie -1033704 en nuestra fila real, la cifra con la que abre la página del artículo. Es el que usar cuando hables con Waxie de un pedido.
product_url
La página de artículo canónica. Con datos en nuestra ejecución más completa e igual allí a la URL enviada; vacía en la ejecución más escasa del mismo artículo, que es parte de por qué esa inconsistencia merece conocerse.
name
El título del producto tal como lo indica la página: WAXIE MULTI-TASK WIPES BUCKETS en nuestra fila. Espera abreviatura de distribuidor en mayúsculas y no prosa de marketing.
description
El texto largo del producto. En nuestra fila llevaba el desglose del embalaje -la cantidad por caja y con qué se usa el artículo-, que en un catálogo mayorista es a menudo el único sitio donde figura el tamaño del paquete. Dale una columna ancha o un tipo texto.
parsed_price
Pensada para llevar el precio como número puro. Mira la nota bajo la tabla.
price
Pensada para llevar el precio tal como se muestra.
currency
Pensada para llevar la moneda.
availability
Pensada para llevar el estado de stock. Aquí el stock es por sucursal -las URLs llevan un identificador de almacén- y el stock de una sucursal no se publica a un visitante anónimo.
rating
Pensada para llevar una valoración media. Un catálogo mayorista para compradores profesionales normalmente no lleva valoraciones de consumidor, así que escribe el importador para aceptar la celda vacía.
reviews
Pensada para llevar el recuento de reseñas, con la misma advertencia que rating.
images
Pensada para llevar todas las imágenes de la página.
brand
Pensada para llevar el fabricante. Vacía en las dos filas reales, aunque la página de artículo en vivo imprime un nombre de fabricante. Registrada como carencia; mira en description si lo necesitas.
sku
El número de artículo del fabricante -80009 en nuestra fila real, y etiquetado así en la página. Distinto de sku_code de arriba, y el que usar cuando cruzas el mismo producto físico entre dos distribuidores diferentes.
url
La dirección desde la que se produjo la fila. Igual a query en todas las filas que tenemos, lo que indica que esas peticiones se sirvieron sin redirigir.
image
Pensada para llevar la imagen principal por separado.
status
Un indicador por fila escrito por nuestro exportador, no por Waxie. A lo largo de nuestras cuatro ejecuciones tomó dos valores: ok y http 404. Concilia por esta columna y no por el número de filas.

Diecisiete columnas por fila · CSV, JSON o Excel

Por qué están vacías las columnas de dinero, dicho sin rodeos. Tenemos cuatro ejecuciones de este servicio. Dos enviaron un artículo real de Waxie y devolvieron status: ok; dos enviaron una dirección de marcador que no existe y devolvieron http 404. En las dos filas reales, price, parsed_price, currency y availability eran cadenas vacías, y también lo eran rating, reviews, brand, image e images. Eso es una propiedad de la fuente y no un defecto de aquí: pedir la página de artículo directamente devuelve una página funcional de unos 131 KB que muestra el producto, ambos números de artículo y un aviso de inicio de sesión, y ningún precio para quien no ha entrado. La propia nota de servicio publicada de Waxie la describe como un sitio mayorista donde algunos datos no se pueden leer sin login, que es el mismo hecho desde el otro lado. Una advertencia más merece tu atención: nuestras dos ejecuciones correctas fueron la misma URL con cinco minutos de diferencia, y la primera devolvió solo el nombre del producto mientras que la segunda devolvió la descripción, ambos identificadores y la URL canónica. Misma página, mismo día, distinta profundidad. Reintenta una fila escasa antes de concluir que un campo está vacío.

Flujos de trabajo habituales

Lo que permiten dos identificadores.

Cruce entre distribuidores

Encontrar el mismo producto en otro catálogo

sku es el número del fabricante, así que sobrevive al salto de un distribuidor a otro, cosa que sku_code no hace. Esa es la clave de cruce para preguntar si el artículo que compras a Waxie es el que lista un competidor, una pregunta que un cruce por nombre no responde de forma fiable sobre descripciones comerciales en mayúsculas.

Compras · Aprovisionamiento
Conciliación de catálogo

Alinear tus registros de compra con los suyos

sku_code es el número que Waxie usa en su propio sistema, lo que lo convierte en el adecuado para conciliar pedidos y facturas. Conserva las dos columnas y podrás hablar con el distribuidor en su numeración y con tu propia base de datos en la del fabricante.

Compras · Registros
Captura del tamaño de paquete

Sacar la cantidad por caja de la descripción

En un catálogo mayorista el desglose del embalaje va con frecuencia escrito en el texto del producto en vez de expuesto como campo, y nuestra fila no fue la excepción. description es de donde parsearlo si tu sistema necesita una cantidad por caja junto al artículo.

Ops de ecommerce · Catálogo
Seguimiento de surtido

Vigilar qué lista un distribuidor

Lanza un conjunto de URLs de artículo de forma programada y guarda name, description y ambos identificadores con la fecha de ejecución. No obtendrás movimiento de precios con esto, pero verás productos renombrados, redescritos o retirados, algo que un mayorista rara vez anuncia.

Investigación de categoría · Surtido
Precios

Paga solo por lo que realmente usas.

Plan gratuito

Las primeras 500 filas son gratis

Por única vez, al registrarte. Sin tarjeta y sin nada que cancelar después.

Por única vez, al registrarte
Tarifa

después 0,002 $ por fila

Se factura por filas realmente devueltas. Una fila que vuelve con un status distinto de uno correcto no es una fila de datos de producto, y no se te cobra como tal.

Facturado por filas devueltas
Sin suscripción

Nada recurrente

Los créditos no caducan en un ciclo mensual. Lanza un barrido de catálogo en marzo y nada más hasta septiembre si el trabajo tiene esa forma.

Sin caducidad mensual
10 % de descuento en tu primera ejecución de pago.Usa el código LIVESCRAPER10 al pagar.
Registrarse
Combina bien con

Otros catálogos, las mismas diecisiete columnas.

La parte legal

¿Es legal hacer scraping de Waxie?

Los hechos de producto en una página de acceso público son información competitiva corriente. Las advertencias que merece la pena señalar aquí van sobre la frontera del inicio de sesión y sobre un sitio que no publica archivo robots.

Un nombre de producto, una descripción y un número de artículo son hechos sobre bienes puestos a la venta. Leerlos de una página que se sirve a cualquier visitante es la misma actividad que un comprador hace a mano, a una velocidad útil. Nada en las diecisiete columnas describe a una persona: no hay nombre, ni correo, ni teléfono, ni cuenta, así que las cuestiones de protección de datos que marcan nuestros servicios sobre personas no se plantean aquí.

La frontera que importa en este sitio es el inicio de sesión. Waxie es un mayorista, y los precios, el stock de sucursal y las condiciones de cuenta están tras su login Web@Work: la propia nota publicada del servicio lo dice. No iniciamos sesión, no usamos las credenciales de nadie y no rodeamos el aviso, así que lo que este servicio alcanza es lo que alcanza un visitante anónimo. Es un límite real y no temporal: si la cifra que necesitas solo aparece una vez dentro como una cuenta concreta, nada de aquí la va a producir. Conviene ser franco también con el segundo punto: shop.waxie.com no sirve ningún robots.txt, devuelve 404. Lo leemos como la ausencia de una instrucción y no como permiso, y por eso este servicio se queda en el mismo terreno que usa en todas partes: páginas públicas, anónimo, a un ritmo considerado.

Nuestras condiciones son las mismas que en cualquier otro servicio de aquí. Solo páginas de acceso público, nada detrás de un inicio de sesión, sin rastreadores de terceros en la capa de datos, y las exportaciones se eliminan automáticamente a los 30 días. Tus primeras 500 filas son gratis y no necesitan tarjeta.

livescraper.app · qué condiciona una ejecución
Una URL de artículo por fila
Solo acceso anónimo
Los precios quedan tras el inicio de sesión Web@Work
El sitio no publica robots.txt
Las exportaciones se eliminan a los 30 días
Un mayorista cotiza por cuenta y por sucursal. Este servicio es el visitante anónimo, así que no ve ninguna de las dos cosas.
Preguntas frecuentes

Lo que la gente pregunta antes de registrarse.

¿La exportación incluye precios de Waxie?+
No. price, parsed_price, currency y availability estaban vacías en nuestras dos filas reales. Waxie es un sitio mayorista y solo muestra precios a una cuenta Web@Work con la sesión iniciada; su propia nota de servicio publicada dice que algunos datos no se pueden leer sin login. No iniciamos sesión ni usamos las credenciales de nadie, así que este servicio ve lo que ve un visitante anónimo. Ningún ajuste cambiará eso.
¿Por qué hay dos números de artículo y cuál uso?+
Son cosas distintas. sku_code es el número de artículo propio de Waxie -1033704 en nuestra fila- y sku es el del fabricante, 80009, que la página etiqueta como artículo del fabricante. Usa sku_code para hablar con Waxie de un pedido y sku para localizar el mismo producto físico en el catálogo de otro.
¿Qué columnas vuelven realmente con datos?+
En la más completa de nuestras dos filas reales: query, sku_code, product_url, name, description, sku, url y status. Vacías en todas las filas que tenemos: parsed_price, price, currency, availability, rating, reviews, images, brand e image.
¿Por qué dos ejecuciones de la misma URL devolvieron cantidades distintas?+
No lo sabemos, y preferimos decirte que ocurrió a ocultarlo. Nuestras dos ejecuciones correctas enviaron el mismo artículo con cinco minutos de diferencia y las dos informaron ok; la primera devolvió solo el nombre del producto y la segunda añadió la descripción, ambos identificadores y la URL canónica. El consejo práctico es reintentar una fila escasa antes de concluir que un campo está vacío para ese producto.
¿Qué columnas contiene la exportación?+
Diecisiete, en este orden: query, sku_code, product_url, name, description, parsed_price, price, currency, availability, rating, reviews, images, brand, sku, url, image y status. Una fila por URL de artículo que envíes.
La página nombra un fabricante, ¿por qué está vacía la columna de marca?+
No debería estarlo, y lo estaba, en las dos filas reales. Lo registramos como una carencia en vez de disfrazarlo. Mientras tanto, el nombre del fabricante suele aparecer dentro de description, así que de ahí es de donde parsearlo.
¿Qué significa la columna status?+
La escribe nuestro exportador, no Waxie, e informa de si esa fila se recuperó. A lo largo de nuestras cuatro ejecuciones tomó dos valores: ok en las dos peticiones de artículo real y http 404 en dos ejecuciones que enviaron una dirección de marcador que no existe. Una fila fallida llega igualmente con su motivo.
¿Cuánto cuesta?+
Tus primeras 500 filas son gratis, por única vez y sin tarjeta. Después son 0,002 $ por fila, facturadas por filas realmente devueltas, sin suscripción y sin caducidad mensual de créditos.
¿En qué formatos puedo exportar?+
CSV, JSON o Excel. Las diecisiete columnas y su orden son los mismos en los tres.

Llévate el catálogo como una tabla.

Nombre, descripción y ambos números de artículo para cada URL de Waxie que envíes, y una celda vacía honesta donde el precio está tras un inicio de sesión. Tus primeras 500 filas son gratis, después 0,002 $ cada una.

Se activa al instante · sin tarjeta

Hacer scraping de datos de producto de Waxie

Waxie es un mayorista de suministros de higiene y limpieza que vende a cuentas profesionales y no a consumidores, y eso condiciona lo que una página de artículo puede contarte. Los campos útiles son los que necesita un sistema de compras -un nombre de producto, una descripción con el desglose del embalaje y dos números de artículo separados- mientras que el precio, el stock de sucursal y las condiciones de cuenta están tras el inicio de sesión Web@Work. La propia nota publicada del servicio lo dice sin rodeos: un sitio mayorista B2B donde algunos datos no se pueden leer sin login.

Las dos columnas de identificador son la razón por la que esta exportación merece la pena. En la fila real que tenemos, sku_code era 1033704 -el número de artículo propio de Waxie, el que encabeza la página y el que se cita en un pedido- y sku era 80009, que la página etiqueta con todas las letras como el número de artículo del fabricante. Los dos valores aparecen en la página en vivo, que es como sabemos que la fila es genuina y no un accidente de análisis. Todos los scrapers de esta familia aconsejan revisar los dos campos de identificador antes de elegir clave de cruce; Waxie es el caso que enseña por qué importa. El número del fabricante es el que sobrevive al salto de un distribuidor a otro, así que es la columna por la que cruzar cuando preguntas si dos catálogos listan el mismo producto físico. El del distribuidor es el que concilia contra pedidos de compra.

Lo que no vuelve es el dinero. price, parsed_price, currency y availability estaban vacías en nuestras dos filas reales, y también rating, reviews, brand, image e images. Pedir la página de artículo directamente explica el primer grupo: devuelve una página funcional de unos 131 KB que muestra el producto, ambos números de artículo y un aviso de inicio de sesión, sin cifra alguna para un visitante que no ha entrado. Las URLs de artículo también llevan un identificador de almacén, así que incluso el precio con sesión iniciada está acotado a una sucursal y una cuenta: no hay un único número público que nadie pueda leer. La columna brand vacía, en cambio, es una carencia genuina y no una propiedad de la fuente, porque la página en vivo sí imprime un fabricante, y así lo registramos.

Una advertencia de consistencia merece decirse en vez de enterrarse. Nuestras dos ejecuciones correctas enviaron la misma URL de artículo con cinco minutos de diferencia y las dos informaron éxito, pero la primera devolvió solo el nombre del producto mientras que la segunda añadió la descripción, ambos identificadores y la URL canónica. Misma página, mismo día, distinta profundidad. Reintenta una fila escasa antes de concluir que un campo no existe para ese producto. Dos ejecuciones son además una muestra demasiado pequeña para citar una tasa de éxito, así que no citamos ninguna. Señalemos por último que shop.waxie.com no publica robots.txt -la petición devuelve 404-, algo que tratamos como la ausencia de una instrucción y no como permiso: solo páginas de acceso público, anónimo, a un ritmo considerado, sin rastreadores de terceros en la capa de datos, y las exportaciones se eliminan automáticamente a los 30 días. Tus primeras 500 filas son gratis y no necesitan tarjeta.