- query
- La URL de CDW que enviaste. En una ejecución de categoría es el mismo valor en cada fila que esa categoría produjo, que es lo que permite distinguir un estante de otro en una exportación combinada. Consérvala: con una apertura en abanico, es lo único que agrupa las filas.
- sku_code
- La referencia propia de CDW. Con datos en las 24 filas de nuestra ejecución de categoría. También es el último segmento de
product_url y el identificador dentro de la URL de imagen, así que los tres coinciden y puedes verificar una fila contra sí misma. - product_url
- La página de producto canónica. En una ejecución de categoría es el producto propio de la fila -24 filas, 24 valores distintos-, que es lo que hace la apertura útil en vez de simplemente larga.
- name
- El título del producto tal como lo indica el listado. Espera redacción de distribuidor con la configuración escrita: procesador, memoria y almacenamiento suelen formar parte del nombre y no ser campos aparte.
- description
- Pensada para llevar el texto largo del producto. Vacía en las 24 filas. Un listado de categoría no imprime uno; una página de producto quizá sí.
- parsed_price
- El precio como número puro. Con datos en las 24 filas. Es el que usar para calcular, y en la nota de abajo está por qué existe siquiera, dado que la página no lo sirve.
- price
- El mismo precio tal como se muestra, con símbolo y separador de miles. Úsalo cuando necesites enseñar exactamente lo que CDW enseñaba; usa
parsed_price para la aritmética. - currency
- La moneda en la que se cotiza el precio. Con datos en las 24 filas. Léela en vez de suponerla: un distribuidor con tiendas internacionales no siempre responde en la misma.
- availability
- Pensada para llevar el estado de stock. Vacía en las 24 filas. Trata su ausencia como que el listado no publica uno, no como que el producto no está disponible.
- rating
- Pensada para llevar una valoración media. Vacía en las 24 filas. Un listado de distribuidor dirigido a compradores profesionales normalmente no lleva valoraciones de consumo.
- reviews
- Pensada para llevar el recuento de reseñas, con la misma advertencia que
rating. Vacía en las 24 filas. - images
- Todas las imágenes que lleva el listado. Con datos en las 24 filas. Conviene saber: la URL de imagen incluye un preajuste de renderizado, y ese preajuste difería entre nuestra ejecución de categoría y la de producto -el mismo producto, dos tamaños distintos. No trates la URL como identidad estable; lo estable es el identificador que hay dentro.
- brand
- Pensada para llevar el fabricante. Vacía en las 24 filas, aunque el nombre del fabricante suele ser la primera palabra de
name. Si necesitas agrupar por marca, extráela del nombre. - sku
- La referencia del fabricante, y un valor distinto de
sku_code. Esta es la columna por la que cruzar cuando preguntas si otro distribuidor lista el mismo producto físico. - url
- La dirección desde la que se produjo la fila. En nuestra ejecución de categoría esto era igual a
product_url y no a query: la fila apunta a su propio producto, no al estante del que salió. - image
- La imagen principal por separado, para que el caso habitual no requiera partir cadenas. Misma advertencia sobre el preajuste de renderizado que
images. - status
- Un indicador por fila escrito por nuestro exportador, no por CDW. A lo largo de nuestras ocho ejecuciones tomó cuatro valores:
ok, blocked (needs residential proxy), no response (proxy) y http 404. Concilia por esta columna, sobre todo con una apertura en abanico, donde el número de filas por sí solo no dice nada.
Dos cosas de esta tabla merecen leerse antes de construir contra ella. Primero, los precios son reales. Las 24 filas de nuestra ejecución de categoría llevaban un número, un precio formateado y una moneda: este es el único catálogo de esta familia cuyas columnas de dinero llegan con datos. Pero pedir la misma página de producto directamente devuelve unos 57 KB de HTML que contienen ambas referencias y el nombre del producto y ningún precio, sin bloque de datos estructurados del que leer uno. La cifra se renderiza en el navegador. Nuestra exportación la tiene porque el servicio renderiza la página, y un scraper construido sobre una librería HTTP y un analizador de HTML volvería con las manos vacías aparentando funcionar. Segundo, el esquema se movió. Nuestra ejecución del 1 de julio lleva una cabecera de once columnas -query, name, brand, price, currency, sku, availability, rating, url, image, status- sin parsed_price, sku_code, product_url, description, reviews ni images. Todo lo del 3 de julio en adelante es la forma de diecisiete columnas de arriba. Si estás conciliando lo viejo contra lo nuevo, esa es la diferencia.