Hacer scraping de datos de producto de BiggestBook
BiggestBook es el catálogo online que Essendant opera para sus clientes distribuidores, con material de oficina, mobiliario, informática y tecnología, sala de descanso y limpieza. Es un catálogo de distribuidor y no una tienda para consumidores, y por eso sus campos útiles se inclinan hacia lo que necesita un sistema de compras -identificador, marca, moneda, disponibilidad- y no hacia lo que usa una página de marketing.
El obstáculo práctico es cómo está construido el sitio. Una petición a https://www.biggestbook.com desde un cliente HTTP normal devuelve una respuesta correcta de unos 6,9 KB que contiene un armazón de aplicación Angular -<base href="/ui">, el título «Biggestbook Web», una hoja de estilos- y ningún marcado de producto: ni precio, ni SKU, ni botón de carrito. El catálogo lo pide y lo renderiza JavaScript después de que carga ese armazón. Cualquier cosa construida sobre una librería HTTP y un analizador de HTML leerá por tanto una página válida y no encontrará nada dentro, que es el motivo más común de que un scraper casero de BiggestBook parezca funcionar y devuelva filas vacías. Este servicio carga la página como lo hace un navegador, así que los productos están presentes cuando se lee algo.
La exportación son diecisiete columnas por URL de producto: query, sku_code, product_url, name, description, parsed_price, price, currency, availability, rating, reviews, images, brand, sku, url, image y status. Cuatro de ellas son parejas -precio como se muestra frente a precio como número, dos campos de identificador, imagen principal frente a todas las imágenes, URL pedida frente a URL canónica- y saber qué mitad usar antes de escribir el importador es la diferencia entre una carga limpia y una reescritura. Los mismos diecisiete nombres en el mismo orden son los que llevan nuestras exportaciones de CDW, AutoZone, Brady y Decathlon, así que un solo importador sirve a toda la familia B2B y de suministro.
Estamos siendo deliberadamente claros sobre los límites de lo que podemos enseñar. Las dos ejecuciones que hay detrás de esta página, del 14 y el 15 de julio de 2026, enviaron una dirección de marcador en vez de una de BiggestBook, y las dos volvieron con un 404 y todas las columnas de datos vacías. Eso establece el esquema -una cabecera es una cabecera real aunque no haya datos debajo- y no establece nada sobre los valores de BiggestBook, así que no encontrarás precios de ejemplo, recuentos de productos ni valoraciones en ninguna parte de esta página. El acceso también tiene un límite real: partes de un catálogo de distribuidor, los precios por cuenta en particular, están detrás de un inicio de sesión de distribuidor, y este servicio no inicia sesión, así que lo que alcanza es lo que alcanza un visitante anónimo. Solo páginas de acceso público, sin rastreadores de terceros en la capa de datos, y las exportaciones se eliminan automáticamente a los 30 días. Tus primeras 500 filas son gratis y no necesitan tarjeta.