Scraper de Produtos da ItemInfo

Entra uma URL de categoria,
sai um catálogo com preços.

Aponte-o para uma página de produto da ItemInfo ou para uma categoria de busca inteira e receba o catálogo como linhas: nome, preço, moeda, disponibilidade, marca e os identificadores que tornam uma exportação cruzável - sku, mpn e gtin. Quinze colunas, uma linha por produto. E, ao contrário de vários scrapers daqui, não há nenhum proxy para você configurar.

500 linhas grátis, uma única vezUS$ 0,002 por linha depois15 colunasCSV · XLSX · JSON
Como funciona

Cinco passos,
e nenhuma configuração.

Uma entrada e um controle. Aqui não há proxy a configurar, então o trabalho inteiro é uma lista de links e um número.

  1. PASSO 1Entre na plataforma.
  2. PASSO 2Abra o Scraper de Produtos da ItemInfo.
  3. PASSO 3Cole URLs de produto da ItemInfo ou URLs de categoria e busca, uma por linha - ou envie um arquivo CSV, XLSX ou TXT.
  4. PASSO 4Defina um limite por consulta, ou deixe vazio para levar tudo, e clique em Get Data.
  5. PASSO 5Baixe o resultado como CSV, XLSX ou JSON.

O limite é por consulta: cinco URLs de categoria com limite de duzentos são duzentos produtos de cada uma - não duzentos no total.

Por que as equipes usam

Nada a configurar,
e as chaves certas.

Sem proxy para trazer

As requisições saem pelo nosso pool e não pelo seu próprio endereço, e este varejista não é um dos quatro que a ferramenta sinaliza como precisando de um proxy residencial adicional. Então não há nada para comprar, nada para configurar e nenhuma segunda conta - o que não vale para todos os scrapers deste catálogo, e é a razão de esta página ser mais curta que as irmãs.

Feito para cruzar catálogos

sku, mpn e gtin ficam na mesma linha que preço e disponibilidade. São os campos que permitem alinhar uma exportação ao seu próprio cadastro de itens ou à lista de outro distribuidor - cruzar por nome de produto é adivinhação, cruzar por número de peça do fabricante não é.

Uma página de busca é uma entrada válida

Você não precisa de uma lista de URLs de produto para começar. Entregue uma URL de busca ou de categoria e ela volta desdobrada, uma linha por produto - que é exatamente como o próprio exemplo da ferramenta para a ItemInfo está escrito, apontando para uma seção inteira e não para um item isolado.

O que você recebe

Quinze colunas,
uma linha por produto.

Cada linha é um item: como se chama, quanto custa e em que moeda, se está disponível, quem o fabrica, os identificadores que o fixam e como ele é apresentado.

A lista de colunas abaixo é a linha de cabeçalho de exportações reais - quarenta e cinco delas, todas idênticas -, corroborada pelo array de colunas que a interface de execução renderiza. Nomes não ficam mais sólidos que isso. O que vem depois da tabela, porém, importa mais que o habitual, porque este serviço divide um pipeline com vários outros e nunca apontamos esse pipeline para a ItemInfo. A nota diz exatamente o que isso nos permite e o que não nos permite contar.

Dicionário de dados

Quinze colunas,
e um teto honesto.

Os nomes são exatos e duplamente confirmados. As descrições dizem para que serve cada coluna - não o que ela vai conter, porque isso é decisão do varejista e não nossa, e a nota abaixo explica por quê.

query
A URL que você enviou para esta linha - a página de produto, categoria ou busca de onde ela veio. É escrita pelo scraper, então está em todas as linhas.
service
De qual varejista esta linha veio. Este scraper divide um pipeline com vários outros serviços de produto, e o que você escolheu fica carimbado em cada linha - útil se você mantém mais de um varejista na mesma tabela.
name
O nome do produto como a página o declara.
price
O preço que a página declara.
currency
A moeda desse preço, como coluna separada - assim você não precisa extrair um símbolo do campo de preço.
availability
O status de estoque que a página declara.
brand
A marca que a página declara.
sku
O código de item do próprio varejista.
mpn
O número de peça do fabricante. Junto com gtin, é o que torna uma exportação cruzável com um catálogo que não seja o da ItemInfo.
gtin
O número global de item comercial - o identificador do código de barras.
rating
A nota do produto, se a página publicar uma. Nenhuma escala é informada aqui; não vimos nenhum valor.
reviews
A contagem de avaliações. Um número, não o texto - não há corpo de avaliação nesta exportação.
image
A imagem do produto que a página declara.
url
O link do produto.
description
A descrição do produto que a página declara.

Duas coisas sobre as evidências por trás desta página. Primeiro, o mecanismo: os produtos são lidos do JSON-LD que a página publica sobre si mesma - os dados estruturados que os varejistas embutem para os buscadores. Isso estabelece um teto que esta página não vai fingir ultrapassar. Toda coluna depois de service só existe se a ItemInfo declarar aquele campo, então um vazio significa não publicado, e não execução falhou. Segundo, a lacuna: nunca rodamos isto contra a ItemInfo. Temos quarenta e cinco exportações do pipeline compartilhado por trás deste serviço e nenhuma é uma execução da ItemInfo - quarenta e quatro voltaram vazias e a única preenchida é de outro varejista. Essa exportação vale um dado honesto sobre a ferramenta, e não sobre a ItemInfo: query e service vieram preenchidos em todas as linhas, porque o scraper os escreve - e seis das quinze estavam vazias em cada uma das linhas. Espere lacunas aqui também, espere que caiam em outro lugar porque outro varejista publica outros dados estruturados, e deixe a sua primeira execução no plano gratuito mostrar quais. É também por isso que esta página não imprime valores de exemplo nem formatos: sem uma execução da ItemInfo, estaríamos inventando.

Controles da execução

Um botão,
e uma lista de links.

Uma linha é uma página de produto, uma categoria ou uma busca. Além disso há um único número a definir e um jeito de entregar uma lista maior - e nada mais para configurar.

URL de produto URL de categoria URL de busca Uma por linha Limite por consulta Vazio ou 0 leva tudo Upload de CSV Upload de XLSX Upload de TXT Sem proxy necessário
De onde vêm os campos

A página declara,
nós reportamos.

Este scraper lê os dados estruturados que uma página de produto publica sobre si mesma - o bloco JSON-LD que os varejistas embutem para que os buscadores possam exibir preço e status de estoque. É por isso que as colunas são o que são: sku, mpn, gtin, brand, availability e currency são o vocabulário padrão para descrever um produto, e não nomes que inventamos.

A consequência prática é a que vale planejar. Uma coluna só é tão boa quanto a marcação do varejista. Se um campo falta nos dados estruturados da página, ele volta vazio, e repetir a execução não muda isso - não é uma falha, é uma ausência. Na única exportação preenchida que temos desta ferramenta compartilhada, seis das quinze colunas estavam vazias em todas as linhas.

Se você precisa de algo que a marcação não carrega, isso é outro trabalho - o Scraper Universal com IA lê a própria página e devolve os atributos que você nomear, em vez de apenas o que foi declarado para os buscadores.

livescraper.app · o teto
Lido do JSON-LD da página
query e service: escritos por nós
Os outros treze: declarados pela página
Vazio = não publicado, não falhou!
Confira as lacunas na sua primeira execução
Dados estruturados são escolha do varejista, e ela varia entre eles.
Entregando a lista

Uploads somam
e não removem duplicatas.

Um arquivo enviado não limpa a caixa - as linhas são acrescentadas ao que você já tinha digitado, e duplicatas não são removidas. Envie o mesmo arquivo duas vezes e aquelas URLs vão mesmo ser buscadas duas vezes, e cobradas duas vezes.

Para um CSV ou TXT a linha inteira é tomada como uma URL, então uma planilha com colunas extras não é o que você quer aqui. Só um XLSX é lido por coluna, e ali ele pega a coluna A.

O seletor lista Parquet ao lado de CSV, XLSX e TXT, mas na verdade não consegue ler um no navegador e vai lhe dizer isso - use um dos outros três.

livescraper.app · o upload
CSV · XLSX · TXT
Duplicatas NÃO são removidas!
CSV e TXT: a linha inteira
XLSX: coluna A
Acrescentado ao que você digitou
Confira a caixa antes de rodar - uma lista dobrada é uma conta dobrada.
Fluxos de trabalho comuns

Três tarefas que as pessoas
mais executam aqui.

Alguns modos como as equipes transformam o catálogo de um distribuidor em algo que uma planilha consegue responder.

Compras

Precifique a sua própria lista de peças

Exporte as categorias das quais você compra e cruze o resultado com o seu cadastro de itens por mpn ou gtin em vez de por nomes. O que você obtém é uma comparação linha a linha com o que está realmente pagando - a versão dessa pergunta que um time financeiro aceita.

Compras · Financeiro
Catálogo

Preencha as lacunas dos seus dados

Se aos seus registros de produto faltam números de fabricante ou códigos de barras, uma exportação de categoria é uma fonte. Marca, sku, mpn e gtin chegam juntos numa linha, o que normalmente basta para reconciliar um item que você já estoca.

Dados · Sortimento
Disponibilidade

Acompanhe uma categoria ao longo do tempo

Rode a mesma categoria periodicamente e guarde as exportações. Como preço e disponibilidade se movem numa seção inteira diz mais sobre um fornecedor do que qualquer item isolado - e, como não há proxy no meio, um job recorrente aqui custa só as suas linhas.

Operações
Preços

Pague pelos produtos
que você realmente puxa.

Sem assinatura, sem mínimo, sem fatura recorrente - e neste aqui, sem conta de proxy também. Suas primeiras 500 linhas são por nossa conta.

Plano gratuito

500 linhas grátis - US$ 0

Em toda conta nova, uma única vez. Sem cartão de crédito. Limites por consulta, upload de arquivo e todos os formatos de exportação incluídos - e nada a fornecer além disso, porque este serviço não precisa de proxy próprio.

US$ 0 para sempre
Pague conforme o uso

US$ 0,002 por linha, após o plano gratuito

A mesma tarifa fixa de qualquer outro scraper da plataforma, e aqui uma linha é um produto. O estimador prévio mostra a quantidade de linhas e o custo em créditos antes de a execução começar - sem contas surpresa, sem unidades de computação para traduzir.

Mais popular
Volume

Sob medida · alto volume

Preço por volume, workers dedicados e um SLA para monitoramento contínuo ou extrações de catálogo muito grandes. Diga-nos seus números e faremos uma proposta.

Fale conosco
10% de desconto na sua primeira execução paga.Use o código LIVESCRAPER10 no checkout.
Cadastre-se
Combina bem com

O mesmo pipeline,
outras prateleiras.

Um é o gêmeo deste scraper num varejista que precisa mesmo de proxy; o outro preenche os campos que uma página nunca declarou.

A parte jurídica

É legal fazer scraping
de catálogos de produtos?

Resposta curta: sim para dados públicos de catálogo - e do lado da privacidade isto é praticamente o scraping menos problemático que existe, porque não há pessoa alguma nele.

Tudo nesta exportação é mostrado numa página pública de produto a qualquer pessoa que a abra: o nome, o preço, a moeda, a disponibilidade, a marca, os identificadores, uma imagem e uma descrição. Mais que isso: a maior parte é publicada em forma estruturada justamente para que máquinas leiam - é para isso que serve o JSON-LD. Coletá-la para pesquisa de preços e trabalho de catálogo é prática consolidada há muito tempo, e nada aqui toca em login, preço de cliente ou checkout.

Não há nenhum dado pessoal nestas quinze colunas - sem nomes, sem quem avaliou, sem contatos. Isso deixa curta a análise usual de privacidade. O que entra no lugar é comercial: preços e estrutura de catálogo são informação de negócio de um fornecedor, e usá-los para orientar as suas próprias compras é comum, ao passo que republicar o catálogo de um distribuidor como seu é outra coisa que nenhuma exportação torna aceitável.

O que esta página não vai fazer é ler a ausência de uma exigência de proxy como um convite. O fato de um varejista não bloquear endereços de datacenter não diz nada sobre o que os termos dele permitem, então leia-os antes de escalar um job recorrente. Não rodamos rastreadores de terceiros na camada de dados, e suas exportações se apagam sozinhas após 30 dias.

livescraper.app · princípios
Apenas páginas públicas de catálogo
Sem logins, sem preço de cliente, sem checkout
Nenhum dado pessoal em coluna alguma
Não bloquear não é o mesmo que permitir!
Exportações se apagam sozinhas (30 dias)
Confira os termos da própria ItemInfo antes de escalar.
Perguntas frequentes

O que as pessoas perguntam
antes de se cadastrar.

As perguntas que mais ouvimos. Mais alguma coisa? Fale conosco - quem escreve as respostas são pessoas, não bots.

Como faço scraping de dados de produto da ItemInfo?+
Com o Scraper de Produtos da ItemInfo:
  1. Entre na plataforma.
  2. Abra o Scraper de Produtos da ItemInfo.
  3. Cole URLs de produto da ItemInfo ou URLs de categoria e busca, uma por linha - ou envie um arquivo CSV, XLSX ou TXT.
  4. Defina um limite por consulta, ou deixe vazio para levar tudo, e clique em Get Data.
  5. Baixe o resultado como CSV, XLSX ou JSON.
Preciso de um proxy para este?+
Não - e vale dizer isso porque vários scrapers desta plataforma precisam. As requisições saem pelo nosso pool compartilhado em vez do seu endereço real, e a ferramenta nomeia quatro varejistas que precisam, além disso, de um proxy residencial próprio. A ItemInfo não é um deles, então não há nada para você configurar. Essa é a avaliação da própria ferramenta, e não uma promessa sobre cada execução.
Posso apontar para uma categoria inteira ou só para produtos isolados?+
Qualquer um dos dois. Uma linha pode ser uma URL de produto ou uma URL de categoria ou busca, e uma categoria devolve uma linha por produto nela. O exemplo que a própria ferramenta coloca na caixa para a ItemInfo é uma URL de busca cobrindo uma seção inteira, então trabalhar categoria a categoria é o uso previsto.
De onde os dados realmente vêm?+
Do JSON-LD que a página publica sobre si mesma - os dados estruturados que os varejistas embutem para os buscadores. Vale saber porque isso define o teto: este scraper reporta o que a ItemInfo declara, então uma coluna volta vazia quando a página nunca declarou aquele campo, e não porque a execução falhou.
Todas as quinze colunas virão preenchidas?+
Quase certamente não, e não vamos fingir o contrário. Como os campos são lidos dos dados estruturados de cada página, quais campos existem é escolha do varejista. Na única exportação preenchida que temos desta ferramenta compartilhada - outro varejista, não a ItemInfo - seis das quinze estavam vazias em todas as linhas. Espere lacunas, e deixe a sua primeira execução gratuita dizer quais valem aqui.
Vocês rodaram isto contra a ItemInfo?+
Não. Temos quarenta e cinco exportações do scraper de produtos compartilhado por trás deste serviço e nenhuma delas é uma execução da ItemInfo. Então os quinze nomes de coluna são sólidos - duas fontes independentes concordam - e o que a ItemInfo especificamente devolve é algo que a sua primeira execução no plano gratuito vai estabelecer antes de nós.
Para que serve a coluna service?+
Ela registra de qual varejista uma linha veio. Este scraper é um de vários serviços que dividem um único pipeline de produtos, e o serviço que você escolheu é enviado com o job e escrito em cada linha - então, se você mantém exportações de mais de um varejista na mesma tabela, é essa coluna que as mantém separadas.
Quanto custa?+
As primeiras 500 linhas são grátis e valem uma única vez, sem cartão de crédito. Depois disso são US$ 0,002 por linha - a mesma tarifa fixa de qualquer outro scraper da plataforma. Uma linha é um produto, e não há conta de proxy por cima.

Seus primeiros 500 produtos,
por conta da casa.

500 linhas grátis, uma única vez, em toda conta nova - sem prazo de validade. Depois são US$ 0,002 por linha, conforme o uso - sem cartão cadastrado até você decidir. Nada mais a fornecer: este aqui não precisa de proxy próprio.

Ativa na hora · sem cartão

Faça scraping de dados de produto da ItemInfo em escala

O Scraper de Produtos da ItemInfo da Livescraper transforma páginas de catálogo numa planilha. Você cola URLs de produto da ItemInfo, URLs de categoria ou URLs de busca - uma por linha, ou enviadas como arquivo CSV, XLSX ou TXT -, define quantos produtos pegar por consulta e baixa o resultado num arquivo CSV, Excel ou JSON limpo, uma linha por produto. Não há proxy a configurar nem nada a instalar.

Cada linha traz o nome, o preço e a sua moeda como colunas separadas, a disponibilidade, a marca e os três identificadores que tornam o trabalho de catálogo possível: sku, mpn e gtin. Esses dois últimos são a razão de esta exportação ser útil e não apenas interessante - um número de peça do fabricante se cruza com o seu cadastro de itens, enquanto um nome de produto só se cruza aproximadamente. Nota, contagem de avaliações, imagem, link e descrição completam as quinze.

Equipes de compras exportam as categorias das quais compram e cruzam o resultado com o que já pagam, linha a linha. Equipes de dados e sortimento usam isso para preencher números de fabricante e códigos de barras que faltam nos seus registros. Equipes de operações rodam a mesma categoria periodicamente e acompanham preço e disponibilidade se movendo numa seção inteira em vez de num item só - barato de repetir aqui, porque as linhas são o único custo.

Um limite está dito com clareza em vez de enterrado. Os campos são lidos dos dados estruturados que cada página publica sobre si mesma, o que significa que uma coluna vazia é um campo que o varejista nunca declarou e não uma execução que falhou; na única exportação preenchida que temos desta ferramenta compartilhada, de outro varejista, seis das quinze colunas estavam vazias do início ao fim. Não rodamos isto contra a ItemInfo, então os quinze nomes de coluna são o que sustentamos e o resto é o que a sua primeira execução no plano gratuito vai mostrar. Comece grátis: suas primeiras 500 linhas não custam nada e não exigem cartão.