Scraper com IA

Descreva os dados.
Receba as colunas.

Cole URLs de qualquer página, uma por linha, e depois diga o que quer tirar delas - como uma frase na caixa Prompt ou como um esquema que você monta campo a campo. O Claude lê cada página e devolve o que você pediu. Os campos que você nomeia são as colunas; não há parser por site nem conjunto fixo para contornar.

500 linhas grátis, uma única vezdepois 0,002 $ por linhavocê define as colunasCSV · JSON · Excel
Como funciona

Uma lista de URLs
e uma descrição.

Duas entradas obrigatórias, e a segunda você pode dar na forma que preferir.

  1. PASSO 1Faça login na plataforma.
  2. PASSO 2Abra o Scraper com IA.
  3. PASSO 3Cole URLs de qualquer página, uma por linha - ou envie um arquivo CSV, XLSX, TXT ou Parquet.
  4. PASSO 4Diga o que você quer. Ou escreve na caixa Prompt - descreva quais dados você quer extrair - ou muda para Schema e adiciona campos um a um, cada um com nome, tipo e uma marcação opcional de obrigatório.
  5. PASSO 5Defina um limite de linhas por URL se quiser. Deixar vazio leva tudo.
  6. PASSO 6Clique em Get Data e baixe como CSV, JSON ou Excel.

Você precisa de um dos dois, não dos dois: o formulário só te interrompe se o prompt estiver vazio e nenhum campo de esquema tiver sido definido. Se escrever os dois, está dando ao modelo a instrução e a forma.

Por que os times usam

O esquema é
a entrega.

Digite o campo, receba a coluna

Adicione um campo chamado price e o arquivo terá uma coluna chamada price. Não há etapa de mapeamento nem lista de sites suportados, porque aqui nada é escrito por site. É isso que faz valer a pena nas páginas que nenhum scraper dedicado cobre - o catálogo de um fornecedor, os avisos de um regulador, o changelog de um concorrente.

Uma frase, ou um esquema com tipos

A caixa Prompt aceita descrição em linguagem comum e é o jeito mais rápido de testar algo. O construtor de Schema é o que se usa quando a saída precisa ser previsível: cada campo carrega um tipo - String, Number, Boolean, Array ou Object - e pode ser marcado como obrigatório. Uma aba JSON mostra o mesmo esquema como JSON Schema, então dá para colar um que você já tenha.

Sua entrada viaja com a saída

Quando a exportação traz uma coluna query, ela vem primeiro, então cada linha diz qual URL a produziu e um arquivo que cobre cinquenta páginas continua agrupável. Um detalhe discreto que vale saber: uma chave interna position é deliberadamente excluída das colunas montadas, então não aparece nem na tabela nem nos downloads.

O que você recebe de volta

Não existe lista de colunas,
porque quem a escreve é você.

Todas as outras páginas de produto daqui nomeiam um conjunto fixo de colunas. Esta não pode, e o motivo é estrutural, não uma omissão.

Os campos que você descreve são o arquivo. Este serviço não tem nenhum array de colunas declarado em lugar algum. A lista é montada depois da execução, a partir das chaves que realmente voltaram: query primeiro quando presente, e depois cada outra chave na ordem em que foi vista pela primeira vez. Peça sku, price e in_stock e essas serão as suas colunas, nessa ordem. Peça algo que a página não carrega e você deve esperar uma célula vazia em vez de uma invenção - mas confira isso na sua própria primeira execução em vez de acreditar numa página de marketing.

Prompt ou esquema é uma escolha real, não duas palavras para a mesma coisa. Um prompt é mais rápido e mais tolerante, e é a ferramenta certa enquanto você ainda está descobrindo o que uma página contém. Um esquema é o que você quer no momento em que a saída alimenta qualquer coisa adiante: nomear os campos e os seus tipos é como você evita que a forma mude de uma execução para a outra, e marcar um campo como obrigatório é como você diz que ele importa. O construtor e a visão JSON são o mesmo esquema, então dá para começar clicando e terminar colando.

Duas diferenças práticas em relação ao resto da plataforma. Aqui o limite conta linhas por URL em vez de páginas, e vem vazio por padrão, o que significa todas - o contrário de uma ferramenta que para depois de uma página se você não disser outra coisa. E cada página é buscada pelo pool de proxies em vez de pelo seu próprio endereço: se houver uma PROXY_URL ou PROXY_LIST paga configurada, ela é usada; caso contrário, o pool gratuito - e em nenhum dos casos o seu IP real.

O que esta página não vai lhe dizer é quão bem sai uma extração específica. Não temos nenhuma exportação preenchida deste serviço para descrever, e a qualidade aqui depende da página para a qual você aponta e das palavras que escolhe - então não há número de precisão, nem arquivo de exemplo, nem promessa sobre uma célula específica. Gaste algumas linhas grátis numa página, leia as colunas e só então amplie a lista.

Fluxos comuns

Três tarefas pelas quais
as pessoas vêm até aqui.

Todas são páginas que nenhum scraper dedicado cobre.

Cauda longa

O site para o qual ninguém construiu um parser

A maior parte do trabalho de scraping não é Amazon nem LinkedIn - é um distribuidor técnico, a lista de associados de uma entidade setorial, o registro de licenças de uma prefeitura. Aponte isto para essas páginas, nomeie os quatro campos de que você realmente precisa, e recebe uma tabela sem que ninguém escreva um parser para um site que você vai usar duas vezes.

Pesquisa · Operações
Protótipo

Trabalhar o esquema antes de se comprometer com ele

Comece na caixa Prompt com um punhado de páginas, veja o que volta e depois leve para o construtor de Schema os campos que se mostraram úteis, dando tipos a eles. Esse caminho - descrever solto e depois fixar - é a razão de existirem as duas entradas.

Dados · Engenharia
Monitoramento

Puxar os mesmos campos de páginas que vivem mudando

Uma página de preços, uma de termos, uma de status: o texto muda, a marcação muda, e um scraper baseado em seletores quebra nas duas. Descrever o campo em vez da sua posição é o que sobrevive a um redesenho, o que torna isto uma escolha sensata para algo que você pretende repetir.

Concorrência · Conformidade
Preços

Pague por linha,
e por mais nada.

Sem assinatura, sem mínimo, sem licença por usuário. Suas primeiras 500 linhas são por nossa conta - depois disso é pago conforme o uso.

Plano gratuito

500 linhas grátis - 0 $

Em cada conta nova, uma única vez. Sem cartão de crédito. Todos os scrapers liberados. Neste serviço em particular é onde você deve começar: não custa nada descobrir se o seu prompt ou o seu esquema devolve o que você quis dizer.

0 $ para sempre
Pago conforme o uso

0,002 $ por linha, após o plano gratuito

Cerca de 2 $ por 1.000 linhas, a mesma tarifa fixa de qualquer outro scraper da plataforma - uma extração com IA não é cobrada de forma diferente de uma com esquema fixo. O limite conta linhas por URL e por padrão são todas, então vale colocar um número enquanto você ainda testa formulações.

Mais popular
Enterprise

Personalizado - muitos sites, com agenda

Preços por volume, SLAs, workers dedicados e onboarding sob medida para times que rodam isto sobre uma lista longa de fontes em vez de um punhado de páginas. Informe seus números e faremos uma proposta.

Fale conosco
10 % de desconto na sua primeira execução paga.Use o código LIVESCRAPER10 no checkout.
Cadastre-se
Combina bem com

Quando um esquema fixo
serviria melhor.

Descrever campos é a ferramenta certa para páginas que ninguém parseou. Onde existe um scraper dedicado, use-o - as colunas já são conhecidas.

A parte jurídica

É legal
extrair com IA?

Resposta curta: valem as regras que já se aplicavam ao scraping - um modelo ler a página não muda o que você pode coletar.

Coletar informações publicamente visíveis para pesquisa e análise é prática consolidada há muito tempo, e é isso que acontece aqui: a página é buscada como um visitante comum a veria, e um modelo a lê. Desde que os dados sejam de acesso público e o processo não prejudique o serviço, não há leis federais que o proíbam. O que o modelo não faz é passar você por cima de nada - nada atrás de um login, de um paywall ou de um aviso de consentimento entra no escopo.

Este serviço é mais aberto que o resto da plataforma, e isso coloca a responsabilidade pelo escopo em quem escreve o prompt. Um esquema que pede nomes, e-mails ou qualquer outra coisa que identifique uma pessoa significa que você está tratando dados pessoais, e o GDPR e regimes semelhantes se aplicam a você independentemente de onde os obteve. Peça o que a sua finalidade realmente precisa; um campo que você não consegue justificar é um risco, não um bônus.

Os termos de cada site continuam valendo, e eles variam - confira-os para as páginas que pretende rodar. Não tocamos em nada atrás de um login, lemos apenas o que qualquer visitante vê, não executamos rastreadores de terceiros na camada de dados e suas exportações se excluem sozinhas após 30 dias.

livescraper.app · princípios
Apenas páginas públicas
Sem logins, sem paywalls
Você escolhe os campos - peça só o que consegue justificar!
Alinhado ao GDPR por padrão
As exportações se excluem sozinhas (30 dias)
Buscado pelo pool de proxies, nunca pelo seu IP real.
Perguntas frequentes

O que as pessoas perguntam antes de se cadastrar.

As perguntas que mais ouvimos. Mais alguma coisa? Fale conosco - quem escreve as respostas são pessoas, não bots.

Quais colunas a exportação vai conter?+
As que você pediu. Este serviço não tem nenhum conjunto fixo de colunas em lugar algum - a lista é montada depois da execução a partir das chaves que voltaram, com query em primeiro lugar quando presente e cada outra chave em seguida na ordem em que foi vista pela primeira vez. É por isso que esta página não tem dicionário de dados: não há nada fixo para tabelar.
Escrevo um prompt ou monto um esquema?+
Qualquer um dos dois, e você precisa de um. Um prompt é uma frase descrevendo o que extrair e é o jeito mais rápido de testar algo. Um esquema é uma lista de campos que você adiciona um a um, cada um com nome e tipo, opcionalmente marcado como obrigatório - use-o quando a saída precisar manter a mesma forma entre execuções. O formulário só te interrompe se o prompt estiver vazio e nenhum campo de esquema tiver sido definido.
Quais tipos de campo um esquema pode usar?+
Cinco: String, Number, Boolean, Array e Object. Cada campo também tem um botão de obrigatório. Uma aba JSON mostra a mesma coisa como JSON Schema, então dá para colar um esquema que você já tenha - ele precisa de um objeto properties com pelo menos uma entrada, e JSON inválido é recusado em vez de ignorado em silêncio.
Existe uma lista de sites suportados?+
Não, e é justamente esse o ponto deste. Aqui nada é escrito por site, então qualquer página que você consiga abrir num navegador é candidata. Onde um site tiver um scraper dedicado nesta plataforma, prefira-o - esses devolvem um conjunto de colunas documentado em vez de um que você precisa descrever.
O que o campo de limite faz?+
Ele limita quantas linhas voltam por URL, e vem vazio por padrão, o que significa todas. Repare que ele conta linhas e não páginas - o limite do Universal AI Scraper conta páginas por consulta, então os dois não são intercambiáveis.
Qual a diferença para o Universal AI Scraper?+
Entradas diferentes e um limite diferente. Este aceita um prompt em texto livre ou um esquema com tipos e limita linhas por URL. O Universal AI Scraper aceita uma lista de atributos que você escolhe ou digita, e limita páginas por consulta. Use aquele quando um punhado de nomes de atributo já diz tudo; use este quando quiser tipos, campos obrigatórios ou uma frase.
Preciso de um proxy?+
Você não precisa configurar nenhum. Cada página é buscada pelo pool de proxies: se houver uma PROXY_URL ou PROXY_LIST paga definida, ela é usada; caso contrário, o pool gratuito. De qualquer forma a requisição não sai do seu IP real.
Quão precisa é a extração?+
Não publicamos um número, e preferimos explicar por quê a inventá-lo. A qualidade depende da página para a qual você aponta e de como você formula o campo, então um número único seria irrelevante para as duas coisas. O plano gratuito existe exatamente para isso - rode uma página, leia as colunas, ajuste a formulação e depois amplie a lista.
Quanto custa?+
As primeiras 500 linhas de uma conta nova são gratuitas e valem uma única vez; depois disso são 0,002 $ por linha - cerca de 2 $ por 1.000 - pago conforme o uso, sem assinatura. É a mesma tarifa fixa de qualquer outro scraper daqui. Os créditos não expiram e não há reinício mensal.

Nomeie os campos.
Leia o arquivo.

Cole uma URL, descreva o que você quer numa frase ou como esquema, e veja o que volta. Suas primeiras 500 linhas são grátis.

Ativa na hora · sem cartão

Transformar qualquer página nas colunas que você pediu

A maioria das ferramentas de scraping começa por um site e entrega a você o esquema dele. Esta começa por um esquema e deixa você apontá-lo para um site. Cole URLs de qualquer página, uma por linha, descreva o que quer - como frase na caixa Prompt, ou como um conjunto de campos no construtor de Schema - e cada página é buscada e lida pelo Claude, que devolve os campos que você nomeou. Aqui não há parser por site, então também não há lista de sites suportados com que se comparar.

As duas formas de pedir são ferramentas genuinamente diferentes. Um prompt é solto e rápido, e é o que você quer enquanto ainda descobre o que uma página carrega. Um esquema fixa a saída: cada campo tem nome e tipo - String, Number, Boolean, Array ou Object - e pode ser marcado como obrigatório, que é como se mantém a forma estável em execuções repetidas. O construtor e a visão JSON são o mesmo esquema em duas formas, então um esquema que você já tem pode ser colado e um que você monta clicando pode ser copiado. Você precisa de um dos dois; dar os dois simplesmente informa ao modelo a instrução e a forma.

Como quem define os campos é você, o arquivo não tem lista fixa de colunas, e por isso esta página não tem dicionário de dados. As colunas são montadas depois da execução a partir das chaves que realmente voltaram - query primeiro quando presente, para que cada linha registre qual URL a produziu, e depois todo o resto na ordem em que apareceu. Uma chave interna position fica de fora dessa lista, então não aparece nem na tabela nem nos downloads. Duas diferenças menores em relação ao resto da plataforma valem ser conhecidas: o limite conta linhas por URL em vez de páginas e vem vazio por padrão, ou seja, todas; e as páginas são buscadas pelo pool de proxies - uma PROXY_URL ou PROXY_LIST paga, se houver, senão o pool gratuito, e nunca o seu próprio endereço.

Uma coisa que esta página deliberadamente não faz é dizer quão boa é a extração. A qualidade depende da página e da sua formulação, o que torna qualquer número de precisão enganoso nos dois sentidos, e preferimos dizer isso a publicar um número pelo qual não podemos responder. O conselho honesto é o barato: rode uma única página no plano gratuito, leia as colunas que voltaram, ajuste os nomes dos campos ou a frase, e só então aponte para uma lista. Suas primeiras 500 linhas não custam nada e não exigem cartão de crédito. Veja preços para as tarifas atuais.