Scraper de Busca do Yahoo

Uma página de resultados do Yahoo,
linha por linha.

Envie uma consulta e receba o que o Yahoo mostrou, como uma tabela: a posição, o título, o link e o trecho, uma linha por resultado. Cinco colunas, e nas 360 linhas por trás desta página todas elas estavam preenchidas em todas as linhas.

500 linhas grátis, uma única vezdepois US$ 0,002 por linhacinco colunas por resultadoCSV · JSON · Excel
Como funciona

Uma consulta entra, uma tabela ordenada sai.

  1. PASSO 1Entre na plataforma.
  2. PASSO 2Abra o Yahoo Search Scraper.
  3. PASSO 3Digite as consultas que quiser, uma por linha.
  4. PASSO 4Escolha o formato de saída (CSV / JSON / XLSX).
  5. PASSO 5Rode o job.
  6. PASSO 6Baixe os resultados - uma linha por resultado, cinco colunas.
Como a exportação realmente é

Cinco colunas e duas coisas que convém saber.

Nada fica em branco

Nas 360 linhas que temos, query, position, title, url e description estavam preenchidas em absolutamente todas as linhas. Nem uma célula vazia na exportação inteira. Isso é incomum o bastante para ser dito: a maioria das fontes deixa você escrevendo verificações de nulo.

position é um número, e é contínuo

Nas cinco execuções, position foi 1, 2, 3 … N sem lacunas e sem repetições. Dá para ordenar por ela diretamente, e um número faltando significa que uma linha se perdeu no seu pipeline, não na coleta.

A mesma URL pode aparecer duas vezes

É esta que pega as pessoas. Dentro de uma única execução a coluna url se repete - 20 linhas duplicadas numa exportação de 74 linhas, e 4, 9, 11 e 16 nas outras. São linhas reais em posições reais, não um defeito da exportação. Deduplique por url antes de contar qualquer coisa.

Um conjunto de resultados não é estável de um dia para o outro

Rodamos python web scraping duas vezes, com 24 horas de intervalo. 66 URLs distintas no primeiro dia, 62 no segundo, e só 42 em ambas - cerca de um terço foi renovado. Das 42 que sobreviveram, 22 estavam em outra posição. Trate uma execução como um instantâneo, não como o ranking.

Os trechos são texto real, às vezes cortado

As descrições foram de 6 a 417 caracteres, mediana 194, e 79 das 360 terminaram em reticências - o Yahoo as cortou. Planeje uma coluna de texto ampla e não trate um “…” final como problema de dados.

Os títulos às vezes trazem a URL exibida

Nove dos 360 títulos começavam com um domínio de trilha separado por espaços, como www. python .org › downloads Download Python. É uma minoria, mas se você casar por título isso vai te surpreender. Remova esse fragmento inicial ou case por url.

O que você recebe

Cinco colunas, por resultado.

Lidas do cabeçalho de uma exportação real deste serviço, na ordem da planilha. Cada descrição abaixo se apoia nas 360 linhas que medimos.

query
O termo que você enviou, repetido em cada linha para que uma exportação com várias consultas continue separável. Cada uma das nossas cinco execuções levava exatamente uma consulta; é esta coluna que permite juntá-las.
position
A posição, como número. Contínua a partir de 1, sem lacunas nem repetições nas cinco execuções - 1 a 74, 1 a 70, 1 a 73, 1 a 69 e 1 a 74. Ordene por isto em vez da ordem das linhas.
title
O título do resultado. Normalmente o título da página; em 9 das nossas 360 linhas ele começava com um domínio exibido separado por espaços, como www. python .org › downloads, antes do título real.
url
O link de destino. 358 de 360 eram https e 2 eram http, em 168 hosts distintos. Esta coluna se repete dentro de uma execução - deduplique por ela.
description
O trecho abaixo do resultado. De 6 a 417 caracteres, mediana 194, com 79 de 360 terminando em reticências onde o Yahoo cortou.

Cinco colunas por linha · CSV, JSON ou Excel

Medido em 5 execuções reais e 360 linhas: python (74 linhas), snake (69), titan (74) e python web scraping duas vezes (70 e 73). O número de linhas por consulta variou entre 69 e 74, então não há um tamanho de página fixo em que confiar - leia as linhas que você recebe em vez de supor um número redondo.

Fluxos de trabalho comuns

Para que serve um segundo buscador.

Acompanhamento de posição

Acompanhar uma posição ao longo do tempo, não uma vez só

Rode as mesmas consultas de forma agendada e guarde query, url, position e a data da execução. Nossas duas execuções com um dia de diferença moveram 22 de 42 URLs em comum: uma leitura isolada diz muito pouco e uma série diz muito.

SEO · Relatórios
Visibilidade competitiva

Ver quem mais rankeia pelos seus termos

Agrupe por host e conte. Nossas 360 linhas cobriram 168 hosts distintos, e essa é exatamente a pergunta: quem aparece repetidamente nas consultas que importam para você, e a que profundidade.

SEO · Pesquisa de mercado
Verificação de cobertura

Comparar Yahoo com Google

Passe a mesma lista de consultas por este serviço e pelo Google Search Scraper e compare os conjuntos de URLs. Onde os dois discordam costuma ser onde uma auditoria encontra algo.

SEO · Auditoria
Geração de leads

Transformar uma página de resultados em lista

Uma consulta de categoria mais cidade devolve páginas de fornecedores às dezenas. Leve a coluna url para o Email & Contact Scraper e a SERP vira uma lista contatável.

Vendas · Prospecção
Preços

Pague só pelo que realmente usar.

Plano grátis

As primeiras 500 linhas são grátis

Uma única vez, no cadastro. Sem cartão e sem nada para cancelar depois.

Uma única vez, no cadastro
Tarifa

depois US$ 0,002 por linha

Cobrado pelas linhas realmente devolvidas. Com as 69 a 74 linhas que uma consulta devolveu nas nossas execuções, 500 linhas grátis dão cerca de sete consultas antes de qualquer cobrança.

Cobrado pelas linhas devolvidas
Sem assinatura

Nada recorrente

Os créditos não expiram em ciclo mensal. Rode um lote agora e mais nada até precisar de novo.

Sem expiração mensal
10% de desconto na sua primeira execução paga.Use o código LIVESCRAPER10 no checkout.
Cadastrar
Combina bem com

O resto da família de busca.

A parte jurídica

É legal fazer scraping dos resultados do Yahoo?

Uma página de resultados é uma página pública, e as cinco colunas aqui descrevem páginas web, não pessoas. As ressalvas são sobre volume e reutilização.

Ler uma página de resultados é o que qualquer visitante faz, e uma posição, um título, um link e um trecho são fatos sobre páginas web publicamente acessíveis. Nada na exportação identifica uma pessoa: não há nome, e-mail, telefone nem conta, então as questões de proteção de dados que moldam nossos serviços sobre pessoas não se colocam aqui.

Duas coisas merecem ser ditas com clareza. Primeiro, os trechos e os títulos são escritos pelos sites indexados, não por nós, e são o texto protegido por direitos autorais desses sites. Usá-los internamente para acompanhamento de posição, análise competitiva e auditorias é prática comum; republicá-los como conteúdo próprio é outra pergunta, com outra resposta. Segundo, isto é um instantâneo e não um ranking: nossas duas execuções da mesma consulta com um dia de diferença compartilharam apenas 42 de cerca de 64 URLs, então qualquer conclusão tirada de uma exportação isolada é mais frágil do que parece. Rode uma série.

Nossos termos são os mesmos de qualquer outro serviço aqui. Apenas páginas publicamente acessíveis, nada atrás de login, sem rastreadores de terceiros na camada de dados, e as exportações são apagadas automaticamente após 30 dias. Suas primeiras 500 linhas são grátis e não precisam de cartão.

livescraper.app · o que molda uma execução
Uma consulta por conjunto de linhas
O número de linhas variou entre 69 e 74 nas nossas execuções
position é contínua a partir de 1
url se repete - deduplique antes de contar!
Exportações são apagadas após 30 dias
Os resultados mudam de um dia para o outro. Na única consulta que rodamos duas vezes, um terço das URLs foi renovado em 24 horas.
Perguntas frequentes

O que as pessoas perguntam antes de se cadastrar.

Quais colunas a exportação vai conter?+
Cinco: query, position, title, url e description. Uma linha por resultado. Nas 360 linhas por trás desta página, cada uma dessas cinco estava preenchida em todas as linhas - não houve uma única célula vazia.
Quantos resultados uma consulta devolve?+
Varia. Nossas cinco execuções devolveram 74, 70, 73, 69 e 74 linhas, então não há um tamanho de página fixo para planejar. Leia as linhas que você recebe em vez de supor um número redondo.
Por que a mesma URL aparece mais de uma vez?+
Porque o Yahoo a mostra mais de uma vez. Dentro de uma única execução contamos 20 linhas duplicadas numa exportação de 74 linhas, e 4, 9, 11 e 16 nas outras. Elas estão em posições reais e distintas. Deduplique por url antes de contar hosts ou medir participação de resultados.
Os resultados são os mesmos se eu rodar a consulta amanhã?+
Não. Rodamos python web scraping duas vezes, com 24 horas de intervalo: 66 URLs distintas no primeiro dia, 62 no segundo, 42 presentes em ambas. Dessas 42, 22 tinham mudado de posição. Até o top dez compartilhava 9 de 10 URLs, mas não na mesma ordem. Trate uma execução como um instantâneo e acompanhe uma série se precisar de tendência.
Posso ordenar pela coluna position?+
Sim. É um número e, nas cinco execuções, foi contínuo de 1 a N, sem lacunas nem repetições. Um número faltando nos seus dados significa, portanto, que uma linha se perdeu no seu pipeline, não na coleta.
Por que alguns títulos começam com algo como “www. python .org”?+
O Yahoo às vezes coloca a URL exibida como trilha antes do título. Isso aconteceu em 9 das nossas 360 linhas. Se você casar por título, remova esse fragmento inicial - ou case por url, que não tem esse problema.
Quanto custa?+
Suas primeiras 500 linhas são grátis, uma única vez, sem cartão. Depois são US$ 0,002 por linha, cobrados pelas linhas realmente devolvidas. Com as 69 a 74 linhas que uma consulta devolveu nas nossas execuções, o plano grátis cobre cerca de sete consultas.
Em quais formatos posso exportar?+
CSV, JSON ou Excel. As cinco colunas e a ordem delas são as mesmas nos três.

Coloque uma página de resultados numa planilha.

Cinco colunas por resultado, preenchidas em todas as linhas. Suas primeiras 500 linhas são grátis, depois US$ 0,002 cada.

Ativa na hora · sem cartão

Fazer scraping dos resultados de busca do Yahoo

O Yahoo Search Scraper recebe uma consulta e devolve a página de resultados como linhas: query, position, title, url e description, uma linha por resultado. Cinco execuções e 360 linhas estão por trás desta página, e cada uma dessas cinco colunas estava preenchida em cada uma dessas linhas - nenhuma célula vazia em lugar nenhum da exportação. position volta como um número contínuo a partir de 1, então ordena diretamente, e uma lacuna nos seus dados significa que uma linha se perdeu depois, não durante a coleta.

Duas propriedades dos dados importam mais que o esquema. A primeira é a duplicação: dentro de uma única execução a coluna url se repete, 20 vezes numa exportação de 74 linhas e 4, 9, 11 e 16 vezes nas outras. São linhas genuínas em posições genuínas, então qualquer contagem de hosts, domínios ou participação de resultados precisa deduplicar primeiro. A segunda é a volatilidade. Rodamos a consulta python web scraping em dois dias seguidos: 66 URLs distintas no primeiro dia, 62 no segundo, e só 42 apareceram em ambas. Dessas 42 sobreviventes, 22 tinham mudado de posição, e até o top dez compartilhava nove de dez URLs em outra ordem. Uma exportação isolada é o instantâneo de um momento, e um programa de acompanhamento de posição baseado numa leitura por trimestre vai relatar ruído como se fosse movimento.

As contagens de linhas também não são fixas - nossas cinco execuções devolveram 74, 70, 73, 69 e 74 linhas, com uma consulta cada. Os trechos foram de 6 a 417 caracteres, com mediana de 194, e 79 dos 360 terminaram em reticências onde o Yahoo cortou, então a coluna description pede um tipo de texto amplo e não um varchar curto. Os títulos costumam ser o título da página, mas em 9 das 360 linhas começavam com um domínio exibido separado por espaços, como www. python .org › downloads; casar por url evita isso por completo. Nas 360 linhas havia 168 hosts distintos, 358 links https e 2 http.

Os usos comuns decorrem desse formato. Acompanhamento de posição funciona se você rodar uma série em vez de uma exportação única. Visibilidade competitiva é um agrupamento por host. Auditar cobertura significa passar a mesma lista de consultas por este serviço e pelo Google Search Scraper e comparar os conjuntos de URLs, porque onde dois buscadores discordam costuma haver algo interessante. E uma página de resultados para uma consulta de categoria mais cidade vira uma lista de leads assim que a coluna url passa pelo Email & Contact Scraper. No aspecto jurídico, uma posição, um link e um trecho são fatos sobre páginas web públicas e nenhuma das cinco colunas descreve uma pessoa - embora os trechos sejam o texto protegido dos sites indexados, o que torna a análise interna comum e a republicação uma questão à parte. Apenas páginas publicamente acessíveis, sem rastreadores de terceiros na camada de dados, e as exportações são apagadas automaticamente após 30 dias. Suas primeiras 500 linhas são grátis e não precisam de cartão.