Extracteur Baidu Maps

La carte de la Chine,
en tableau de lieux.

Indiquez les catégories ou les marques que vous cherchez et les villes où chercher, et récupérez les lieux en lignes : le nom, l'adresse, le numéro de téléphone, l'étiquette de catégorie, une latitude et une longitude, et l'identifiant propre à Baidu pour le lieu. Neuf colonnes, une ligne par lieu. Une chose à savoir avant de commencer : Baidu Maps est hébergé en Chine et bloque les IP de datacenters hors de Chine, ce scraper a donc besoin d'un proxy résidentiel - idéalement à sortie chinoise - pour renvoyer quoi que ce soit.

500 lignes gratuites, une seule foispuis 0,002 $ par ligne9 colonnesCSV · XLSX · JSON
Comment ça marche

Catégories et villes entrent,
les lieux sortent.

Deux cases plutôt qu'une : ce que vous cherchez, et où. La plateforme les combine, donc chaque catégorie est cherchée dans chaque localité.

  1. ÉTAPE 1Connectez-vous à la plateforme.
  2. ÉTAPE 2Ouvrez le Baidu Maps Scraper.
  3. ÉTAPE 3Saisissez les catégories ou marques voulues, une par ligne.
  4. ÉTAPE 4Saisissez les localités, une par ligne - ou importez un fichier CSV, XLSX, TXT ou Parquet.
  5. ÉTAPE 5Fixez une limite par requête, ou mettez-la à 0 pour tout prendre.
  6. ÉTAPE 6Cliquez sur Get Data.

Les deux listes sont combinées en produit cartésien : dix catégories contre vingt villes font donc deux cents recherches, et non trente. Lisez la note sous le dictionnaire avant de coller une longue liste dans l'une ou l'autre case.

Pourquoi les équipes l'utilisent

La carte derrière
la Grande Muraille numérique.

La source qui couvre réellement la Chine

Les produits cartographiques occidentaux sont pauvres en fiches de Chine continentale. C'est chez Baidu que ces lieux se trouvent, ce qui en fait le seul point de départ praticable pour un jeu de données de lieux à l'intérieur de la Chine.

Catégories fois villes, en une seule tâche

Vous fournissez deux listes et la tâche parcourt la grille. Un balayage de catégories sur vingt villes, c'est une tâche et un fichier de sortie, plutôt que vingt tâches à recoudre ensuite.

Un identifiant stable par lieu

Chaque ligne porte l'identifiant propre à Baidu pour le lieu. C'est ce qui rend une seconde exécution comparable à la première, au lieu d'un nouveau tas de noms à rapprocher approximativement.

Ce que vous récupérez

Neuf colonnes -
et une réponse franche à leur sujet.

L'ensemble de colonnes ci-dessous est solide. Ce que contiennent les cellules, cette page ne va pas le deviner, et la raison mérite deux paragraphes de votre temps.

Les neuf noms et leur ordre proviennent de la ligne d'en-tête de cinq exports d'exécution distincts, réalisés à quinze jours d'écart, qui concordent exactement. C'est la meilleure preuve dont nous disposons pour ce scraper - et c'est une source plutôt que deux, ce qui mérite d'être dit franchement : contrairement à la plupart des pages d'ici, il n'existe pas de liste de colonnes publiée pour la recouper.

Ce que nous n'avons pas, c'est un export rempli. Baidu Maps est hébergé en Chine et bloque les IP de datacenters hors de Chine, et chaque exécution archivée ici a été faite sans proxy à sortie chinoise : chacune est donc revenue sous la forme d'une ligne d'en-tête sans rien en dessous. C'est le comportement documenté, pas un défaut. Cela signifie que cette page peut vous dire à quoi chaque colonne sert, et ne peut pas vous dire quelle forme prennent ses valeurs - vous ne trouverez donc ci-dessous ni type, ni unité, ni format, ni exemple. Lancez une exécution avec votre propre proxy sur une seule catégorie dans une seule ville et lisez le premier fichier obtenu.

Dictionnaire de données

Neuf colonnes,
dans l'ordre d'export.

La ligne d'en-tête de l'export, dans l'ordre. Les descriptions disent à quoi sert chaque champ ; elles ne prétendent délibérément rien quant à son format, ses unités ou son vocabulaire - voyez la note ci-dessus.

category
La catégorie ou la marque que vous avez soumise, répétée sur chaque ligne qui en provient. Une moitié du couple qui a produit la recherche.
location
La localité que vous avez soumise, répétée sur chaque ligne qui en provient. L'autre moitié du couple - avec category, elle vous dit à laquelle de vos recherches une ligne appartient.
name
Le nom du lieu.
address
L'adresse telle que la fiche la donne. Elle arrive en un seul champ ; il n'y a pas de colonnes distinctes de ville, de district ou de code postal sur lesquelles regrouper.
phone
Le numéro de téléphone porté par la fiche.
tag
La classification propre à Baidu pour le lieu. C'est l'étiquette de la plateforme, pas la category que vous avez demandée : les deux peuvent donc différer sur une même ligne.
latitude
La coordonnée nord-sud. Déterminez dans quel système de coordonnées ces valeurs sont exprimées avant de les tracer ou de les joindre - voyez la note ci-dessous.
longitude
La coordonnée est-ouest. La même prudence s'applique.
uid
L'identifiant Baidu du lieu. C'est la colonne sur laquelle s'appuyer quand vous relancez une recherche et voulez savoir ce qui a changé, et le seul champ ici qui reste stable quand un commerce change de nom.

Lisez ceci avant de bâtir autour du tableau ci-dessus. Chaque export d'exécution que nous détenons pour ce scraper est revenu vide - à chaque fois un classeur avec cette ligne d'en-tête et aucune ligne de données en dessous. La cause n'est pas un bug : Baidu Maps est hébergé en Chine et bloque les IP de datacenters hors de Chine, et une exécution sans proxy résidentiel - idéalement à sortie chinoise - se termine et ne renvoie absolument rien plutôt que de lever une erreur. Les neuf noms sont donc solides ; rien d'autre ici ne l'est. Nous ne publions ni taux de remplissage, ni valeurs d'exemple, ni format pour aucune colonne. Cela inclut les coordonnées, et ce sont elles qui mordront. Les services cartographiques ne publient pas tous les positions sur le même référentiel géodésique, et poser deux nombres sur un fond de carte GPS est une opération d'une ligne qui produit une carte confiante et fausse quand le référentiel diffère. Cette page ne vous dira pas dans quel système ces valeurs sont exprimées, parce que nous n'avons pas vu de cellule remplie - vérifiez une poignée d'adresses que vous connaissez sur votre propre fond de carte lors de votre première vraie exécution, avant que quoi que ce soit en aval n'en dépende.

Réglages d'exécution

Réglé sur la tâche,
pas dans le tableur.

Deux listes d'entrée et une limite. Les listes sont combinées en produit cartésien : la limite s'applique donc par recherche et non par exécution - c'est ce nombre qui détermine ce que coûte une tâche.

Catégories ou marques Localités Combinées en produit cartésien Limite par requête 0 pour tout prendre Import CSV Import XLSX Import TXT Import Parquet Proxy à sortie chinoise requis
Cas d'usage courants

Trois tâches qui tournent
ici plus que les autres.

Quelques exemples de la façon dont les équipes se servent des données de lieux chinois pour répondre à une question qu'elles se posent vraiment.

Expansion

Compter la concurrence ville par ville

Une catégorie face à une liste de villes donne un décompte comparable par marché dans un seul fichier. Comme les deux moitiés du couple figurent sur chaque ligne, le regroupement est déjà là - rien à reconstituer pour savoir de quelle recherche vient un lieu.

Expansion · Stratégie
Implantation

Cartographier le réseau de magasins d'une marque en Chine continentale

La case d'entrée accepte aussi bien des marques que des catégories : les points de vente d'une chaîne sur un ensemble de villes reviennent donc en un seul tableau, avec un identifiant stable par emplacement - ce qui fait de l'exécution suivante une comparaison plutôt qu'un nouveau départ.

Retail
Couverture

Combler le trou chinois d'un jeu de lieux mondial

Les jeux de données de lieux construits à partir de sources occidentales s'appauvrissent nettement à l'intérieur de la Chine. Relancer ici la même liste de catégories et concaténer est la façon pratique de combler ce trou - une fois réglée la question des coordonnées ci-dessus.

Ingénierie des données
Tarifs

Ne payez que les lieux
que vous extrayez vraiment.

Pas d'abonnement, pas de minimum, pas de facture récurrente. Vos 500 premières lignes sont pour nous - ensuite vous payez à l'usage, au même tarif forfaitaire que tous les autres scrapers d'ici.

Offre gratuite

500 lignes gratuites - 0 $

Sur chaque nouveau compte, une seule fois. Sans carte bancaire. Limites par requête, import de fichiers et tous les formats d'export inclus.

0 $ pour toujours
À l'usage

0,002 $ par ligne après l'offre gratuite

Environ 2 $ pour 1 000 lieux. L'estimateur affiche le nombre de lignes et le coût en crédits avant le lancement - il mérite un second regard ici, car deux listes d'entrée se multiplient en bien plus de recherches qu'on ne l'imagine.

Le plus choisi
Volume

Sur mesure · gros volumes

Tarifs au volume, workers dédiés et SLA pour un suivi continu ou de très gros extraits historiques. Donnez-nous vos chiffres, nous préparons un devis.

Parlons-en
10 % de remise sur votre première exécution payante.Utilisez le code LIVESCRAPER10 au paiement.
S'inscrire
Va bien avec

Une carte,
et celles d'à côté.

Le point juridique

Le scraping de
Baidu Maps est-il légal ?

Réponse courte : les fiches sont des informations d'entreprise publiques - mais c'est un service chinois portant des données chinoises, et cela change les règles sur lesquelles vous devriez vous interroger.

Une fiche Baidu Maps est montrée à quiconque lance la recherche : le nom, l'adresse, le numéro de téléphone et la catégorie sont précisément ce par quoi le lieu est publié pour être trouvé. Collecter des fiches d'entreprises publiquement visibles à des fins d'étude de marché est une pratique établie de longue date, et ce scraper ne touche ni connexion, ni compte, ni mur payant.

Ce qui change ici, c'est la juridiction. Le service est hébergé en Chine, les données décrivent des entreprises en Chine, et les conditions de Baidu restreignent l'accès automatisé - c'est donc autant une question contractuelle que juridique, et ce ne sont pas les conditions auxquelles la plupart des lecteurs de ce site sont habitués. Si vous sortez les résultats de Chine, le transfert transfrontalier est une vraie question avec ses propres règles et non un détail : mieux vaut la poser à quelqu'un de qualifié avant qu'un pipeline n'en dépende. Nous ne sommes pas les bonnes personnes pour ce conseil, et ce paragraphe ne l'est pas.

Côté données personnelles, les lignes sont des fiches d'entreprise, ce qui écarte l'essentiel du sujet - mais phone reste un numéro de contact, et pour un indépendant ou une petite boutique ce numéro joint souvent une personne précise. Si votre analyse porte sur la couverture et l'implantation plutôt que sur le contact, supprimez la colonne dès l'import et la question cesse d'être la vôtre. Nous n'exécutons aucun traceur tiers sur la couche de données, et vos exports s'effacent d'eux-mêmes au bout de 30 jours.

livescraper.app · principes
Fiches d'entreprises publiques uniquement
Aucune connexion, aucun compte touché
Le transfert transfrontalier, c'est à vous de le régler
phone peut être une donnée personnelle - supprimez-la si inutilisée
Les exports s'effacent seuls (30 jours)
Relisez les conditions de Baidu avant de passer à l'échelle.
Questions fréquentes

Ce que l'on demande
avant de s'inscrire.

Les questions qui reviennent le plus. Une autre ? Écrivez-nous - ce sont des humains qui rédigent les réponses, pas des bots.

Comment scraper Baidu Maps ?+
Avec le Baidu Maps Scraper :
  1. Connectez-vous à la plateforme.
  2. Ouvrez le Baidu Maps Scraper.
  3. Saisissez les catégories ou marques voulues, une par ligne.
  4. Saisissez les localités, une par ligne - ou importez un fichier CSV, XLSX, TXT ou Parquet.
  5. Fixez une limite par requête, ou mettez-la à 0 pour tout prendre.
  6. Cliquez sur Get Data.
Pourquoi mon exécution est-elle revenue vide ?+
Presque certainement à cause du proxy. Baidu Maps est hébergé en Chine et bloque les IP de datacenters hors de Chine : sans proxy résidentiel - idéalement à sortie chinoise - la tâche se termine normalement et ne renvoie absolument rien. Il n'y a aucune erreur à lire, et c'est ce qui rend la chose déroutante. Pointez l'exécution vers un proxy adapté et essayez une catégorie dans une ville avant de faire plus gros.
Comment les deux cases de saisie fonctionnent-elles ensemble ?+
Elles se multiplient. Chaque catégorie est cherchée dans chaque localité : dix catégories contre vingt villes font donc deux cents recherches plutôt que trente. C'est utile quand vous voulez une grille et coûteux quand vous n'aviez pas réalisé en avoir demandé une - vérifiez donc l'estimateur avant de lancer une exécution bâtie sur deux longues listes.
Que récupère-t-on pour chaque lieu ?+
Neuf colonnes : la catégorie et la localité que vous avez soumises, le nom, l'adresse, le numéro de téléphone, l'étiquette de catégorie propre à Baidu, une latitude et une longitude, et l'identifiant Baidu du lieu. Une ligne par lieu, et les neuf figurent dans le CSV et le XLSX comme dans le JSON.
Dans quel système de coordonnées sont la latitude et la longitude ?+
Nous n'allons pas vous le dire, parce que nous n'avons pas vu d'export rempli. Cela compte plus que pour les autres colonnes : les services cartographiques ne publient pas tous les positions sur le même référentiel géodésique, et tracer deux nombres sur un fond de carte GPS est une opération d'une ligne qui produit une carte confiante et fausse quand le référentiel diffère. Vérifiez quelques lieux que vous connaissez sur votre propre fond de carte lors de votre première vraie exécution, et tranchez-le là avant que quoi que ce soit en aval n'en dépende.
Pourquoi la colonne tag ne correspond-elle pas à la catégorie demandée ?+
Parce que ce sont deux choses différentes. La colonne category répète ce que vous avez soumis ; la colonne tag est la classification propre à Baidu pour le lieu. Une recherche sur un terme peut renvoyer des lieux que la plateforme range sous quelque chose de voisin : les deux diffèrent donc légitimement sur une même ligne. Regroupez selon celle qui correspond réellement à votre question.
Est-il légal de scraper Baidu Maps ?+
Les fiches sont des informations d'entreprise publiques et le scraper ne lit rien d'autre - pas de connexion, pas de compte, pas de mur payant. Mais le service est hébergé en Chine et les conditions de Baidu restreignent l'accès automatisé : c'est donc autant une question contractuelle que juridique, et sortir les résultats de Chine soulève des règles de transfert transfrontalier sur lesquelles il vaut mieux prendre un vrai conseil. Les lignes sont des fiches d'entreprise et non des personnes, la colonne du téléphone étant l'exception qu'il vaut mieux supprimer si vous n'en avez pas besoin.
Combien ça coûte ?+
Les 500 premières lignes sont gratuites et offertes une seule fois, sans carte bancaire. Ensuite, c'est 0,002 $ par ligne - environ 2 $ pour 1 000 lieux - soit le même tarif forfaitaire que tous les autres scrapers de la plateforme. L'estimateur affiche le coût d'une exécution avant son lancement, ce qui vaut la peine d'être lu ici puisque deux listes d'entrée se multiplient.

Vos 500 premiers lieux,
c'est la maison qui offre.

500 lignes gratuites une seule fois sur chaque nouveau compte - sans date d'expiration. Ensuite 0,002 $ par ligne à l'usage - aucune carte enregistrée tant que vous ne le décidez pas.

Actif immédiatement · sans carte bancaire

Scraper les données de lieux Baidu Maps à grande échelle

Le Baidu Maps Scraper de Livescraper transforme des recherches cartographiques en données de lieux. Vous lui donnez deux listes - les catégories ou marques que vous cherchez, et les localités où chercher - et la plateforme les combine, cherchant chaque catégorie dans chaque localité. Les localités peuvent être saisies une par ligne ou importées sous forme de fichier CSV, XLSX, TXT ou Parquet. Plafonnez le nombre de lignes par recherche, puis téléchargez les résultats en CSV, Excel ou JSON propres.

Chaque ligne porte neuf colonnes : la catégorie et la localité que vous avez soumises, le nom du lieu, l'adresse, le numéro de téléphone, l'étiquette de catégorie propre à Baidu, une latitude et une longitude, et l'identifiant Baidu du lieu. Cette dernière colonne est ce qui fait d'une exécution répétée une comparaison plutôt qu'un nouveau départ, car elle survit au changement de nom d'un commerce.

Les équipes d'expansion lancent une catégorie face à une liste de villes pour obtenir un décompte comparable par marché dans un seul fichier. Les équipes retail mettent une marque dans la même case pour cartographier les points de vente d'une chaîne en Chine continentale. Les ingénieurs données s'en servent pour combler le trou chinois d'un jeu de lieux assemblé à partir de sources occidentales, où la couverture continentale s'appauvrit nettement.

Deux choses à savoir avant de bâtir là-dessus. Ce scraper a besoin d'un proxy résidentiel, idéalement à sortie chinoise : Baidu Maps est hébergé en Chine et bloque les IP de datacenters hors de Chine, et sans proxy une exécution se termine et ne renvoie absolument rien plutôt que de lever une erreur. Et parce que chaque export archivé ici est revenu sous la forme d'une ligne d'en-tête sans données en dessous, cette page nomme les neuf colonnes et dit à quoi chacune sert sans revendiquer de type, d'unité ni de format pour aucune - y compris les coordonnées, dont vous devriez établir le référentiel à partir de votre propre première exécution avant de les joindre à des données GPS. Commencez gratuitement : vos 500 premières lignes ne coûtent rien et ne demandent pas de carte bancaire, puis c'est un forfait de 0,002 $ par ligne.