Extracteur IA

Décrivez les données.
Obtenez les colonnes.

Collez les URL de n'importe quelles pages, une par ligne, puis dites ce que vous voulez en tirer - sous forme de phrase dans le champ Prompt, ou de schéma que vous construisez champ par champ. Claude lit chaque page et renvoie ce que vous avez demandé. Les champs que vous nommez sont les colonnes ; il n'y a ni parseur par site ni jeu figé à contourner.

500 lignes gratuites, une seule foispuis 0,002 $ par lignevous définissez les colonnesCSV · JSON · Excel
Comment ça marche

Une liste d'URL
et une description.

Deux entrées obligatoires, et la seconde peut être donnée sous la forme qui vous arrange.

  1. ÉTAPE 1Connectez-vous à la plateforme.
  2. ÉTAPE 2Ouvrez l'Extracteur IA.
  3. ÉTAPE 3Collez les URL de n'importe quelles pages, une par ligne - ou téléversez un fichier CSV, XLSX, TXT ou Parquet.
  4. ÉTAPE 4Dites ce que vous voulez. Soit vous l'écrivez dans le champ Prompt - décrivez les données que vous voulez extraire - soit vous passez à Schema et ajoutez les champs un par un, chacun avec un nom, un type et un indicateur « requis » optionnel.
  5. ÉTAPE 5Fixez une limite de lignes par URL si vous le souhaitez. La laisser vide prend tout.
  6. ÉTAPE 6Cliquez sur Get Data et téléchargez en CSV, JSON ou Excel.

Il vous en faut un des deux, pas les deux : le formulaire ne vous arrête que si le prompt est vide et qu'aucun champ de schéma n'a été défini. Si vous écrivez les deux, vous donnez au modèle l'instruction et la forme.

Pourquoi les équipes l'utilisent

Le schéma est
le livrable.

Tapez le champ, obtenez la colonne

Ajoutez un champ nommé price et le fichier a une colonne nommée price. Il n'y a ni étape de mappage ni liste de sites pris en charge, parce que rien ici n'est écrit par site. C'est ce qui le rend intéressant pour les pages qu'aucun extracteur dédié ne couvre - le catalogue d'un fournisseur, les avis d'un régulateur, le journal des versions d'un concurrent.

Une phrase, ou un schéma typé

Le champ Prompt accepte une description en clair et c'est la façon la plus rapide d'essayer quelque chose. Le constructeur Schema est celui à utiliser quand la sortie doit être prévisible : chaque champ porte un type - String, Number, Boolean, Array ou Object - et peut être marqué requis. Un onglet JSON affiche le même schéma en JSON Schema, vous pouvez donc coller celui que vous avez déjà.

Votre entrée voyage avec la sortie

Quand l'export porte une colonne query, elle est placée en premier : chaque ligne dit quelle URL l'a produite et un fichier couvrant cinquante pages reste regroupable. Un détail discret à connaître : une clé interne position est délibérément exclue des colonnes assemblées, elle n'apparaît donc ni dans le tableau ni dans les téléchargements.

Ce que vous récupérez

Il n'y a pas de liste de colonnes,
parce que c'est vous qui l'écrivez.

Toutes les autres pages produit d'ici nomment un jeu de colonnes figé. Celle-ci ne le peut pas, et la raison est structurelle, pas un oubli.

Les champs que vous décrivez sont le fichier. Ce service n'a nulle part de tableau de colonnes déclaré. La liste est assemblée après l'exécution, à partir des clés réellement revenues : query d'abord lorsqu'elle est présente, puis chaque autre clé dans l'ordre où elle a été vue pour la première fois. Demandez sku, price et in_stock et ce seront vos colonnes, dans cet ordre. Demandez quelque chose que la page ne porte pas et attendez-vous à une cellule vide plutôt qu'à une invention - mais vérifiez-le sur votre propre première exécution plutôt que de le croire sur parole.

Prompt ou schéma est un vrai choix, pas deux mots pour la même chose. Un prompt est plus rapide et plus indulgent, et c'est le bon outil tant que vous cherchez encore ce que contient une page. Un schéma est ce qu'il vous faut dès que la sortie alimente quelque chose en aval : nommer les champs et leurs types est la façon d'empêcher la forme de dériver d'une exécution à l'autre, et marquer un champ requis est la façon de dire qu'il compte. Le constructeur et la vue JSON sont le même schéma : vous pouvez commencer en cliquant et finir en collant.

Deux différences pratiques avec le reste de la plateforme. Ici la limite compte des lignes par URL et non des pages, et elle est vide par défaut, ce qui veut dire toutes - l'inverse d'un outil qui s'arrête après une page tant que vous ne dites rien. Et chaque page est récupérée via le pool de proxies plutôt que depuis votre propre adresse : si une PROXY_URL ou une PROXY_LIST payante est configurée, elle est utilisée, sinon le pool gratuit, et dans aucun des deux cas votre IP réelle.

Ce que cette page ne vous dira pas, c'est la qualité d'une extraction donnée. Nous n'avons aucun export rempli de ce service à décrire, et la qualité dépend ici de la page visée et des mots choisis - donc pas de chiffre de précision, pas de fichier d'exemple et aucune promesse sur une cellule précise. Dépensez quelques lignes gratuites sur une page, lisez les colonnes, puis élargissez la liste.

Cas d'usage courants

Trois tâches pour lesquelles
on vient ici.

Toutes concernent des pages qu'aucun extracteur dédié ne couvre.

Longue traîne

Le site pour lequel personne n'a écrit de parseur

L'essentiel du travail de scraping n'est ni Amazon ni LinkedIn - c'est un distributeur professionnel, la liste des membres d'une fédération, le registre des licences d'une commune. Pointez ceci sur ces pages, nommez les quatre champs dont vous avez réellement besoin, et vous obtenez un tableau sans que personne n'écrive un parseur pour un site que vous utiliserez deux fois.

Recherche · Opérations
Prototype

Élaborer le schéma avant de s'y engager

Commencez dans le champ Prompt sur une poignée de pages, voyez ce qui revient, puis basculez dans le constructeur Schema les champs qui se sont révélés utiles et donnez-leur des types. Ce chemin - décrire librement, puis fixer - est la raison d'être des deux entrées.

Data · Ingénierie
Surveillance

Extraire les mêmes champs de pages qui changent sans cesse

Une page tarifs, une page conditions, une page statut : la formulation bouge, le balisage bouge, et un extracteur à base de sélecteurs casse sur les deux. Décrire le champ plutôt que sa position, c'est ce qui survit à une refonte, ce qui en fait un choix raisonnable pour quelque chose que vous comptez relancer.

Concurrence · Conformité
Tarifs

Payez à la ligne,
et rien d'autre.

Pas d'abonnement, pas de minimum, pas de licence par utilisateur. Vos 500 premières lignes sont offertes - ensuite, c'est du paiement à l'usage.

Offre gratuite

500 lignes gratuites - 0 $

Pour chaque nouveau compte, une seule fois. Sans carte bancaire. Tous les scrapers débloqués. Sur ce service en particulier, c'est là qu'il faut commencer : cela ne coûte rien de découvrir si votre prompt ou votre schéma renvoie bien ce que vous vouliez dire.

0 $ pour toujours
Paiement à l'usage

0,002 $ par ligne, après l'offre gratuite

Environ 2 $ pour 1 000 lignes, le même tarif forfaitaire que tous les autres scrapers de la plateforme - une extraction pilotée par IA n'est pas facturée différemment d'une extraction à schéma figé. La limite compte des lignes par URL et vaut toutes par défaut : mieux vaut poser un nombre tant que vous testez encore les formulations.

Le plus populaire
Enterprise

Sur mesure - beaucoup de sites, planifiés

Tarifs au volume, SLA, workers dédiés et onboarding sur mesure pour les équipes qui lancent ceci sur une longue liste de sources plutôt que sur quelques pages. Donnez-nous vos chiffres et nous vous ferons une proposition.

Parlons-en
10 % de remise sur votre première exécution payante.Utilisez le code LIVESCRAPER10 au paiement.
S'inscrire
S'associe bien avec

Quand un schéma figé
vous servirait mieux.

Décrire des champs est le bon outil pour les pages que personne n'a parsées. Là où un extracteur dédié existe, utilisez-le - les colonnes y sont déjà connues.

Le volet juridique

Est-il légal
d'extraire avec l'IA ?

Réponse courte : ce sont les règles qui s'appliquaient déjà au scraping - qu'un modèle lise la page ne change pas ce que vous avez le droit de collecter.

Collecter des informations publiquement visibles à des fins de recherche et d'analyse est une pratique établie de longue date, et c'est ce qui se passe ici : la page est récupérée telle qu'un visiteur ordinaire la verrait, et un modèle la lit. Tant que les données sont accessibles au public et que le processus ne perturbe pas le service, aucune loi fédérale ne l'interdit. Ce que le modèle ne fait pas, c'est vous faire passer quoi que ce soit : rien derrière une connexion, un paywall ou un mur de consentement n'entre dans le périmètre.

Ce service est plus ouvert que le reste de la plateforme, ce qui place la responsabilité du périmètre sur la personne qui écrit le prompt. Un schéma qui demande des noms, des e-mails ou toute autre donnée identifiant une personne signifie que vous traitez des données personnelles, et le RGPD et les régimes similaires s'appliquent à vous quelle qu'en soit la provenance. Demandez ce dont votre finalité a réellement besoin ; un champ que vous ne pouvez pas justifier est un risque, pas un bonus.

Les conditions de chaque site s'appliquent toujours, et elles varient - vérifiez-les pour les pages que vous comptez traiter. Nous ne touchons à rien derrière une connexion, ne lisons que ce que voit un visiteur ordinaire, n'exécutons aucun traceur tiers sur la couche de données, et vos exports s'auto-suppriment au bout de 30 jours.

livescraper.app · principes
Uniquement des pages publiques
Pas de connexion, pas de paywall
C'est vous qui choisissez les champs - ne demandez que ce que vous pouvez justifier!
Aligné RGPD par défaut
Les exports s'auto-suppriment (30 jours)
Récupéré via le pool de proxies, jamais depuis votre IP réelle.
Questions fréquentes

Ce qu'on demande avant de s'inscrire.

Les questions que nous entendons le plus. Autre chose ? Parlez-nous - ce sont des humains qui rédigent les réponses, pas des bots.

Quelles colonnes l'export contiendra-t-il ?+
Celles que vous avez demandées. Ce service n'a nulle part de jeu de colonnes figé - la liste est assemblée après l'exécution à partir des clés revenues, avec query placée en premier lorsqu'elle est présente et chaque autre clé à la suite dans l'ordre où elle a été vue pour la première fois. C'est pourquoi cette page n'a pas de dictionnaire de données : il n'y a rien de figé à tabuler.
Dois-je écrire un prompt ou construire un schéma ?+
L'un ou l'autre, et il vous en faut un. Un prompt est une phrase décrivant ce qu'il faut extraire et c'est la façon la plus rapide d'essayer. Un schéma est une liste de champs ajoutés un par un, chacun avec un nom et un type, éventuellement marqué requis - utilisez-le quand la sortie doit garder la même forme d'une exécution à l'autre. Le formulaire ne vous arrête que si le prompt est vide et qu'aucun champ de schéma n'a été défini.
Quels types de champ un schéma peut-il utiliser ?+
Cinq : String, Number, Boolean, Array et Object. Chaque champ possède aussi un interrupteur « requis ». Un onglet JSON affiche la même chose en JSON Schema, vous pouvez donc coller un schéma existant - il lui faut un objet properties comportant au moins une entrée, et un JSON invalide est refusé plutôt qu'ignoré en silence.
Y a-t-il une liste de sites pris en charge ?+
Non, et c'est tout l'intérêt de celui-ci. Rien ici n'est écrit par site, donc toute page que vous pouvez ouvrir dans un navigateur est candidate. Là où un site dispose d'un extracteur dédié sur cette plateforme, préférez-le - ceux-là renvoient un jeu de colonnes documenté plutôt qu'un jeu que vous devez décrire.
À quoi sert le champ de limite ?+
Il plafonne le nombre de lignes renvoyées par URL, et il est vide par défaut, ce qui veut dire toutes. Notez qu'il compte des lignes et non des pages - la limite de l'Universal AI Scraper compte des pages par requête, les deux ne sont donc pas interchangeables.
En quoi est-ce différent de l'Universal AI Scraper ?+
Des entrées différentes et une limite différente. Celui-ci prend un prompt en texte libre ou un schéma typé et limite les lignes par URL. L'Universal AI Scraper prend une liste d'attributs que vous choisissez ou saisissez, et limite les pages par requête. Prenez celui-là quand une poignée de noms d'attributs suffit ; prenez celui-ci quand vous voulez des types, des champs requis ou une phrase.
Ai-je besoin d'un proxy ?+
Vous n'avez pas à en configurer un. Chaque page est récupérée via le pool de proxies : si une PROXY_URL ou une PROXY_LIST payante est définie, elle est utilisée, sinon le pool gratuit. Dans les deux cas la requête ne part pas de votre IP réelle.
Quelle est la précision de l'extraction ?+
Nous ne publions pas de chiffre, et nous préférons expliquer pourquoi plutôt que d'en inventer un. La qualité dépend de la page visée et de la façon dont vous formulez le champ : un nombre unique serait dénué de sens pour les deux. L'offre gratuite existe exactement pour cela - lancez une page, lisez les colonnes, ajustez la formulation, puis élargissez la liste.
Combien ça coûte ?+
Les 500 premières lignes d'un nouveau compte sont gratuites et valables une seule fois ; ensuite c'est 0,002 $ par ligne - environ 2 $ les 1 000 - en paiement à l'usage, sans abonnement. C'est le même tarif forfaitaire que tous les autres scrapers d'ici. Les crédits n'expirent pas et il n'y a pas de remise à zéro mensuelle.

Nommez les champs.
Lisez le fichier.

Collez une URL, décrivez ce que vous voulez en une phrase ou sous forme de schéma, et voyez ce qui revient. Vos 500 premières lignes sont gratuites.

Activation immédiate · sans carte

Transformer n'importe quelle page en les colonnes que vous avez demandées

La plupart des outils de scraping partent d'un site et vous tendent son schéma. Celui-ci part d'un schéma et vous laisse le pointer sur un site. Collez les URL de n'importe quelles pages, une par ligne, décrivez ce que vous voulez - en une phrase dans le champ Prompt, ou en un ensemble de champs dans le constructeur Schema - et chaque page est récupérée et lue par Claude, qui renvoie les champs que vous avez nommés. Il n'y a pas de parseur par site ici, donc pas de liste de sites pris en charge à laquelle vous mesurer.

Les deux façons de demander sont réellement deux outils. Un prompt est souple et rapide, et c'est ce qu'il vous faut tant que vous découvrez ce que porte une page. Un schéma fige la sortie : chaque champ a un nom et un type - String, Number, Boolean, Array ou Object - et peut être marqué requis, ce qui est la façon de garder la forme stable d'une exécution répétée à l'autre. Le constructeur et la vue JSON sont le même schéma sous deux formes : un schéma que vous avez déjà peut être collé, et celui que vous assemblez au clic peut être copié. Il vous en faut un des deux ; donner les deux indique simplement au modèle l'instruction et la forme.

Parce que c'est vous qui définissez les champs, le fichier n'a pas de liste de colonnes figée, et cette page n'a donc pas de dictionnaire de données. Les colonnes sont assemblées après l'exécution à partir des clés réellement revenues - query d'abord lorsqu'elle est présente, pour que chaque ligne enregistre l'URL qui l'a produite, puis tout le reste dans l'ordre d'apparition. Une clé interne position est exclue de cette liste : elle n'apparaît ni dans le tableau ni dans les téléchargements. Deux différences plus petites avec le reste de la plateforme méritent d'être connues : la limite compte des lignes par URL et non des pages, et elle est vide par défaut, c'est-à-dire toutes ; et les pages sont récupérées via le pool de proxies - une PROXY_URL ou une PROXY_LIST payante si elle est configurée, sinon le pool gratuit, et jamais votre propre adresse.

Une chose que cette page ne fait délibérément pas, c'est vous dire à quel point l'extraction est bonne. La qualité dépend de la page et de votre formulation, ce qui rend n'importe quel chiffre de précision trompeur dans les deux sens, et nous préférons le dire plutôt que publier un nombre que nous ne pouvons pas assumer. Le conseil honnête est le moins cher : lancez une seule page avec l'offre gratuite, lisez les colonnes obtenues, ajustez les noms de champ ou la phrase, et seulement ensuite pointez-le sur une liste. Vos 500 premières lignes ne coûtent rien et ne demandent pas de carte bancaire. Voir les tarifs pour les prix en vigueur.