Outil de capture de pages web

Une URL entre.
Une capture sort.

Soumettez une liste d'URL et recevez une image de chaque page - à la taille de fenêtre que vous choisissez ou sur toute la hauteur de défilement, en PNG, WebP, JPEG ou PDF. Sept colonnes par ligne, dont un lien vers le fichier. Lisez la note sur la colonne de statut avant d'automatiser quoi que ce soit dessus.

500 lignes offertes, une seule fois0,002 $ par ligne ensuitejusqu'à 1 000 URL par requêtePNG · WebP · JPEG · PDF
À lire en premier

« ok » veut dire capturée,
pas affichée.

Nous avons ouvert chaque image derrière cette page plutôt que de nous fier à la colonne qui dit que cela a marché. Cela s'est avéré déterminant.

Nous détenons trois exports réels couvrant quatre lignes et deux URL. status affiche ok sur les quatre, chaque fichier image existe, et chacun est un PNG valide aux 1200 × 800 exactement demandés. Sur ces seuls signaux, quatre sur quatre ressemblent à des réussites.

Deux ne le sont pas. Une fois ouvertes, les deux captures antérieures du même site sont des épaves sans styles - vignettes d'images cassées, bouton « Toggle Navigation » brut, graphique surdimensionné égaré - la page saisie avant l'arrivée de son CSS et de ses ressources. Les deux autres sont correctes : une page d'accueil complète et bien stylée, et une page de tarifs qui a exactement l'allure attendue. Même URL, même ok, résultat totalement différent.

L'indice bon marché est la taille du fichier. Les deux captures cassées pèsent environ 15 Ko chacune ; les deux bonnes, 182 Ko et 953 Ko. Une page stylée avec des images est tout simplement plus lourde qu'une page qui n'a pas su charger sa feuille de style. Si vous automatisez cela, fixez donc un seuil sur la taille en octets et vérifiez à la main les valeurs aberrantes - et ne traitez pas status comme une garantie d'affichage, car ce n'est pas ce qu'il affirme.

livescraper.app · ce qui est vérifié
3 exécutions, 4 lignes, 2 URL - tous les fichiers présents
Les quatre exactement en 1200 × 800, toutes PNG valides
status = ok sur 4 sur 4
2 sur 4 se sont affichées sans styles malgré le ok!
La taille du fichier est le signal de qualité exploitable!
Nous avons ouvert les images. Faites-en autant.
Comment ça marche

URL en entrée,
images en sortie.

Une URL est l'entrée. Trois réglages facultatifs décident de l'allure de l'image.

  1. ÉTAPE 1Connectez-vous à la plateforme.
  2. ÉTAPE 2Ouvrez le WebPage Screenshoter.
  3. ÉTAPE 3Collez vos URL, une par ligne.
  4. ÉTAPE 4Réglez la largeur et la hauteur de la fenêtre, ou demandez une capture pleine page.
  5. ÉTAPE 5Choisissez un format d'image, puis cliquez sur Get Data.

Les valeurs par défaut documentées sont 1200 de large sur 800 de haut - la taille utilisée par chaque capture derrière cette page. La capture pleine page remplace la hauteur. Le paramètre de format accepte WebP, PNG, JPEG et PDF, et vaut WebP par défaut.

Dictionnaire de données

Sept colonnes,
et ce que chacune contenait.

Mesuré sur 3 exports réels couvrant 4 lignes et 2 URL, avec les mêmes sept colonnes dans le même ordre à chaque fois. Les noms sont copiés caractère par caractère depuis la ligne d'en-tête.

url
La page capturée, reprise de votre entrée - https://outscraper.com, https://stripe.com/pricing. Notez que la référence appelle ce champ query ; l'export l'appelle url.
status
Si la capture s'est achevée - ok sur les quatre lignes que nous détenons. Cela rend compte de la capture, pas de l'affichage ; lisez la section ci-dessus avant de bâtir dessus.
format
Le format d'image produit - png sur chaque ligne ici. La référence liste WebP, PNG, JPEG et PDF, avec WebP comme valeur par défaut du paramètre : nos exécutions ont donc demandé PNG explicitement.
width
Largeur de la fenêtre en pixels - 1200 sur chaque ligne, conforme à la valeur par défaut documentée. Les fichiers livrés mesurent exactement 1200 pixels de large.
height
Hauteur de la fenêtre en pixels - 800 sur chaque ligne, là encore la valeur par défaut documentée, et là encore respectée exactement par les fichiers.
full_page
Si toute la hauteur de défilement a été capturée - false sur chaque ligne que nous détenons, d'où des images limitées à la partie visible. L'activer remplace height.
screenshot
Où se trouve l'image : un chemin de la forme /api/screenshoter/file/<run-id>/<n>.png, numéroté à partir de zéro au sein de l'exécution. Une exécution à deux URL a produit 0.png et 1.png sous le même identifiant d'exécution.

Chaque colonne a porté une valeur réelle sur chaque ligne, et chaque fichier référencé existait. Le schéma est stable - sept noms, même ordre, trois exécutions. Ce que le tableau ne peut pas vous dire, c'est si une image vaut quelque chose : les quatre nôtres étaient des PNG valides aux dimensions exactement demandées, et deux d'entre elles étaient des échecs sans styles. C'est une propriété de la capture d'écran plutôt que de cet export, et c'est pourquoi le conseil honnête est de fixer un seuil sur la taille de fichier et de regarder les valeurs aberrantes.

Avant de le brancher

Quatre notes pour qui
écrira l'importateur.

Chacune est issue de l'ouverture des fichiers réels plutôt que de la lecture de l'export, et c'est pour cela qu'elles méritent leur place.

Fixez le seuil sur la taille du fichier, pas sur status

Les deux captures cassées de notre lot pèsent environ 15 Ko ; les deux correctes, 182 Ko et 953 Ko. Une page ayant perdu sa feuille de style se compresse à presque rien : la taille en octets les sépare donc nettement là où status en est incapable. Choisissez un plancher adapté à vos cibles, signalez pour relecture tout ce qui passe en dessous, et relancez ces lignes plutôt que de les livrer.

La page s'affiche pour l'endroit d'où part la capture

Notre capture d'une page de tarifs est revenue en affichant les tarifs britanniques - pourcentages en pence, une ligne sur les cartes de l'UE - parce que le site a servi la version correspondant à la région d'où venait la requête. Tout ce qui varie géographiquement variera donc aussi dans vos captures : prix, devises, disponibilité, bandeaux de consentement et langue. Bon à savoir avant de les utiliser comme preuve de ce que voit un client ailleurs.

Le chemin de l'image est relatif et numéroté par exécution

screenshot contient un chemin, pas une URL absolue : /api/screenshoter/file/<run-id>/<n>.png. Le numéro repart à zéro à chaque exécution, si bien que 0.png n'est unique qu'associé à son identifiant d'exécution. Indexez votre stockage sur le couple, sinon une seconde exécution écrasera la première.

Ce sont des captures de la fenêtre, sauf demande contraire

full_page valait false sur chaque ligne que nous détenons : chaque image correspond donc aux 800 premiers pixels et non au document entier - notre capture de la page de tarifs s'arrête à mi-page. S'il vous faut l'article complet ou le pied de page, activez l'option pleine page, qui remplace la hauteur au lieu de s'y ajouter.

Flux de travail courants

Trois travaux que l'on
lance le plus souvent ici.

Partout où une page doit être conservée telle qu'elle apparaissait, et non telle qu'elle se lit.

Veille concurrentielle

Observer comment les rivaux se présentent

Les textes changent, les mises en page changent, les offres apparaissent et disparaissent. Capturer un ensemble de pages concurrentes à intervalles réguliers donne un comparatif visuel dans le temps qu'aucune extraction de texte ne fournit - et la page de tarifs photographiée le trimestre dernier est souvent la seule trace qu'elle a un jour dit ce qu'elle disait.

Marketing produit · Stratégie
Preuve de conformité

Conserver la preuve de ce qu'affichait une page

Allégations publicitaires, conditions, mentions obligatoires et prix promotionnels doivent tous être attestés tels qu'ils apparaissaient à une date. Une image horodatée est l'artefact que réclament réellement auditeurs et juristes, et une ligne par URL rend tout un parc simple à capturer.

Juridique · Conformité
Aperçus et QA

Générer des vignettes et repérer les pages cassées

Annuaires, tableaux de bord et cartes de liens veulent tous une image de la destination. La même exécution fait aussi office de test de fumée de votre propre parc - une page qui revient à 15 Ko quand ses voisines pèsent 400 Ko vous dit généralement que quelque chose est cassé.

Ingénierie · Ops de contenu
Tarifs

Ne payez que les lignes
que vous extrayez vraiment.

Pas d'abonnement, pas de minimum, pas de licence par utilisateur. Vos 500 premières lignes sont offertes - ensuite, paiement à l'usage.

Offre gratuite

500 lignes offertes - 0 $

Pour chaque nouveau compte, une seule fois. Sans carte bancaire. Dépensez-en quelques-unes sur des pages que vous connaissez bien et ouvrez les images - c'est le seul moyen d'apprendre ce que pèse une bonne capture pour vos cibles, et c'est précisément le nombre qu'utilisera votre contrôle qualité.

0 $ pour toujours
Paiement à l'usage

0,002 $ par ligne après l'offre gratuite

Environ 2 $ pour 1 000 pages, une ligne par URL - budget exact, puisqu'une page mal capturée renvoie tout de même exactement une ligne et est facturée comme n'importe quelle autre.

Le plus populaire
Enterprise

Sur mesure · captures planifiées

Tarifs au volume, SLA, workers dédiés et onboarding sur mesure pour les équipes qui capturent un grand ensemble de pages à intervalles réguliers. Donnez-nous vos chiffres et nous établirons un devis.

Parlons-en
10 % de remise sur votre première exécution payante.Utilisez le code LIVESCRAPER10 au paiement.
S'inscrire
Va bien avec

La même page,
en données.

Une capture conserve l'allure d'une page. Ces deux-là vous disent de quoi elle est faite et qui l'a enregistrée.

Le volet juridique

Une image d'une
page publique.

Plus léger que la plupart de ce catalogue, avec deux réserves qu'il vaut mieux énoncer que passer sous silence.

Une capture enregistre ce qu'une page web publique a montré à un visiteur ordinaire. C'est la même observation que fait n'importe quel navigateur, enregistrée au lieu d'être jetée, et c'est pourquoi capturer des pages publiques se situe à l'extrémité douce de ce que nous faisons. Rien ici ne se connecte, et rien ici ne contourne un péage.

Deux réserves. D'abord, une page peut contenir des données personnelles - une page équipe avec noms et photographies, un avis avec son auteur, une carte de profil - et une capture les saisit aussi fidèlement qu'une extraction de texte, tout en étant plus difficile à caviarder ensuite. Réfléchissez à ce qui entre dans le cadre avant d'archiver à grande échelle. Ensuite, l'image est la mise en page et le contenu protégés par le droit d'auteur d'autrui ; utiliser des captures en interne pour la veille, la QA ou la preuve est une pratique courante, les republier est une autre question qui dépend de votre juridiction et de votre finalité.

De notre côté : uniquement des pages publiquement disponibles, rien derrière une authentification, aucun traceur tiers sur la couche de données, et vos exports - fichiers images compris - s'auto-suppriment au bout de 30 jours.

livescraper.app · principes
Uniquement des pages publiquement disponibles
Rien derrière une authentification
Aucun traceur tiers sur la couche de données
Exports et images s'auto-suppriment (30 jours)
Une capture peut contenir des données personnelles - vérifiez ce qui est dans le cadre!
Ce qu'un visiteur aurait vu, enregistré.
Questions fréquentes

Ce que l'on demande
avant de s'inscrire.

Les questions qui reviennent le plus. Autre chose ? Parlez-nous - ce sont des humains, pas des bots, qui rédigent les réponses.

Un status « ok » signifie-t-il que la capture est bonne ?+
Non - cela signifie que la capture s'est achevée. Nous avons ouvert les quatre images derrière cette page : status affichait ok sur chacune, les quatre étaient des PNG valides à la taille exactement demandée, et deux d'entre elles étaient des épaves sans styles, saisies avant le chargement du CSS et des ressources de la page. Jugez la qualité à la taille du fichier et en regardant les valeurs aberrantes, pas à cette colonne.
Que revient-il exactement ?+
Sept colonnes : url, status, format, width, height, full_page et screenshot. La dernière est un chemin vers le fichier image lui-même, de la forme /api/screenshoter/file/<run-id>/<n>.png. Chaque colonne a porté une valeur réelle sur chaque ligne que nous détenons, et chaque fichier référencé existait.
Comment repérer automatiquement une mauvaise capture ?+
Par la taille du fichier. Dans notre lot, les deux captures cassées avoisinent 15 Ko tandis que les deux correctes pèsent 182 Ko et 953 Ko, parce qu'une page ayant perdu sa feuille de style se compresse à presque rien. Fixez un plancher adapté à vos cibles, signalez ce qui passe en dessous, et relancez ces lignes plutôt que de les livrer.
Quelle taille et quel format vais-je obtenir ?+
La fenêtre vaut par défaut 1200 sur 800 pixels, ce qu'a utilisé chaque capture derrière cette page, et les fichiers livrés mesuraient exactement cela. Le paramètre de format accepte WebP, PNG, JPEG et PDF et vaut WebP par défaut - nos exécutions ont demandé PNG explicitement. Activer l'option pleine page remplace la hauteur et capture toute la longueur de défilement.
La page aura-t-elle la même allure que chez moi ?+
Pas nécessairement. Notre capture d'une page de tarifs est revenue en affichant les tarifs britanniques, parce que le site sert la version correspondant à la région d'où part la requête. Prix, devises, disponibilité, langue et bandeaux de consentement peuvent tous différer de ce que vous voyez localement : traitez donc une capture comme ce qu'aurait vu un visiteur situé au lieu de capture.
Combien d'URL puis-je soumettre en une fois ?+
La référence documente un traitement par lots allant jusqu'à 1 000 URL par requête. Nos propres exécutions étaient modestes - quatre lignes sur trois exports - nous citons donc ce chiffre comme documenté et non comme quelque chose que nous aurions éprouvé à cette échelle.
Combien cela coûte-t-il ?+
Les 500 premières lignes d'un nouveau compte sont gratuites et offertes une seule fois ; ensuite c'est 0,002 $ par ligne - environ 2 $ pour 1 000 pages - au paiement à l'usage et sans abonnement. Une ligne par URL rend le budget exact, et une mauvaise capture est facturée comme n'importe quelle autre ligne, ce qui est une bonne raison de consacrer l'offre gratuite à apprendre ce que pèse un fichier sain. Les crédits n'expirent pas et il n'y a pas de remise à zéro mensuelle.

Capturez votre
liste de pages.

Collez vos URL et obtenez une image de chacune, à la taille et au format de votre choix. Vos 500 premières lignes sont gratuites - dépensez-en quelques-unes à ouvrir les fichiers, pour savoir ce que pèse une bonne capture avant d'automatiser le contrôle.

Activation immédiate · sans carte bancaire

WebPage Screenshoter - capturer des pages web en images à grande échelle

Certaines choses d'une page web ne peuvent pas être saisies sous forme de texte. Une mise en page, un bandeau promotionnel, l'agencement d'un tableau de tarifs, la manière dont une allégation était présentée un jour donné - ce sont des faits visuels, et l'artefact qui les conserve est une image. Ce service en produit une par URL : soumettez une liste de pages et chacune revient sous forme de ligne portant les réglages de capture et un lien vers le fichier. La fenêtre vaut par défaut 1200 sur 800 pixels, la capture pleine page est disponible et remplace la hauteur, et le format de sortie peut être WebP, PNG, JPEG ou PDF.

L'export porte sept colonnes, et derrière cette page se trouvent trois exécutions réelles couvrant quatre lignes et deux URL. Chaque colonne a porté une valeur réelle sur chaque ligne, les sept noms sont apparus dans le même ordre à chaque fois, et chaque image référencée par l'export existait bel et bien sur le disque aux dimensions exactement demandées. Le chemin de l'image est relatif et numéroté à partir de zéro au sein d'une exécution : un travail à deux URL a donc produit 0.png et 1.png sous un même identifiant d'exécution - ce qui signifie que le numéro de fichier n'est unique qu'associé à cet identifiant, et que le stockage doit être indexé sur le couple.

La chose la plus utile que cette page puisse vous dire est venue de l'ouverture des fichiers plutôt que de la lecture du tableur. La colonne de statut affichait ok sur les quatre lignes. Deux des quatre images sont correctes : une page d'accueil bien stylée et une page de tarifs à l'allure exactement attendue. Les deux autres, captures du même site prises plus tôt, sont des épaves sans styles - vignettes d'images cassées, bascule de navigation brute, graphique surdimensionné égaré - la page saisie avant l'arrivée de son CSS et de ses ressources. Même URL, même ok, résultat entièrement différent. Le statut rend donc compte de l'achèvement de la capture, pas de l'affichage de la page, et tout automatisme bâti dessus a besoin d'un second signal. La taille du fichier est le signal bon marché et efficace : les deux captures cassées pèsent environ 15 Ko chacune tandis que les bonnes pèsent 182 Ko et 953 Ko, parce qu'une page ayant perdu sa feuille de style se compresse à presque rien. Fixez un plancher, signalez ce qui passe en dessous, et relancez ces lignes. Une observation de plus à emporter dans tout travail de veille : la page de tarifs que nous avons capturée est revenue en affichant les tarifs britanniques, parce que les sites servent la version adaptée à la région d'où part une requête - prix, devises, disponibilité, langue et bandeaux de consentement suivront le lieu de capture et non le vôtre.

Les usages courants en découlent. La veille concurrentielle profite d'un enregistrement visuel que l'extraction de texte ne peut produire, et la capture prise le trimestre dernier est souvent la seule preuve qu'une page a un jour dit ce qu'elle disait. Les équipes juridiques et conformité ont besoin exactement de ce type de preuve datée pour les allégations publicitaires, les conditions et les prix promotionnels. Annuaires et tableaux de bord ont besoin de vignettes, et la même exécution fait office de test de fumée de votre propre parc. Sur le plan juridique, une capture enregistre ce qu'une page publique a montré à un visiteur ordinaire, et rien ici ne se connecte ni ne contourne un péage. Deux réserves méritent d'être dites clairement : une capture peut contenir des données personnelles, comme des noms et des photographies sur une page équipe, et elle est plus difficile à caviarder après coup que du texte ; et l'image est la mise en page protégée d'autrui, si bien que la veille interne, la QA et la preuve sont des pratiques courantes tandis que la republication est une question distincte. Uniquement des pages publiquement disponibles, aucun traceur tiers sur la couche de données, et les exports, fichiers images compris, s'auto-suppriment au bout de 30 jours. Vos 500 premières lignes sont gratuites et ne demandent pas de carte bancaire.