Extractor con IA

Describe los datos.
Recibe las columnas.

Pega URLs de cualquier página, una por línea, y después di qué quieres sacar de ellas: como una frase en la caja Prompt o como un esquema que construyes campo a campo. Claude lee cada página y devuelve lo que has pedido. Los campos que nombras son las columnas; no hay parser por sitio ni un conjunto fijo que sortear.

500 filas gratis, una sola vezdespués 0,002 $ por filatú defines las columnasCSV · JSON · Excel
Cómo funciona

Una lista de URLs
y una descripción.

Dos entradas obligatorias, y la segunda puedes darla en la forma que más te convenga.

  1. PASO 1Inicia sesión en la plataforma.
  2. PASO 2Abre el Extractor con IA.
  3. PASO 3Pega URLs de cualquier página, una por línea, o sube un archivo CSV, XLSX, TXT o Parquet.
  4. PASO 4Di qué quieres. O lo escribes en la caja Prompt - describe qué datos quieres extraer - o cambias a Schema y añades campos de uno en uno, cada uno con nombre, tipo y una marca opcional de obligatorio.
  5. PASO 5Fija un límite de filas por URL si quieres. Dejarlo vacío se lo lleva todo.
  6. PASO 6Pulsa Get Data y descarga en CSV, JSON o Excel.

Necesitas uno de los dos, no ambos: el formulario solo te detiene si el prompt está vacío y no se ha definido ningún campo de esquema. Si escribes los dos, le estás dando al modelo la instrucción y la forma.

Por qué lo usan los equipos

El esquema es
el entregable.

Escribe el campo, obtén la columna

Añade un campo llamado price y el archivo tendrá una columna llamada price. No hay paso de mapeo ni lista de sitios compatibles, porque aquí nada está escrito por sitio. Eso es lo que hace que valga la pena para las páginas que ningún extractor dedicado cubre: el catálogo de un proveedor, los avisos de un regulador, el changelog de un competidor.

Una frase, o un esquema con tipos

La caja Prompt acepta descripción en lenguaje llano y es la vía más rápida para probar algo. El constructor de Schema es el que usas cuando la salida tiene que ser predecible: cada campo lleva un tipo - String, Number, Boolean, Array u Object - y puede marcarse como obligatorio. Una pestaña JSON muestra el mismo esquema como JSON Schema, así que puedes pegar uno que ya tengas.

Tu entrada viaja con la salida

Cuando la exportación lleva una columna query se coloca la primera, así que cada fila dice qué URL la produjo y un archivo que cubre cincuenta páginas sigue siendo agrupable. Un detalle discreto que conviene saber: una clave interna position queda deliberadamente excluida de las columnas ensambladas, así que no aparece ni en la tabla ni en las descargas.

Qué recibes

No hay lista de columnas,
porque la escribes tú.

Todas las demás páginas de producto de aquí nombran un conjunto fijo de columnas. Esta no puede, y el motivo es estructural, no una omisión.

Los campos que describes son el archivo. Este servicio no tiene ningún array de columnas declarado en ninguna parte. La lista se ensambla después de la ejecución, a partir de las claves que realmente volvieron: query primero cuando está presente, y después cada clave restante en el orden en que se vio por primera vez. Pide sku, price e in_stock y esas serán tus columnas, en ese orden. Pide algo que la página no lleva y deberías esperar una celda vacía en vez de una invención, pero comprueba eso en tu propia primera ejecución en vez de creérselo a una página de marketing.

Prompt o esquema es una elección real, no dos palabras para lo mismo. Un prompt es más rápido y más indulgente, y es la herramienta adecuada mientras todavía estás averiguando qué contiene una página. Un esquema es lo que quieres en cuanto la salida alimenta algo aguas abajo: nombrar los campos y sus tipos es como evitas que la forma cambie entre una ejecución y la siguiente, y marcar un campo como obligatorio es como dices que importa. El constructor y la vista JSON son el mismo esquema, así que puedes empezar haciendo clic y terminar pegando.

Dos diferencias prácticas con el resto de la plataforma. Aquí el límite cuenta filas por URL en lugar de páginas, y viene vacío por defecto, lo que significa todas: lo contrario de una herramienta que se detiene tras una página salvo que le digas otra cosa. Y cada página se obtiene a través del pool de proxies en vez de desde tu propia dirección: si hay una PROXY_URL o PROXY_LIST de pago configurada la usa, si no, el pool gratuito, y en ninguno de los dos casos tu IP real.

Lo que esta página no te va a decir es lo bien que sale una extracción concreta. No tenemos ninguna exportación con datos de este servicio que describir, y la calidad aquí depende de la página a la que apuntes y de las palabras que elijas, así que no hay cifra de precisión, ni archivo de muestra, ni promesa sobre una celda determinada. Gasta unas filas gratis en una página, lee las columnas y después amplía la lista.

Flujos habituales

Tres tareas para las que
la gente recurre a esto.

Todas son páginas que ningún extractor dedicado cubre.

Cola larga

El sitio para el que nadie construyó un parser

La mayor parte del trabajo de scraping no es Amazon ni LinkedIn: es un distribuidor profesional, la lista de socios de una asociación sectorial, el registro de licencias de un ayuntamiento. Apunta esto a esas páginas, nombra los cuatro campos que de verdad necesitas y obtienes una tabla sin que nadie escriba un parser para un sitio que vas a usar dos veces.

Investigación · Operaciones
Prototipo

Trabajar el esquema antes de comprometerte con él

Empieza en la caja Prompt con un puñado de páginas, mira qué vuelve y luego pasa al constructor de Schema los campos que resultaron útiles y dales tipos. Ese camino -describir con soltura y luego fijarlo- es la razón de que existan las dos entradas.

Datos · Ingeniería
Monitorización

Sacar los mismos campos de páginas que no paran de cambiar

Una página de precios, una de términos, una de estado: la redacción se mueve, el marcado se mueve, y un extractor basado en selectores se rompe con ambos. Describir el campo en lugar de su posición es lo que sobrevive a un rediseño, lo que convierte esto en una opción razonable para algo que piensas repetir.

Competencia · Cumplimiento
Precios

Paga por fila,
por nada más.

Sin suscripción, sin mínimo, sin licencia por usuario. Tus primeras 500 filas corren de nuestra cuenta; a partir de ahí, pago por uso.

Plan gratuito

500 filas gratis - 0 $

Para cada cuenta nueva, una sola vez. Sin tarjeta de crédito. Todos los scrapers desbloqueados. En este servicio en particular es donde te toca empezar: no cuesta nada averiguar si tu prompt o tu esquema devuelve lo que querías decir.

0 $ para siempre
Pago por uso

0,002 $ por fila, tras el plan gratuito

Unos 2 $ por 1.000 filas, la misma tarifa plana que cualquier otro scraper de la plataforma: una extracción con IA no se factura distinto de una de esquema fijo. El límite cuenta filas por URL y por defecto son todas, así que conviene poner un número mientras todavía pruebas redacciones.

El más popular
Enterprise

A medida - muchos sitios, con calendario

Precios por volumen, SLAs, workers dedicados y onboarding a medida para equipos que ejecutan esto sobre una lista larga de fuentes en vez de un puñado de páginas. Dinos tus números y te preparamos una propuesta.

Habla con nosotros
10 % de descuento en tu primera ejecución de pago.Usa el código LIVESCRAPER10 al pagar.
Regístrate
Combina bien con

Cuando un esquema fijo
te serviría mejor.

Describir campos es la herramienta adecuada para páginas que nadie ha parseado. Donde existe un extractor dedicado, úsalo: las columnas ya se conocen.

La parte legal

¿Es legal
extraer con IA?

Respuesta corta: rigen las reglas que ya se aplicaban al scraping - que un modelo lea la página no cambia lo que puedes recopilar.

Recopilar información públicamente visible para investigación y análisis es una práctica asentada desde hace mucho, y eso es lo que ocurre aquí: la página se obtiene tal como la vería un visitante cualquiera y un modelo la lee. Mientras los datos sean de acceso público y el proceso no perturbe el servicio, no hay leyes federales que lo prohíban. Lo que el modelo no hace es colarte en ningún sitio: nada que esté tras un inicio de sesión, un muro de pago o un muro de consentimiento entra en el alcance.

Este servicio es más abierto que el resto de la plataforma, y eso pone la responsabilidad del alcance en quien escribe el prompt. Un esquema que pide nombres, correos o cualquier otra cosa que identifique a una persona significa que estás tratando datos personales, y el RGPD y regímenes similares te aplican sin importar de dónde los sacaste. Pide lo que tu finalidad realmente necesita; un campo que no puedes justificar es un riesgo, no un extra.

Los términos de cada sitio siguen aplicando, y varían: revísalos para las páginas que pienses ejecutar. No tocamos nada tras un inicio de sesión, leemos solo lo que ve cualquier visitante, no ejecutamos rastreadores de terceros en la capa de datos y tus exportaciones se autoeliminan a los 30 días.

livescraper.app · principios
Solo páginas públicas
Sin inicios de sesión, sin muros de pago
Tú eliges los campos: pide solo lo que puedas justificar!
Alineado con el RGPD por defecto
Las exportaciones se autoeliminan (30 días)
Obtenido a través del pool de proxies, nunca desde tu IP real.
Preguntas frecuentes

Lo que preguntan antes de registrarse.

Las preguntas que más oímos. ¿Algo más? Habla con nosotros: las respuestas las escriben personas, no bots.

¿Qué columnas contendrá la exportación?+
Las que hayas pedido. Este servicio no tiene ningún conjunto fijo de columnas en ninguna parte: la lista se ensambla tras la ejecución a partir de las claves que volvieron, con query en primer lugar cuando está presente y cada clave restante a continuación en el orden en que se vio por primera vez. Por eso esta página no tiene diccionario de datos: no hay nada fijo que tabular.
¿Escribo un prompt o construyo un esquema?+
Cualquiera de los dos, y necesitas uno. Un prompt es una frase que describe qué extraer y es la vía más rápida para probar algo. Un esquema es una lista de campos que añades de uno en uno, cada uno con nombre y tipo, opcionalmente marcado como obligatorio: úsalo cuando la salida tenga que mantener la misma forma entre ejecuciones. El formulario solo te detiene si el prompt está vacío y no se ha definido ningún campo de esquema.
¿Qué tipos de campo puede usar un esquema?+
Cinco: String, Number, Boolean, Array y Object. Cada campo tiene además un interruptor de obligatorio. Una pestaña JSON muestra lo mismo como JSON Schema, así que puedes pegar un esquema que ya tengas: necesita un objeto properties con al menos una entrada, y el JSON inválido se rechaza en vez de ignorarse en silencio.
¿Hay una lista de sitios compatibles?+
No, y ese es el sentido de este. Aquí nada está escrito por sitio, así que cualquier página que puedas abrir en un navegador es candidata. Donde un sitio sí tiene un extractor dedicado en esta plataforma, prefiérelo: esos devuelven un conjunto de columnas documentado en lugar de uno que tienes que describir.
¿Qué hace el campo de límite?+
Limita cuántas filas vuelven por URL, y viene vacío por defecto, lo que significa todas. Fíjate en que cuenta filas y no páginas: el límite del Universal AI Scraper cuenta páginas por consulta, así que los dos no son intercambiables.
¿En qué se diferencia del Universal AI Scraper?+
Entradas distintas y un límite distinto. Este toma un prompt en texto libre o un esquema con tipos y limita filas por URL. El Universal AI Scraper toma una lista de atributos que eliges o escribes, y limita páginas por consulta. Usa aquel cuando un puñado de nombres de atributo lo dice todo; usa este cuando quieras tipos, campos obligatorios o una frase.
¿Necesito un proxy?+
No tienes que configurar ninguno. Cada página se obtiene a través del pool de proxies: si hay una PROXY_URL o PROXY_LIST de pago configurada la usa, si no, el pool gratuito. En cualquier caso la petición no sale de tu IP real.
¿Cómo de precisa es la extracción?+
No publicamos una cifra, y preferimos explicar por qué antes que inventarla. La calidad depende de la página a la que apuntes y de cómo redactes el campo, así que un número único sería irrelevante para ambas cosas. El plan gratuito existe justo para esto: ejecuta una página, lee las columnas, ajusta la redacción y después amplía la lista.
¿Cuánto cuesta?+
Las primeras 500 filas de una cuenta nueva son gratis y de una sola vez; a partir de ahí son 0,002 $ por fila - unos 2 $ por 1.000 - de pago por uso y sin suscripción. Es la misma tarifa plana que cualquier otro scraper de aquí. Los créditos no caducan y no hay reinicio mensual.

Nombra los campos.
Lee el archivo.

Pega una URL, describe lo que quieres en una frase o como un esquema, y mira qué vuelve. Tus primeras 500 filas son gratis.

Se activa al instante · sin tarjeta

Convertir cualquier página en las columnas que pediste

La mayoría de las herramientas de scraping empiezan por un sitio y te entregan su esquema. Esta empieza por un esquema y te deja apuntarlo a un sitio. Pega URLs de cualquier página, una por línea, describe qué quieres -como una frase en la caja Prompt, o como un conjunto de campos en el constructor de Schema- y cada página se obtiene y la lee Claude, que devuelve los campos que nombraste. Aquí no hay parser por sitio, así que tampoco hay lista de sitios compatibles con la que compararte.

Las dos formas de pedir son herramientas genuinamente distintas. Un prompt es suelto y rápido, y es lo que quieres mientras todavía averiguas qué lleva una página. Un esquema fija la salida: cada campo tiene nombre y tipo - String, Number, Boolean, Array u Object - y puede marcarse como obligatorio, que es como mantienes la forma estable entre ejecuciones repetidas. El constructor y la vista JSON son el mismo esquema en dos formas, así que un esquema que ya tengas se puede pegar y uno que armes a clics se puede copiar. Necesitas uno de los dos; dar ambos simplemente le indica al modelo la instrucción y la forma.

Como tú defines los campos, el archivo no tiene lista fija de columnas, y por eso esta página no tiene diccionario de datos. Las columnas se ensamblan tras la ejecución a partir de las claves que realmente volvieron: query primero cuando está presente, para que cada fila registre qué URL la produjo, y después todo lo demás en el orden en que apareció. Una clave interna position queda excluida de esa lista, así que no aparece ni en la tabla ni en las descargas. Merece la pena conocer dos diferencias menores con el resto de la plataforma: el límite cuenta filas por URL en vez de páginas y viene vacío por defecto, es decir, todas; y las páginas se obtienen a través del pool de proxies - una PROXY_URL o PROXY_LIST de pago si hay una configurada, si no el pool gratuito, y nunca tu propia dirección.

Algo que esta página deliberadamente no hace es decirte cómo de buena es la extracción. La calidad depende de la página y de tu redacción, lo que vuelve engañosa en ambos sentidos cualquier cifra de precisión, y preferimos decir eso a publicar un número que no podemos sostener. El consejo honesto es el barato: ejecuta una sola página en el plan gratuito, lee las columnas que te devolvió, ajusta los nombres de campo o la frase, y solo entonces apúntalo a una lista. Tus primeras 500 filas no cuestan nada y no necesitan tarjeta. Consulta precios para las tarifas actuales.