AI スクレイパー

データを説明する。
列が返る

任意のページ URL を1行1件で貼り付け、そこから何が欲しいかを伝えてください - Prompt 欄に一文で書くか、項目ごとに組み立てるスキーマとして。Claude が各ページを読み、求めたものを返します。あなたが名付けた項目がそのまま列です。サイトごとのパーサーはなく、回避すべき固定の構成もありません。

初回500行は無料以降は1行0.002ドル列を決めるのはあなたCSV · JSON · Excel
使い方

URL のリストと
ひとつの説明

必須の入力はふたつ。2つ目は、あなたに合う形で与えられます。

  1. ステップ 1プラットフォームにログインします。
  2. ステップ 2AI スクレイパーを開きます。
  3. ステップ 3任意のページ URL を1行1件で貼り付けます - CSV、XLSX、TXT、Parquet ファイルのアップロードも可能です。
  4. ステップ 4何が欲しいかを伝えます。Prompt 欄に書く - 抽出したいデータを説明してください - か、Schema に切り替えて項目をひとつずつ追加します。各項目に名前、型、任意の必須フラグを付けられます。
  5. ステップ 5必要なら URL ごとの行数上限を設定します。空のままにすればすべて取得します。
  6. ステップ 6Get Data をクリックし、CSV、JSON、Excel でダウンロードします。

必要なのはどちらか一方で、両方ではありません。フォームが止めるのは、プロンプトが空でかつスキーマ項目がひとつも定義されていない場合だけです。両方書けば、モデルに指示と形の両方を渡すことになります。

チームが使う理由

スキーマこそが
成果物です

項目を入力すれば、その列が返る

price という項目を追加すれば、ファイルには price という列ができます。マッピングの工程も対応サイト一覧もありません。ここでは何ひとつサイトごとに書かれていないからです。だからこそ、専用スクレイパーがカバーしないページ - 仕入先のカタログ、規制当局の告示、競合のチェンジログ - に手を伸ばす価値があります。

一文、あるいは型付きスキーマ

Prompt 欄は平易な説明を受け取り、何かを試すには最も速い方法です。Schema ビルダーは、出力が予測可能でなければならないときに使うものです。各項目は型 - StringNumberBooleanArrayObject - を持ち、必須として指定できます。JSON タブは同じスキーマを JSON Schema として表示するので、既存のものを貼り付けられます。

入力は出力とともに運ばれます

エクスポートに query 列がある場合は先頭に置かれるので、各行がどの URL から生まれたかを語り、50ページにまたがるファイルでもグループ化できます。知っておくとよい静かな細部がひとつ。内部キーの position は組み立てられた列から意図的に除かれており、表にもダウンロードにも現れません。

返ってくるもの

列リストは存在しません。
書くのはあなただからです

ここにある他のすべての製品ページは固定の列の集合を挙げています。このページにはそれができません。理由は抜け落ちではなく、構造的なものです。

あなたが説明した項目がファイルです。 このサービスには、宣言された列の配列がどこにもありません。列のリストは実行後に、実際に返ってきたキーから組み立てられます。query があれば最初に、続いて他のキーが最初に現れた順に並びます。skupricein_stock を求めれば、その順でそれがあなたの列になります。ページが持っていないものを求めた場合は、捏造ではなく空のセルを期待すべきです - ただしそれはマーケティングページを信じるのではなく、ご自身の初回実行で確かめてください。

プロンプトかスキーマかは、同じことの言い換えではなく本当の選択です。 プロンプトは速く寛容で、そのページに何が載っているのかをまだ探っている段階に向いた道具です。スキーマは、出力が下流の何かを支えるようになった瞬間に欲しくなるものです。項目と型に名前を与えることが、実行ごとに形がずれるのを防ぐ方法であり、必須と印を付けることが、それが重要だと述べる方法です。ビルダーと JSON ビューは同じスキーマなので、クリックで始めて貼り付けで終えることもできます。

プラットフォームの他と違う実務的な点がふたつ。 ここでの上限はページ数ではなく URL ごとの行数 を数え、既定は空、つまりすべてです - 何も言わなければ1ページで止まる道具とは正反対です。そして各ページはあなた自身のアドレスからではなくプロキシプールを通じて取得されます。有料の PROXY_URL または PROXY_LIST が設定されていればそれを、なければ無料プールを使い、どちらの場合もあなたの実 IP は使いません。

このページがお伝えしないことは、個々の抽出がどれほどうまくいくかです。このサービスの値の入ったエクスポートは手元になく、ここでの品質はどのページに向けるかと、どんな言葉を選ぶかに左右されます。ですから精度の数字も、サンプルファイルも、特定のセルについての約束もありません。無料枠の数行を1ページに使い、列を読み、それからリストを広げてください。

よくある使い方

人々がここに来る
3つの仕事。

どれも専用スクレイパーがカバーしないページです。

ロングテール

誰もパーサーを書かなかったサイト

スクレイピングの仕事の大半は Amazon でも LinkedIn でもありません。業務用の卸売業者、業界団体の会員一覧、自治体の許認可台帳です。そうしたページにこれを向け、本当に必要な4項目を名付ければ、2回しか使わないサイトのために誰かがパーサーを書かなくても表が手に入ります。

リサーチ · オペレーション
プロトタイプ

確定させる前にスキーマを練る

まず Prompt 欄で数ページ試し、何が返るかを見て、役に立つと分かった項目を Schema ビルダーに移して型を与えます。ゆるく説明してから固める - この道筋のために、入力が2種類あります。

データ · エンジニアリング
モニタリング

変わり続けるページから同じ項目を取り出す

料金ページ、規約ページ、ステータスページ。文言も動けばマークアップも動き、セレクタ頼みのスクレイパーはその両方で壊れます。位置ではなく項目そのものを説明することがリニューアルを生き延びる方法であり、繰り返し実行するつもりのものにこれが妥当な選択となる理由です。

競合 · コンプライアンス
料金

行の分だけ、
それ以外は無料

サブスクリプションなし、最低利用額なし、ユーザー単位のライセンスなし。最初の500行は当社負担です。以降は従量課金。

無料枠

500行無料 - 0ドル

新規アカウントごとに一度きり。クレジットカード不要。すべてのスクレイパーが解放されます。とりわけこのサービスでは、まずここから始めるべきです。あなたのプロンプトやスキーマが意図したものを返すかどうかを確かめるのに、費用はかかりません。

ずっと0ドル
従量課金

無料枠のあとは1行0.002ドル

1,000行でおよそ2ドル。プラットフォーム上の他のスクレイパーと同じ一律料金です - AI による抽出だからといって課金が変わることはありません。上限は URL ごとの行数を数え、既定はすべてなので、表現を試している段階では数値を入れておく価値があります。

いちばん人気
エンタープライズ

カスタム - 多数のサイトを定期実行で

数ページではなく長い情報源リストに対してこれを走らせるチーム向けに、ボリューム料金、SLA、専用ワーカー、個別のオンボーディングをご用意します。数量をお知らせいただければ見積もりをお出しします。

お問い合わせ
初回の有料実行が10%オフ。チェックアウトでコード LIVESCRAPER10 をご利用ください。
登録する
組み合わせて使う

固定スキーマのほうが
役に立つとき

項目を説明するのは、誰もパースしていないページに向いた道具です。専用スクレイパーがあるなら、そちらを使ってください - 列はすでに分かっています。

法的な話

AI で抽出するのは
合法ですか?

短い答え: もともとスクレイピングに適用されていた規則がそのまま当てはまります。モデルがページを読むからといって、収集してよいものが変わるわけではありません。

公開されている情報を調査や分析のために収集することは長く確立された実務であり、ここで起きているのもそれです。ページは通常の訪問者が見るとおりに取得され、モデルがそれを読みます。データが公開アクセス可能で、処理がサービスに損害を与えない限り、これを禁じる連邦法はありません。モデルが行わないのは、何かを突破することです。ログイン、ペイウォール、同意ウォールの背後にあるものは対象外です。

このサービスはプラットフォームの他のものより開かれており、そのぶん範囲の責任はプロンプトを書く人にあります。氏名やメールアドレス、その他個人を特定しうるものを求めるスキーマは、あなたが個人データを取り扱うことを意味し、どこから得たかにかかわらず GDPR や同種の規制が適用されます。目的が実際に必要とするものを求めてください。正当化できない項目は、おまけではなくリスクです。

各サイトの利用規約は引き続き適用され、内容はさまざまです。実行するつもりのページについて確認してください。当社はログインの背後にあるものには一切触れず、通常の訪問者が見るものだけを読み、データ層でサードパーティのトラッカーを動かさず、エクスポートは30日後に自動削除されます。

livescraper.app · 原則
公開されているページのみ
ログインなし、ペイウォールなし
項目を選ぶのはあなた - 正当化できるものだけを求めてください!
既定で GDPR に準拠
エクスポートは自動削除(30日)
プロキシプール経由で取得。あなたの実 IP は使いません。
よくある質問

登録前に寄せられる質問。

いちばん多い質問です。ほかにありますか? お問い合わせください - 回答を書くのはボットではなく人間です。

エクスポートにはどの列が含まれますか?+
あなたが求めたものです。このサービスにはどこにも固定の列構成がありません。リストは実行後に、返ってきたキーから組み立てられ、query があればそれが先頭、続いて他のキーが最初に現れた順に並びます。だからこのページにはデータ辞書がありません。表にすべき固定のものが存在しないからです。
プロンプトを書くのですか、スキーマを組むのですか?+
どちらでもよく、どちらか一方は必要です。プロンプトは何を抽出するかを述べる一文で、何かを試すには最速です。スキーマはひとつずつ追加する項目のリストで、各項目に名前と型があり、任意で必須と印を付けられます。出力が実行をまたいで同じ形を保つ必要があるときに使ってください。フォームが止めるのは、プロンプトが空でスキーマ項目もひとつも定義されていない場合だけです。
スキーマではどの項目型が使えますか?+
5つです。String、Number、Boolean、Array、Object。各項目には必須の切り替えもあります。JSON タブが同じものを JSON Schema として表示するので、既存のスキーマを貼り付けられます - 少なくとも1件の properties オブジェクトが必要で、無効な JSON は黙って無視されるのではなく拒否されます。
対応サイトの一覧はありますか?+
ありません。そしてそれこそがこのサービスの要点です。ここでは何ひとつサイトごとに書かれていないので、ブラウザで開けるページはすべて候補です。そのサイトにこのプラットフォームの専用スクレイパーがある場合はそちらを優先してください - そちらは、あなたが説明しなければならない列ではなく、文書化された列の集合を返します。
上限の欄は何をしますか?+
URL ごとに返る行数を制限します。既定は空で、それはすべてを意味します。ページ数ではなく行数を数える点にご注意ください - Universal AI Scraper の上限はクエリごとのページ数を数えるので、両者は入れ替えられません。
Universal AI Scraper とはどう違いますか?+
入力が違い、上限も違います。こちらは自由記述のプロンプトか型付きスキーマを受け取り、URL ごとの行数を制限します。Universal AI Scraper は選ぶか入力する属性のリストを受け取り、クエリごとのページ数を制限します。属性名がいくつかあれば足りるときはあちらを、型や必須項目、あるいは一文で伝えたいときはこちらを使ってください。
プロキシは必要ですか?+
ご自身で用意する必要はありません。各ページはプロキシプール経由で取得されます。有料の PROXY_URL または PROXY_LIST が設定されていればそれを、なければ無料プールを使います。いずれの場合もリクエストはあなたの実 IP から出ません。
抽出の精度はどれくらいですか?+
数字は公表しておらず、でっち上げるより理由を説明することを選びます。品質はどのページに向けるかと、項目をどう書くかに左右されるため、単一の数字はそのどちらにとっても無意味になります。無料枠はまさにこのためにあります - 1ページ走らせ、列を読み、表現を調整し、それからリストを広げてください。
料金はいくらですか?+
新規アカウントの最初の500行は無料で、一度きりです。以降は1行0.002ドル - 1,000行でおよそ2ドル - の従量課金で、サブスクリプションはありません。ここにある他のスクレイパーと同じ一律料金です。クレジットは失効せず、月次のリセットもありません。

項目を名付ける。
ファイルを読む

URL をひとつ貼り付け、欲しいものを一文かスキーマで説明し、何が返るかを見てください。最初の500行は無料です。

即時有効 · カード不要

任意のページを、求めた列に変える

たいていのスクレイピングツールはサイトから始まり、そのスキーマをあなたに手渡します。これはスキーマから始まり、それをサイトに向けさせます。任意のページ URL を1行1件で貼り付け、欲しいものを説明してください - Prompt 欄に一文で、あるいは Schema ビルダーで項目の集合として。各ページが取得され Claude が読み、あなたが名付けた項目を返します。ここにはサイトごとのパーサーがないので、自分を照らし合わせるべき対応サイト一覧もありません。

2つの尋ね方は、本当に別の道具です。プロンプトはゆるく速く、そのページに何が載っているのかをまだ探っている段階に向いています。スキーマは出力を固定します。各項目に名前と型 - StringNumberBooleanArrayObject - があり、必須と印を付けられ、それが繰り返しの実行を通じて形を安定させる方法です。ビルダーと JSON ビューは同じスキーマの2つの姿なので、既存のスキーマは貼り付けられ、クリックで組んだものは書き出せます。必要なのはどちらか一方で、両方与えることは、モデルに指示と形の両方を伝えるだけです。

項目を定義するのがあなたである以上、ファイルに固定の列リストはなく、このページにデータ辞書がないのもそのためです。列は実行後に、実際に返ってきたキーから組み立てられます - query があれば先頭に置かれ、各行がどの URL から生まれたかを記録し、続いて残りが現れた順に並びます。内部キーの position はそのリストから除かれるため、表にもダウンロードにも現れません。プラットフォームの他との小さな違いが2つ、知っておく価値があります。上限はページ数ではなく URL ごとの行数を数え、既定は空、つまりすべてであること。そしてページはプロキシプール経由で取得されること - 有料の PROXY_URLPROXY_LIST が設定されていればそれを、なければ無料プールを使い、あなた自身のアドレスは決して使いません。

このページが意図的にしないことがひとつあります。抽出がどれほど良いかを述べることです。品質はページとあなたの表現に左右され、そのためどんな精度の数字も両方向に誤解を招きます。責任を持てない数字を出すより、そう述べるほうを選びます。誠実な助言は安上がりです。無料枠で1ページだけ走らせ、返ってきた列を読み、項目名か一文を調整し、それからリストに向けてください。最初の500行は無料で、クレジットカードも不要です。現在の料金は料金ページをご覧ください。