ジェミニスクレイパーAPI: Googleジェミニの回答をデータとしてキャプチャする
Web Data Collection Specialist
TL;DR:
- Gemini Scraperは、Google Geminiの回答を構造化データとしてキャプチャします。
scraper.geminiにプロンプトを送信し、回答テキストとそれに基づく引用を受け取ります。 - これは2回の非同期フローです。 プロンプトをPOSTしてタスクを作成し、その後
task_idで結果をGETします — ライブ実行では約12秒で回答が返ってきました。 - 引用は構造化され、HTMLからスクレイピングされません。 各引用には
title、url、website_name、snippet、favicon、およびGeminiが使用した強調表示されたパッセージが含まれます。 - 国コードでローカライズします。
countryフィールドは地域に合わせて回答を形成します。ユーザーがそこで見るのと同じように。 - これがAI回答におけるブランドの可視性を監視する方法です。 顧客が尋ねる質問をGeminiに聞いて、どのソースが引用されているかを読み取ります。
- 無料で始められます。 新しいScrapelessアカウントには無料のScraper API使用が含まれています — app.scrapeless.comでサインアップしてください。
はじめに: Geminiが実際に回答する内容を確認する
AI回答エンジンは、ユーザーとオープンウェブの間に位置しています。誰かがGoogle Geminiに「最高のプロキシサービス」や「ニューヨークでやるべきこと」と尋ねると、その回答と引用元は、ユーザーが何かをクリックする前に彼らが信じることを形成します。ブランド監視、競合リサーチ、回答エンジンの最適化において、もはや「Googleではどの順位にいるか」という質問ではなく、「Geminiは何と言い、誰を引用するか」という質問になります。
Scrapeless Gemini Scraperは、それをプログラム的に回答します。scraper.geminiアクターにプロンプトを送信し、回答テキストとその背後の構造化された引用を受け取ります。このガイドでは、リクエストの形、最初のcurl、レスポンススキーマ、Python統合、およびその使用方法について説明します — 以下のすべてのリクエストとレスポンスは、ライブAPIに対してキャプチャされました。
何ができるか
- Geminiの回答テキストをキャプチャする — CommonMarkスタイルのMarkdownとして、保存または分析の準備が整ったフルレスポンス。
- 引用を読む — Geminiがその回答の基にしたソース、それぞれにタイトル、URL、および使用された節が含まれています。
- AI回答におけるブランドの言及を追跡する — 購入者が尋ねる質問をして、あなたが出現するかどうかを確認します。
- 地域によるローカライズ —
countryを設定して、その市場のユーザーが見る回答を確認します。 - 監視パイプラインへの供給 — 同じプロンプトをスケジュールで実行し、時間の経過に伴うソースの差異を確認します。
Scrapeless Gemini Scraperの理由
Gemini Scraperは、AIエンジンの回答をデータとして読み取るための管理された方法であるScrapeless LLM Chat Scraperラインの一部です。特にGeminiの場合、次のことを提供します。
- 単一リクエスト契約 — プロンプトを送信し、回答とその引用を取得します。ブラウザを操作する必要はありません。
- 構造化された引用 — ソースはフィールドとして戻ってきて、解析する必要のあるマークアップではありません。
- 195カ国以上の住宅用プロキシ — 回答は、クリーンで地域に適した出口を通じて取得されます。
- 国によるローカライズ — 1つのフィールドが市場に合わせて回答を形成します。
app.scrapeless.comの無料プランでAPIキーを取得しましょう。
前提条件
- ScrapelessアカウントとAPIキー — app.scrapeless.comでサインアップ
- 最初のリクエストに
curl、統合にはPython 3.10以上が必要 - HTTPおよびJSONの基本的な知識
Gemini Scraperの動作
フローは2回の呼び出しです:タスクを作成し、その結果を取得します。
リクエストパラメータ
| フィールド | 場所 | 意味 |
|---|---|---|
actor |
トップレベル | scraper.gemini |
input.prompt |
入力 | Geminiに尋ねる質問 |
input.country |
入力 | 回答をローカライズするためのISO国コード |
認証は両方の呼び出しでx-api-tokenヘッダーです。
curlによるクイックキャプチャ
タスクを作成します:
bash
curl -X POST https://api.scrapeless.com/api/v2/scraper/request \
-H "x-api-token: ${SCRAPELESS_API_KEY}" \
-H "Content-Type: application/json" \
-d '{
"actor": "scraper.gemini",
"input": { "prompt": "Recommended attractions in New York", "country": "US" }
}'
# { "status": "pending", "task_id": "3886db31-…" }
次に、task_idで結果を取得します:
bash
curl -X GET https://api.scrapeless.com/api/v2/scraper/result/{task_id} \
-H "x-api-token: ${SCRAPELESS_API_KEY}"
レスポンスエンベロープ
statusがsuccessになると、回答と引用はtask_resultにあります:
json
// 記述サンプル — フィールドの形状は正確(ライブキャプチャ);値は省略
{
"status": "success",
"task_result": {
"prompt": "Recommended attractions in New York",
"result_text": "New York City is a beautiful chaos of culture, history…",
"citations": [
{
"title": "20 Best Things to Do in NYC",
"url": "https://example.com/nyc",
"website_name": "Example Travel",
"snippet": "From the Statue of Liberty to…",
"favicon": "https://example.com/favicon.ico",
"highlights": ["Statue of Liberty", "Central Park"]
}
]
}
}
}
ライブ実行では、12秒ほどで15件の引用が返され、各引用は上記の6つのフィールドを持っていました。
---
## PythonでAPIを統合する
タスクを作成し、完了するまでポーリングして答えを読み取ります:
```python
import os
import time
import requests
API_KEY = os.environ["SCRAPELESS_API_KEY"]
BASE = "https://api.scrapeless.com"
HEADERS = {"x-api-token": API_KEY, "Content-Type": "application/json"}
def ask_gemini(prompt: str, country: str = "US") -> dict:
created = requests.post(
f"{BASE}/api/v2/scraper/request",
headers=HEADERS,
json={"actor": "scraper.gemini", "input": {"prompt": prompt, "country": country}},
timeout=60,
)
task_id = created.json()["task_id"]
for _ in range(30):
time.sleep(3)
got = requests.get(f"{BASE}/api/v2/scraper/result/{task_id}", headers=HEADERS, timeout=60)
data = got.json()
if data.get("status") in ("success", "failed"):
return data
raise TimeoutError("結果が時間内に準備できませんでした")
result = ask_gemini("ニューヨークのおすすめ観光地")
answer = result["task_result"]
print(answer["result_text"])
for c in answer["citations"]:
print("-", c["website_name"], c["url"])
無料プランでAPIキーを取得: app.scrapeless.com
一般的な問題を避ける方法
- 存在しないフィールドはnullであり、エラーではありません。 すべての答えが
highlightsやfaviconを持っているわけではありません。各引用フィールドはオプションとして扱い、その不在に対してガードしてください。 - 結果を迅速に取得します。 結果は
task_idで取得されます。タスクを作成した後すぐにポーリングし、長時間後ではなく、短いポーリング間隔を好みます。 - 調査している市場に国を固定します。
countryフィールドは答えを変えます。監視実行ごとに固定して、結果が時間を通じて比較可能であるようにしてください。 - 実行ごとに答えが異なります。 Geminiの文言は実行ごとに変わるので、引用のソースを時間を通じて比較し、正確な文体ではなく、応答エンジンがどのようにページを表示するかは、Google自身のウェブ向けAI機能ガイダンスで説明されており、呼び出しているHTTP契約はHTTP意味仕様に従っています。
結論:あなたのブランドがGeminiにどう見えるか
Gemini ScraperはAIの回答を追跡可能なデータに変えます:応答テキストとその背後にある正確なソースを、1つの2回の呼び出しの流れで取得します。顧客が求めるプロンプトを実行し、引用を保存し、Geminiの回答での可視性が時間を通じてどのように変化するかを見守ってください。他のエンジンと組み合わせたUniversal Scraping APIラインを確認し、なぜ回答エンジンが検索を変えたのかを読んで、ドキュメントはすべてのフィールドをカバーしています。
AI駆動のデータパイプラインを構築する準備はできましたか?
私たちのコミュニティに参加して無料プランを取得し、AI回答を監視する開発者とつながりましょう:Discord · Telegram。
app.scrapeless.comで無料のScraper APIを使用するためにサインアップし、スケールのための価格を確認してください。
FAQ
Q: Gemini Scraperは何を返しますか?
Markdown形式の応答テキスト(result_text)とcitations配列。各引用にはtitle、url、website_name、snippet、favicon、Geminiが使用したhighlightsが含まれています。ライブ実行では、1つのプロンプトが15の引用を返しました。
Q: 同期ですか?
いいえ。プロンプトをPOSTしてタスクを作成し、task_idで結果をGETします。ライブ実行では、回答は約12秒で準備が整いました。
Q: 回答をローカライズできますか?
はい。input.countryをISOコードに設定してください。回答はその市場に合わせて形作られるため、時間を通じて結果を比較する際には固定してください。
Q: 実行ごとに回答が変わるのはなぜですか?
生成された回答は実行ごとに文言が異なります。監視目的では、引用のソースとブランドが表示されるかどうかを追跡し、正確な文体ではなく、注意してください。
Q: プロキシが必要ですか?
いいえ。エグレスは住宅IPを介してアクター内部で処理され、プロンプトと国だけを送信します。
Scrapelessでは、適用される法律、規制、およびWebサイトのプライバシーポリシーを厳密に遵守しながら、公開されているデータのみにアクセスします。 このブログのコンテンツは、デモンストレーションのみを目的としており、違法または侵害の活動は含まれません。 このブログまたはサードパーティのリンクからの情報の使用に対するすべての責任を保証せず、放棄します。 スクレイピング活動に従事する前に、法律顧問に相談し、ターゲットウェブサイトの利用規約を確認するか、必要な許可を取得してください。



