双子座爬虫API:将Google Gemini答案捕获为数据
Web Data Collection Specialist
TL;DR:
- Gemini Scraper 捕获 Google Gemini 的答案作为结构化数据。 发送提示到
scraper.gemini;返回答案文本以及 Gemini 引用的来源。 - 这是一个两次调用的异步流程。 先 POST 提示以创建任务,然后通过
task_idGET 结果——在实时运行中,答案大约在 12 秒内返回。 - 引用以结构化形式返回,而不是从 HTML 中抓取。 每个引用包含
title、url、website_name、snippet、favicon和 Gemini 使用的高亮段落。 - 使用国家代码进行本地化。
country字段使答案适应该地区,就像那里的用户看到的一样。 - 这就是您监控品牌在 AI 答案中曝光度的方法。 向 Gemini 提问您的客户所问的问题,并查看它引用的来源。
- 免费开始。 新的 Scrapeless 账户包括免费 Scraper API 使用——可在 app.scrapeless.com 注册。
引言:了解 Gemini 实际回答的内容
AI 回答引擎现在处于用户与开放网络之间。当有人向 Google Gemini 询问“最佳代理服务”或“纽约的活动时”,答案——以及它引用的来源——在用户点击任何内容之前塑造了他们的看法。对于品牌监控、竞争研究和答案引擎优化,问题已不再是“我在 Google 上的排名如何”,而是“Gemini 说了什么,它引用了谁”。
Scrapeless Gemini Scraper 程序性地回答这个问题。您向 scraper.gemini 发出提示,并获得答案文本及其背后的结构化引用。本指南涵盖请求格式、第一次的 curl、响应模式、Python 集成以及如何使用它——下面的每个请求和响应都是在实时 API 下捕获的。
您可以用它做什么
- 捕获 Gemini 的答案文本——完整响应以 CommonMark 样式 Markdown 的形式,便于存储或分析。
- 阅读引用——Gemini 依据其回答的来源,每个引用都有标题、URL 和使用的段落。
- 跟踪 AI 答案中的品牌提及——提出您的买家所问的问题,查看您是否出现在回答中。
- 按地区本地化——设置
country,以查看用户在该市场将如何看到答案。 - 为监控管道提供数据——定期以相同的提示运行,并随时间比较来源的变化。
为什么选择 Scrapeless Gemini Scraper
Gemini Scraper 是 Scrapeless LLM Chat Scraper 系列的一部分,是以数据形式读取 AI 引擎答案的管理方式。具体来说,它提供:
- 单一请求契约——发送提示,获取答案及其引用;无需驱动浏览器。
- 结构化引用——来源作为字段返回,而不是需要解析的标记。
- 覆盖 195 个国家的住宅代理——通过干净、适合地区的出口获取答案。
- 按国家本地化——一个字段使答案适应该市场。
在 app.scrapeless.com 的免费计划中获取您的 API 密钥。
先决条件
- 一个 Scrapeless 账户和 API 密钥——请在 app.scrapeless.com 注册
- 第一次请求需要
curl,集成需 Python 3.10+ - 基本熟悉 HTTP 和 JSON
Gemini Scraper 的工作原理
该流程包括两个调用:创建任务,然后获取结果。
请求参数
| 字段 | 位置 | 意义 |
|---|---|---|
actor |
顶层 | scraper.gemini |
input.prompt |
输入 | 向 Gemini 提问 |
input.country |
输入 | 用于本地化答案的 ISO 国家代码 |
授权是在两个调用中的 x-api-token 头。
使用 curl 快速捕获
创建任务:
bash
curl -X POST https://api.scrapeless.com/api/v2/scraper/request \
-H "x-api-token: ${SCRAPELESS_API_KEY}" \
-H "Content-Type: application/json" \
-d '{
"actor": "scraper.gemini",
"input": { "prompt": "Recommended attractions in New York", "country": "US" }
}'
# { "status": "pending", "task_id": "3886db31-…" }
然后通过 task_id 获取结果:
bash
curl -X GET https://api.scrapeless.com/api/v2/scraper/result/{task_id} \
-H "x-api-token: ${SCRAPELESS_API_KEY}"
响应封装
一旦 status 为 success,答案和引用在 task_result 中:
json
// 示范样本—字段形状准确(实时捕获);值已简化
{
"status": "success",
"task_result": {
"prompt": "Recommended attractions in New York",
"result_text": "New York City is a beautiful chaos of culture, history…",
"citations": [
{
"title": "20 Best Things to Do in NYC",
"url": "https://example.com/nyc",
"website_name": "Example Travel",
"snippet": "From the Statue of Liberty to…",
"favicon": "https://example.com/favicon.ico",
"highlights": ["Statue of Liberty", "Central Park"]
}
]
}
}
在一次实时运行中,这个结果大约在12秒内返回,包含15个引用,每个引用都携带上述六个字段。
在Python中集成API
创建任务,轮询直到完成,并读取答案:
python
import os
import time
import requests
API_KEY = os.environ["SCRAPELESS_API_KEY"]
BASE = "https://api.scrapeless.com"
HEADERS = {"x-api-token": API_KEY, "Content-Type": "application/json"}
def ask_gemini(prompt: str, country: str = "US") -> dict:
created = requests.post(
f"{BASE}/api/v2/scraper/request",
headers=HEADERS,
json={"actor": "scraper.gemini", "input": {"prompt": prompt, "country": country}},
timeout=60,
)
task_id = created.json()["task_id"]
for _ in range(30):
time.sleep(3)
got = requests.get(f"{BASE}/api/v2/scraper/result/{task_id}", headers=HEADERS, timeout=60)
data = got.json()
if data.get("status") in ("success", "failed"):
return data
raise TimeoutError("未能及时准备好结果")
result = ask_gemini("纽约推荐的景点")
answer = result["task_result"]
print(answer["result_text"])
for c in answer["citations"]:
print("-", c["website_name"], c["url"])
在免费计划上获取您的API密钥:app.scrapeless.com
如何避免常见问题
- 缺失的字段是null,而不是错误。 不是每个答案都携带
highlights或favicon,将每个引用字段视为可选,并对其缺失进行防护。 - 及时获取结果。 结果是通过
task_id检索的;在创建任务后不久进行轮询,而不是很久之后,并且更倾向于使用短轮询间隔,而不是晚些时候读取。 - 将国家固定在您研究的市场上。
country字段会改变答案;在监测运行中保持不变,以便结果可以随时间进行比较。 - 答案在不同运行之间有所变化。 Gemini的措辞因运行而异,因此随着时间的推移,比较引用的来源而不是精确的措辞——答案引擎展示页面的方式在Google自己关于网络的AI特性的指导中进行了描述,而您调用的HTTP合同遵循HTTP语义规范。
结论:Gemini眼中的您的品牌
Gemini Scraper将AI答案转化为您可以跟踪的数据:响应文本及其背后的确切来源,通过一次两次调用的流程完成。运行客户询问的提示,存储引用,并观察您在Gemini答案中的可见度随时间的变化。将其与通用抓取API行中的其他引擎结合,了解为什么答案引擎改变了搜索,文档涵盖每个字段。
准备好构建您的AI驱动数据管道了吗?
加入我们的社区,领取免费计划,并与监测AI答案的开发者联系:Discord · Telegram。
在app.scrapeless.com注册以免费使用抓取API,查看规模的定价。
常见问题解答
问:Gemini Scraper返回什么?
答案文本作为Markdown(result_text)以及一个citations数组——每个引用都有title、url、website_name、snippet、favicon和Gemini使用的highlights。在一次实时运行中,一个提示返回了15个引用。
问:这是同步的吗?
不是。您POST提示以创建任务,然后通过task_id获取结果。在一次实时运行中,答案大约在12秒内准备好。
问:我可以本地化答案吗?
可以——将input.country设置为ISO代码。答案会根据该市场进行调整,因此在比较结果时保持不变。
问:为什么答案在不同运行之间会变化?
生成的答案在不同运行中措辞不同。为了监测,跟踪引用来源以及您的品牌是否出现,而不是精确的措辞。
问:我需要代理吗?
不需要。出口由参与者通过住宅IP处理;您只需发送提示和国家。
在Scrapeless,我们仅访问公开可用的数据,并严格遵循适用的法律、法规和网站隐私政策。本博客中的内容仅供演示之用,不涉及任何非法或侵权活动。我们对使用本博客或第三方链接中的信息不做任何保证,并免除所有责任。在进行任何抓取活动之前,请咨询您的法律顾问,并审查目标网站的服务条款或获取必要的许可。



