🎯 一款可定制、具备反检测功能的云浏览器,由自主研发的 Chromium驱动,专为网页爬虫AI 代理设计。👉立即试用
返回博客

双子座爬虫API:将Google Gemini答案捕获为数据

Isabella Garcia
Isabella Garcia

Web Data Collection Specialist

08-Jul-2026

TL;DR:

  • Gemini Scraper 捕获 Google Gemini 的答案作为结构化数据。 发送提示到 scraper.gemini;返回答案文本以及 Gemini 引用的来源。
  • 这是一个两次调用的异步流程。 先 POST 提示以创建任务,然后通过 task_id GET 结果——在实时运行中,答案大约在 12 秒内返回。
  • 引用以结构化形式返回,而不是从 HTML 中抓取。 每个引用包含 titleurlwebsite_namesnippetfavicon 和 Gemini 使用的高亮段落。
  • 使用国家代码进行本地化。 country 字段使答案适应该地区,就像那里的用户看到的一样。
  • 这就是您监控品牌在 AI 答案中曝光度的方法。 向 Gemini 提问您的客户所问的问题,并查看它引用的来源。
  • 免费开始。 新的 Scrapeless 账户包括免费 Scraper API 使用——可在 app.scrapeless.com 注册。

引言:了解 Gemini 实际回答的内容

AI 回答引擎现在处于用户与开放网络之间。当有人向 Google Gemini 询问“最佳代理服务”或“纽约的活动时”,答案——以及它引用的来源——在用户点击任何内容之前塑造了他们的看法。对于品牌监控、竞争研究和答案引擎优化,问题已不再是“我在 Google 上的排名如何”,而是“Gemini 说了什么,它引用了谁”。

Scrapeless Gemini Scraper 程序性地回答这个问题。您向 scraper.gemini 发出提示,并获得答案文本及其背后的结构化引用。本指南涵盖请求格式、第一次的 curl、响应模式、Python 集成以及如何使用它——下面的每个请求和响应都是在实时 API 下捕获的。


您可以用它做什么

  • 捕获 Gemini 的答案文本——完整响应以 CommonMark 样式 Markdown 的形式,便于存储或分析。
  • 阅读引用——Gemini 依据其回答的来源,每个引用都有标题、URL 和使用的段落。
  • 跟踪 AI 答案中的品牌提及——提出您的买家所问的问题,查看您是否出现在回答中。
  • 按地区本地化——设置 country,以查看用户在该市场将如何看到答案。
  • 为监控管道提供数据——定期以相同的提示运行,并随时间比较来源的变化。

为什么选择 Scrapeless Gemini Scraper

Gemini Scraper 是 Scrapeless LLM Chat Scraper 系列的一部分,是以数据形式读取 AI 引擎答案的管理方式。具体来说,它提供:

  • 单一请求契约——发送提示,获取答案及其引用;无需驱动浏览器。
  • 结构化引用——来源作为字段返回,而不是需要解析的标记。
  • 覆盖 195 个国家的住宅代理——通过干净、适合地区的出口获取答案。
  • 按国家本地化——一个字段使答案适应该市场。

app.scrapeless.com 的免费计划中获取您的 API 密钥。


先决条件

  • 一个 Scrapeless 账户和 API 密钥——请在 app.scrapeless.com 注册
  • 第一次请求需要 curl,集成需 Python 3.10+
  • 基本熟悉 HTTP 和 JSON

Gemini Scraper 的工作原理

该流程包括两个调用:创建任务,然后获取结果。

请求参数

字段 位置 意义
actor 顶层 scraper.gemini
input.prompt 输入 向 Gemini 提问
input.country 输入 用于本地化答案的 ISO 国家代码

授权是在两个调用中的 x-api-token 头。

使用 curl 快速捕获

创建任务:

bash Copy
curl -X POST https://api.scrapeless.com/api/v2/scraper/request \
  -H "x-api-token: ${SCRAPELESS_API_KEY}" \
  -H "Content-Type: application/json" \
  -d '{
    "actor": "scraper.gemini",
    "input": { "prompt": "Recommended attractions in New York", "country": "US" }
  }'
# { "status": "pending", "task_id": "3886db31-…" }

然后通过 task_id 获取结果:

bash Copy
curl -X GET https://api.scrapeless.com/api/v2/scraper/result/{task_id} \
  -H "x-api-token: ${SCRAPELESS_API_KEY}"

响应封装

一旦 statussuccess,答案和引用在 task_result 中:

json Copy
// 示范样本—字段形状准确(实时捕获);值已简化
{
  "status": "success",
  "task_result": {
    "prompt": "Recommended attractions in New York",
    "result_text": "New York City is a beautiful chaos of culture, history…",
    "citations": [
      {
        "title": "20 Best Things to Do in NYC",
        "url": "https://example.com/nyc",
        "website_name": "Example Travel",
        "snippet": "From the Statue of Liberty to…",
        "favicon": "https://example.com/favicon.ico",
        "highlights": ["Statue of Liberty", "Central Park"]
      }
    ]
  }
}

在一次实时运行中,这个结果大约在12秒内返回,包含15个引用,每个引用都携带上述六个字段。


在Python中集成API

创建任务,轮询直到完成,并读取答案:

python Copy
import os
import time
import requests

API_KEY = os.environ["SCRAPELESS_API_KEY"]
BASE = "https://api.scrapeless.com"
HEADERS = {"x-api-token": API_KEY, "Content-Type": "application/json"}


def ask_gemini(prompt: str, country: str = "US") -> dict:
    created = requests.post(
        f"{BASE}/api/v2/scraper/request",
        headers=HEADERS,
        json={"actor": "scraper.gemini", "input": {"prompt": prompt, "country": country}},
        timeout=60,
    )
    task_id = created.json()["task_id"]

    for _ in range(30):
        time.sleep(3)
        got = requests.get(f"{BASE}/api/v2/scraper/result/{task_id}", headers=HEADERS, timeout=60)
        data = got.json()
        if data.get("status") in ("success", "failed"):
            return data
    raise TimeoutError("未能及时准备好结果")


result = ask_gemini("纽约推荐的景点")
answer = result["task_result"]
print(answer["result_text"])
for c in answer["citations"]:
    print("-", c["website_name"], c["url"])

在免费计划上获取您的API密钥:app.scrapeless.com


如何避免常见问题

  • 缺失的字段是null,而不是错误。 不是每个答案都携带highlightsfavicon,将每个引用字段视为可选,并对其缺失进行防护。
  • 及时获取结果。 结果是通过task_id检索的;在创建任务后不久进行轮询,而不是很久之后,并且更倾向于使用短轮询间隔,而不是晚些时候读取。
  • 将国家固定在您研究的市场上。 country字段会改变答案;在监测运行中保持不变,以便结果可以随时间进行比较。
  • 答案在不同运行之间有所变化。 Gemini的措辞因运行而异,因此随着时间的推移,比较引用的来源而不是精确的措辞——答案引擎展示页面的方式在Google自己关于网络的AI特性的指导中进行了描述,而您调用的HTTP合同遵循HTTP语义规范

结论:Gemini眼中的您的品牌

Gemini Scraper将AI答案转化为您可以跟踪的数据:响应文本及其背后的确切来源,通过一次两次调用的流程完成。运行客户询问的提示,存储引用,并观察您在Gemini答案中的可见度随时间的变化。将其与通用抓取API行中的其他引擎结合,了解为什么答案引擎改变了搜索,文档涵盖每个字段。


准备好构建您的AI驱动数据管道了吗?

加入我们的社区,领取免费计划,并与监测AI答案的开发者联系:Discord · Telegram

app.scrapeless.com注册以免费使用抓取API,查看规模的定价


常见问题解答

问:Gemini Scraper返回什么?
答案文本作为Markdown(result_text)以及一个citations数组——每个引用都有titleurlwebsite_namesnippetfavicon和Gemini使用的highlights。在一次实时运行中,一个提示返回了15个引用。

问:这是同步的吗?
不是。您POST提示以创建任务,然后通过task_id获取结果。在一次实时运行中,答案大约在12秒内准备好。

问:我可以本地化答案吗?
可以——将input.country设置为ISO代码。答案会根据该市场进行调整,因此在比较结果时保持不变。

问:为什么答案在不同运行之间会变化?
生成的答案在不同运行中措辞不同。为了监测,跟踪引用来源以及您的品牌是否出现,而不是精确的措辞。

问:我需要代理吗?
不需要。出口由参与者通过住宅IP处理;您只需发送提示和国家。

在Scrapeless,我们仅访问公开可用的数据,并严格遵循适用的法律、法规和网站隐私政策。本博客中的内容仅供演示之用,不涉及任何非法或侵权活动。我们对使用本博客或第三方链接中的信息不做任何保证,并免除所有责任。在进行任何抓取活动之前,请咨询您的法律顾问,并审查目标网站的服务条款或获取必要的许可。

最受欢迎的文章

目录