鹅 + 无刮擦:通过MCP向Block的AI代理提供实时网络数据
Lead Scraping Automation Engineer
TL;DR:
- Goose 是 Block 的开源 AI 代理,它通过模型上下文协议(MCP)访问外部工具。 添加 Scrapeless MCP 服务器可以使 Goose 在没有自身的情况下进行实时网页搜索和抓取。
- Scrapeless MCP 服务器提供 21 个工具 —
google_search、google_trends、scrape_html、scrape_markdown、scrape_screenshot,以及 16 个用于驱动云浏览器的browser_*操作。 - 你可以将其添加为一个标准输入输出扩展, 通过 Goose 的
config.yaml或者在运行时与goose run --with-extension一起指向npx -y scrapeless-mcp-server,并在SCRAPELESS_KEY环境变量中放入你的 Scrapeless 密钥。 - 接着 Goose 会自行调用这些工具。 给定一个任务,代理会选择合适的 Scrapeless 工具,运行它,并根据返回的数据回答 — 无需粘合代码。
- 开始免费。 新的 Scrapeless 账户包含免费积分 — 可在 app.scrapeless.com 注册。
Goose 是来自 Block 的开源代理,能够编写和运行代码、驱动工作流程,并自行调用外部服务。它开箱即用不能做的是看到实时网页 — 它的知识截止于模型的训练数据。Goose 通过连接到 模型上下文协议 服务器来填补这个空白,而这些服务器暴露工具。此指南将 Goose 连接到 Scrapeless MCP 服务器,以便代理能够搜索 Google 并抓取页面作为推理的一部分。以下每个命令、工具名称和结果都是从实时运行中捕获的。
此集成所能实现的功能
Scrapeless MCP 服务器是一个标准输入输出服务器:Goose 将其作为子进程启动,并通过标准输入和输出以 MCP — JSON-RPC 协议进行通信。一旦连接,Goose 将获得:
- 实时搜索 —
google_search和google_trends用于获取实时结果和兴趣数据。 - 页面提取 —
scrape_html、scrape_markdown和scrape_screenshot将任何 URL 转换为 HTML、干净的 Markdown 或图像。 - 云浏览器控制 — 16 个
browser_*工具(browser_goto、browser_click、browser_type、browser_get_text、browser_snapshot等)驱动一个需要交互的管理浏览器。
代理会决定调用哪个;你用简单的语言描述任务。
先决条件
- 已安装 Goose(CLI 或桌面) — 查看 Goose 项目的安装程序。
- 可用的 Node.js 和
npx,以便 Goose 可以使用npx -y scrapeless-mcp-server启动服务器。 - 一个 Scrapeless API 密钥 — 在 app.scrapeless.com 的免费计划中获取一个。
- 在 Goose 中配置的模型提供者(代理的推理过程运行在你选择的模型上)。
将 Scrapeless MCP 服务器添加到 Goose
有两种方式来注册扩展。对于永久设置,将其添加到 Goose 的 config.yaml(在 Linux 中为 ~/.config/goose/config.yaml),放在 extensions 下:
yaml
extensions:
scrapeless:
name: scrapeless
type: stdio
cmd: npx
args:
- -y
- scrapeless-mcp-server@0.4.9
envs:
SCRAPELESS_KEY: your-scrapeless-api-key
enabled: true
bundled: false
timeout: 300
description: Scrapeless 网络搜索和抓取工具
在桌面应用程序中,相同的值放入 扩展 → 添加自定义扩展:名称为 scrapeless,命令为 npx -y scrapeless-mcp-server,环境变量为 SCRAPELESS_KEY。
对于一次性运行,跳过配置文件并内联传递扩展。 --with-extension 标志接受一个带有其环境变量的完整命令:
bash
goose run --with-extension "SCRAPELESS_KEY=your-key npx -y scrapeless-mcp-server@0.4.9" \
--text "在 Google 上搜索 '网络抓取' 并给我第一个结果。"
Goose 看到的内容:工具列表
连接时,Goose 执行 MCP 握手并加载服务器的工具。Scrapeless MCP 服务器(协议 2024-11-05)宣传 21 个工具:
text
google_search google_trends scrape_html scrape_markdown
scrape_screenshot browser_create browser_goto browser_click
browser_type browser_press_key browser_get_text browser_get_html
browser_snapshot browser_screenshot browser_scroll browser_scroll_to
browser_go_back browser_go_forward browser_wait browser_wait_for
browser_close
前五个返回数据直接;browser_* 集合驱动 Scrapeless 抓取浏览器上的持久会话——创建一个,导航,操作,读取并关闭。有关基于这些工具构建的更多代理任务,请参见 5 个 Scrapeless MCP 使用案例。
基于提示的使用
注册扩展后,你将任务交给 Goose,它会选择工具。要求它运行搜索:
bash
goose run --no-session \
--text "使用 scrapeless google_search 工具在 Google 中搜索 '网页抓取'。报告返回了多少个自然结果以及第一个自然结果的确切标题。"
Goose 在你的模型上开始一个会话,调用工具,并根据结果进行回答。实时运行显示了代理调用工具并报告真实数据:
text
▸ google_search (q: web scraping)
Google 对“网页抓取”的搜索返回了 8 个自然结果。
第一个自然结果的确切标题是维基百科的“网页抓取”。
代理选择了 google_search,传递了查询,并从结构化响应中读取了计数和第一个标题——你那边无需解析代码。
结论
Goose 的能力取决于它能够访问的工具,而 Scrapeless MCP 服务器提供了 21 个工具:搜索、趋势、三个页面到数据的转换器,以及一个完整的云浏览器工具集。将服务器注册为一个 stdio 扩展——在 config.yaml 中或与 --with-extension 内联——设置 SCRAPELESS_KEY,Goose 会为每个任务调用合适的工具并从实时网页数据中回答。整个集成是一个扩展条目;代理与之所做的一切都是提示。
准备好让你的 Goose 代理获取实时网页数据吗?从 Scrapeless 仪表板 免费开始,阅读 MCP 服务器文档,或在 Scrapeless 定价 上比较计划。
常见问题
问:什么是 Goose?
答:Goose 是一款开源 AI 代理,由 Block 提供,可在命令行和桌面应用上运行。它自动执行任务,并通过模型上下文协议连接到外部工具,因此每添加一个 MCP 服务器,它的能力就会增强。
问:Goose 如何连接到 Scrapeless?
答:Goose 启动 Scrapeless MCP 服务器作为 stdio 子进程 (npx -y scrapeless-mcp-server),并通过标准输入/输出进行 MCP 通信。你只需在 config.yaml 中或通过 goose run --with-extension 在线注册一次。
问:Scrapeless MCP 服务器提供哪些工具?
答:21 个工具:google_search、google_trends、scrape_html、scrape_markdown、scrape_screenshot 和十六个用于驱动云浏览器的 browser_* 操作(导航、点击、输入、读取文本或 HTML、截图、滚动、等待和关闭)。
问:我该把我的 Scrapeless API 密钥放在哪里?
答:在扩展的 SCRAPELESS_KEY 环境变量中——可以放在 config.yaml 的 envs 块中或作为 --with-extension 命令字符串的一部分。Goose 会将其传递给服务器子进程。
问:我还需要模型提供者吗?
答:是的。Scrapeless 提供工具;Goose 自身的模型提供者进行推理,以决定何时调用这些工具。像往常一样在 Goose 中配置你的提供者。
问:代理会自动调用工具吗?
答:是的。一旦注册了扩展,你用简单语言描述任务,Goose 就会选择合适的 Scrapeless 工具,运行它,并从返回的数据中回答。
问:Goose 能与页面互动,而不仅仅是获取页面吗?
答:是的。browser_* 工具驱动一个持久的云浏览器会话——browser_create、browser_goto、browser_click、browser_type、browser_get_text 和 browser_close——因此代理可以处理需要交互的页面。
在Scrapeless,我们仅访问公开可用的数据,并严格遵循适用的法律、法规和网站隐私政策。本博客中的内容仅供演示之用,不涉及任何非法或侵权活动。我们对使用本博客或第三方链接中的信息不做任何保证,并免除所有责任。在进行任何抓取活动之前,请咨询您的法律顾问,并审查目标网站的服务条款或获取必要的许可。



