返回博客

Scrapeless 每周变更日志:2026年8月24日至30日 更新

Alex Johnson
Alex Johnson

Senior Web Scraping Engineer

31-Aug-2026

TL;DR:

  • TikTok Scraper 现已正式上线。 公开文档现在涵盖了创作者个人资料、创作者视频列表和 TikTok 商店产品详细信息。
  • Scrapeless MCP 服务器现在包括 LLM 聊天抓取器。 新工具将 AI 答案收集引入与 MCP 连接的工作流程。
  • Google AI 模式现在接受 URL 作为输入。 完整的 AI 模式访问链接可以替代通常基于提示的输入参数。
  • 搜索和 AI 收集收到了可靠性更新。 Google 搜索 API 新发布,多个 LLM 抓取器的成功率更高,Amazon Rufus 的响应包含改进的来源引用解析。

TikTok Scraper 已从预览版转为正式发布。在 8 月 24 日至 30 日期间,Scrapeless 还在其 MCP 服务器上添加了 LLM 聊天抓取器,并为 Google AI 模式引入了基于 URL 的收集。此次发布包括针对较大商业工作负载的 Google 搜索 API 改进、更好的 AI 抓取器成功率以及更丰富的 Amazon Rufus 源数据。

💥 TikTok Scraper 正式上线

TikTok Scraper 现在有三个收集任务的公开 API 文档:

能力 角色 常见用例
创作者个人资料 scraper.tiktok.user.detail 研究公开创作者个人资料
创作者视频列表 scraper.tiktok.user.work 跟踪创作者发布的内容
TikTok 商店产品详细信息 scraper.tiktok.shop.page 收集用于商业研究的产品页面数据

团队现在可以使用发布的请求和响应参考来构建集成。这些独立角色让开发人员可以选择其工作流程所需的数据源,无论是创作者个人资料、内容列表还是产品页面。

对于创作者数据项目,保持收集限于公开信息,并仅存储项目所需的字段。公开可用性并不消除审查平台条款和适用数据处理要求的需要。

💫 LLM 聊天抓取器加入 Scrapeless MCP 服务器

Scrapeless MCP 服务器现在公开 llm_chat_scraper 用于创建 AI 答案收集任务。Scrapeless MCP 服务器工具参考 列出了对 ChatGPT、Gemini、Perplexity、Copilot、Google AI 模式、Google AI 概述、Grok 和 Alexa 的支持。

这为与 MCP 连接的代理提供了请求 AI 引擎数据的直接工具,与服务器现有的搜索、浏览器和爬取能力并行。研究工作流程可以使用收集到的答案进行引擎比较或定期的 AI 可见性监控。

MCP 客户端通过 MCP 工具发现界面 发现命名工具及其输入模式。在将新操作添加到工作流程之前,请检查您连接的服务器公开的工具列表。Scrapeless MCP 服务器概述 解释了更广泛的集成。

开始使用 Scrapeless 抓取

用 Scrapeless 提升您的网页抓取和自动化工作流程!
今天注册即可获得 $5 免费信用 - 无需信用卡

现在在 Scrapeless 仪表板 领取您的免费信用。

🌟 Google AI 模式支持基于 URL 的输入

Google AI 模式抓取器现在接受一个 url 字符串,该字符串包含完整的 Google AI 模式访问链接。这为已经拥有 AI 模式 URL 的工作流程增加了一个输入选项。

Google AI 模式输入参考 指定了一条重要规则:url 被提供时,其他输入参数不是必需的,并且如果包含则会被忽略。 不要期望提供单独的提示、国家、购物或位置设置来覆盖提供的 URL。

传递完整的链接,而不是从选定的部分重建它。如果您的应用程序解析或存储该链接,请使用 URL 标准 定义的行为来保留其查询组件和编码。

⬆️ 服务改进

更新 Google 搜索 API 以支持更大工作负载

Google 搜索 API 收到了一个新的版本,专注于大规模商业使用,增强了稳定性和数据完整性。该更新支持团队进行定期搜索数据收集,以便于监控、研究和生产应用。

人工智能抓取工具的成功率提高

Copilot、Perplexity 和 Gemini 在奥地利 (AT) 的成功率得到了提升。Google AI 概述也提高了成功率。这些是定性的服务更新;结果仍然取决于引擎、请求和收集上下文。

亚马逊 Rufus 源引用解析得更全面

亚马逊 Rufus 抓取工具现在从响应中解析了更多的源引用字段。附加的信息帮助团队检查与 Rufus 答案相关的引用,并将该上下文带入后续分析。处理源数据时应尽量使用现有数据,而不是假设每个答案都包含引用。

结论

本周的发布使 TikTok 收集通过文档化的参与者可用,将 AI 答案收集添加到 MCP,并为 Google AI 模式提供了基于 URL 的输入路径。搜索可靠性和 Rufus 源解析也提高了可用于下游工作流的数据。

Scrapeless Scraping API 中选择相关的参与者,并在规划工作负载时查看 Scrapeless 定价

准备好构建下一个数据工作流了吗?

与在 Scrapeless 社区中构建公共网络数据和 AI 答案工作流的开发者连接: Discord · Telegram

app.scrapeless.com 注册以开始使用。

在Scrapeless,我们仅访问公开可用的数据,并严格遵循适用的法律、法规和网站隐私政策。本博客中的内容仅供演示之用,不涉及任何非法或侵权活动。我们对使用本博客或第三方链接中的信息不做任何保证,并免除所有责任。在进行任何抓取活动之前,请咨询您的法律顾问,并审查目标网站的服务条款或获取必要的许可。

最受欢迎的文章

目录