网络正在获得一个访问层:llms.txt、签名代理和按爬取付费
Expert Network Defense Engineer
网络已经运行了三十年,依赖于一个单一的荣誉系统文件。robots.txt 礼貌地请求,未识别任何人,也未强制执行任何规定——在这大部分时间里,这已经足够,因为阅读你页面的内容是一个会带回流量的搜索引擎。
这种交流已经崩溃,现在有四项独立的努力试图取而代之。它们并不是同一想法的竞争版本,而是回答三个不同的问题——阅读什么、谁在询问,以及费用是多少——而其中只有一个是完成的标准。
实际上缺失的层是身份
从 robots.txt 能做和不能做的事情开始。机器人排除协议标准 为出版商提供了一种按用户代理字符串表达偏好的方式。其弱点就在最后一句话:用户代理字符串是一种声明,而不是凭证。任何人都可以发送任何字符串,IP 白名单随着基础设施的转变而迅速过时。
因此,想要对两个爬虫进行差异化处理的出版商没有可靠的方法来区分它们。以下的每个提议都是针对这一差距的下游。文件本身的实用机制——语法、指令以及收集者应如何阅读 —— 已在 网络抓取的 robots.txt 指南 中涵盖。
llms.txt 回答 “我应该读取什么?”
llms.txt 提议在 /llms.txt 上放置一个 Markdown 文件,包含网站重要页面的策划摘要和干净文本版本的链接。llms.txt 提议 由 Jeremy Howard 于 2024 年 9 月发布,其所述问题是上下文窗口:模型无法摄取整个网站,并且将 HTML 转换为可用文本是有损的。
准确说明它的状态非常重要,因为它通常被描述为一个标准。该网站本身称其为“一个标准化的提案”。没有 RFC,没有工作组,也没有人有义务遵守它。
它真正擅长的是策划。编写这一内容的出版商表示这是我内容的好版本,这对表现良好的读者有帮助,而对表现不佳的读者则没有成本。它表达的是偏好,而不是许可——与 robots.txt 的限制相同。
网络机器人认证回答 “谁在询问?”
这是实际上解决身份差距的部分。其方法是:来自自动客户端的每个请求都携带一个用其操作员的私钥制作的密码签名,以便源服务器可以验证谁在调用,而不是信任一个头部。
目前的规范是 网络机器人认证 HTTP 消息签名草案,这是一个基于 HTTP 消息签名的积极个人互联网草案。其框架表明,IP 白名单和用户代理字符串并不足够作为身份识别。
有两个警告需要注意。它是一个个人提交,而不是工作组的成果,并且来自同一作者的早期架构草案已经过期并被替换——这在标准工作中是正常的,但这标志着它仍然处于早期阶段。而且签名证明的是你是谁,而不是你被允许。它为出版商提供了一些决策依据;但并不做出决策。
按次付费爬取和 RSL 回答 “费用是多少?”
两个项目从相反的方向解决了补偿问题。
Cloudflare 的按次付费爬取使用 HTTP 402,这是在HTTP 语义规范中为支付保留的状态码,并且几十年来未被使用。出版商设定每次请求的价格,并标记每个爬虫为允许、收费或阻止;爬虫通过价格头部传达意图,通过网络机器人认证签名进行识别。它于 2025 年 7 月宣布,目前仍处于私有测试阶段——这是一个实时实验,而非可依赖的基础设施。
RSL 采用授权路线。真正简单的许可标准 定义了机器可读的许可条款——署名、按次付费、按推断付费——以 XML 的形式,可以从 robots.txt、HTML、HTTP 头部、RSS 源或媒体文件中引用。RSL 1.0 于 2025 年发布,得到了 Akamai、Cloudflare、Creative Commons、Fastly、Reddit、O'Reilly Media、Vox Media、Yahoo 和 Ziff Davis 的支持。
在这四者中,RSL 作为一项已发布的规范并且有行业采用,已经走得最远。虽然这并不意味着它确立——一个许可语法仍然需要有人愿意执行,而执行又将你带回身份问题。
它们暗示的堆栈
放在一起看,这些是层次,而不是替代品:
- 偏好 —
robots.txt和llms.txt表示出版商的意愿。 - 身份 — Web Bot Auth 以加密方式表明请求者的身份。
- 条款 — RSL 说明内容的使用目的和价格。
- 结算 — 按爬取付费的402流向说明金钱如何实际流动。
顺序很重要。没有身份的条款是不可执行的,没有条款的结算就像一个没有公布费率的收费站。身份是承重层,而它的完善程度最低。
可能存在的不足之处
对这一切的明显反对意见是:这里没有任何东西能够约束选择不参与的人。忽视 llms.txt、不发送签名并从不读取 RSL 文件的客户端,与过去的客户端所处的状况完全相同。这些机制适用于希望能被识别的运营者——大多数大型且可追责的运营者,而其他的则不在此列。
第二个问题是整合。基于签名的身份有利于足够大以运行关键基础设施并获得其密钥被认可的运营者。研究人员、初创公司或公共利益档案可能会发现新的访问层比其所替代的荣誉系统更难进入。这是一个实际的成本,值得被提及,而不是将其视为更清洁的网络上的一个四舍五入误差。
第三,这些都没有解决导致崩溃的非对称性。搜索时代的爬取以流量交换访问。一个读取你的页面并自行回答问题的模型并不会返回任何东西,而支付通道并不会恢复这种关系——它给缺失定价。
实际该怎么做
如果你是出版商:编写一个 llms.txt——这既便宜又能表达你所控制的策展。关注 RSL,因为机器可读许可证是未来纠纷将围绕的文物。将按爬取付费视为一项应跟进而非计划的实验。
如果你收集数据:持久的举措是成为这些系统旨在适应的类型的客户端。诚实地表明你的身份,保持在公共数据范围内,尊重现有的指令,保持比例适当,并记录你收集了什么以及来自何处。以上每个提议都奖励能够回答“你是谁,你拿走了什么”的运营者——而这现在值得做到,因为答案仍然是自愿的。
荣誉系统正在结束。取而代之的是尚未完成的,而有用的姿态既不是等待它也不是忽视它,而是现在以未来版本所需的方式行事。
开始使用 Scrapeless 免费计划,看看 Scrapeless AI Agent 如何处理公共网络数据,并在计划收集程序时查看 Scrapeless 定价。
常见问题解答
问:llms.txt 是正式标准吗?
不是。它明确提出的是在2024年9月发布的标准化提案。没有 RFC,也没有工作组支持它,任何客户端也没有义务遵守它。网站采用它是因为策展有助于行为良好的读者,而不是因为有什么强制性的要求。
问:llms.txt 取代 robots.txt 吗?
不——它们回答的是不同的问题。robots.txt 在 RFC 9309 中标准化,表示客户端不应获取的路径。llms.txt 指向出版商认为最有用的内容,并提供其更清晰的文本版本。一个是限制,另一个是策展,并且两者都不对客户端进行身份验证。
问:Web Bot Auth 实际上解决了什么问题?
它使爬虫的身份可验证。目前,客户端用任何人都可以复制的 User-Agent 字符串来识别自己,因此出版商无法可靠地区分爬虫。Web Bot Auth 使用 HTTP 消息签名对每一请求进行运营者私钥签名,以便来源可以验证是谁在呼叫。这是一项主动的个体互联网草案,而不是已完成的标准。
问:出版商今天可以向 AI 爬虫收费吗?
只有实验性地。Cloudflare 的按爬取付费使用 HTTP 402 和按请求定价,于2025年7月宣布,但仍处于私有测试阶段。RSL 于2025年发布,得到了基础设施公司和出版商的支持,定义了包括按爬取付费和按推理付费的机器可读许可条款——但许可证仍依赖于某人识别并对客户端执行。
问:在这一切稳定之前,数据收集团队应该做什么?
表现得好像身份和条款已经得到执行。仅收集公共数据,尊重当前指导方针,保持请求量与网站能够处理的比例相称,并记录所收集的数据及其来源。桌上的每个提案都奖励能够回答这个问题的运营商,因此无论哪个提案获胜,工作都不会浪费。
在Scrapeless,我们仅访问公开可用的数据,并严格遵循适用的法律、法规和网站隐私政策。本博客中的内容仅供演示之用,不涉及任何非法或侵权活动。我们对使用本博客或第三方链接中的信息不做任何保证,并免除所有责任。在进行任何抓取活动之前,请咨询您的法律顾问,并审查目标网站的服务条款或获取必要的许可。



