什么是 llms.txt?
Scrapeless Universal Scraping API 可以从团队可能通过 llms.txt 资源组织的公共页面检索 Markdown 和其他响应格式。
简而言之
- llms.txt 是一个提议的网站资源,用于 LLM 友好的发现。 一个网站在其根目录放置一个 Markdown 文档,并链接到具有简短描述和结构的选定页面。
- 该文件是指南,而不是访问控制机制。 它无法替代身份验证、robots.txt、规范标签、网站地图或普通 HTML 导航。
- 一个简洁的文件比目录转储更有用。 该文档应引导助手朝向权威的、高价值的资源,而不是列出网站上的每个 URL。
- Markdown 替代方案可以减少提取噪声。 该提案还讨论了有用页面的干净 Markdown 版本和可选的完整汇编。
- 采用并不保证引用或排名。 一个 AI 系统可能会忽略该文件,通过其他路径检索页面,或应用其自己的索引和源选择策略。
llms.txt 定义
llms.txt 是一个开放提案,用于发布网站的简明、LLM 友好概述。该网站在根路径放置一个 Markdown 文件,通常为 /llms.txt,并使用标题、解释性文本和描述性链接指向助手在推理时可能需要的材料。该权威 llms.txt 提案 描述了动机和文档形状。
该提案针对一个实际的检索问题。许多网站包含导航外壳、脚本、广告、重复模板和需要在模型上下文中解读的长页面,这些都是昂贵的。一个简短的、经过策划的地图可以说明该网站是什么,识别权威文档,并指引工具朝向更干净的表示,而无需模型从零推断信息架构。
该文件以 Markdown 编写,因此仍然可由人类阅读,并易于传统软件解析。它可以包含顶级项目名称、摘要、上下文散文、部分和带描述的链接列表。一个好的描述告诉检索系统一个页面的重要性;原始的 URL 列表仅仅在另一个文件中重现发现问题。
llms.txt 仍然是一个提案,而不是浏览器或搜索引擎强制执行的通用网络标准。实现各异,支持必须在特定工具或服务中进行检查。发布该文件可以改善选择阅读它的系统的定向,但并不保证任何模型将摄取、引用、排名或记住链接内容。
llms.txt 文件如何工作
客户端首先请求可预测的根路径。如果文件存在,它将读取 Markdown 结构,并利用描述决定哪些链接页面与当前任务相关。该文件可以指向普通的 HTML 页面或更干净的 Markdown 替代方案。检索系统仍然需要获取、验证和引用所选择的源。
该提案偏爱策划的层次结构。一个文档网站可能会快速入门、概念、API 参考、示例和政策进行分类。可选部分可以包含有用但不必的二级材料。这使客户端在最可能回答问题的页面上花费有限的上下文预算。
一些网站还展示 llms-full.txt,一个更大的文档,结合了可直接阅读的实质内容。较小的 llms.txt 地图和更完整的汇编解决了不同的问题:一个支持发现,而另一个可以减少对限制文档集的后续请求。大型或频繁变化的网站需要生成和大小政策,以免更完整的文件变得陈旧或笨拙。
该 参考 llms.txt 仓库 包含提案源和实施资源。团队应将解析器和生成器视为普通软件依赖:锁定行为、测试输出、保留描述,并避免假设每个消费者都以相同方式实现可选特性。
llms.txt 与 robots.txt 和 sitemap.xml
这些文件可以共存,因为它们对不同消费者回答不同的问题。
| 维度 | 主要含义 | 常见错误 |
|---|---|---|
| llms.txt | 为 LLM 定向检索提供策划、描述性导向。 | 将列出链接视为许可、支持或保证摄取。 |
| robots.txt | 按用户代理和路径分组的爬虫访问偏好。 | 将其用于保护机密内容,而不是身份验证。 |
| sitemap.xml | 供爬虫使用的机器可读 URL 发现和元数据。 | 期待网站地图解释哪个页面回答特定任务。 |
| HTML 导航 | 面向人类的结构和内部发现。 | 因为存在 AI 特定文件而移除普通导航。 |
| Markdown 页面替代方案 | 一个页面内容的更干净表示。 | 发布一个不维护的副本与规范页面相矛盾。 |
llms.txt的用途
该提案适用于一些权威资源可以比开放式抓取更快地引导助手的网站。
开发者文档
一个项目可以指向快速入门、概念、API参考、迁移说明和当前示例,以及简短的任务导向描述。
产品知识库
一个站点可以识别官方功能、政策、集成和故障排查页面,同时分隔可选背景材料。
研究集合
一个实验室可以在一个可读的地图中解释数据集、方法、出版物、许可证和引用指导。
代理工具发现
一个浏览助手可以使用地图选择一小组页面,然后打开并验证源内容。
如何创建有用的llms.txt
从受众和常见任务开始。文档助手可能需要安装、身份验证、核心概念、API参考、限制和故障排查。营销网站可能需要产品定义、定价、安全和联系信息。选择能回答这些任务的页面,而不是复制网站地图。
编写描述以区分相邻链接。“身份验证指南——API密钥创建、存储和请求头”比“身份验证”更有用。避免推广性形容词和不支持的声明。该文件应帮助检索系统选择证据,因此准确性胜过品牌语言。
为内容选择一个真实来源。如果Markdown替代品是从规范页面生成的,记录生成者并验证标题、代码、表格、链接和更新时间。如果编辑以手动方式维护两者,添加一个审查工作流程以捕捉偏差。矛盾的副本削弱了文件所提供的方向价值。
验证已部署的工件。确认根路径返回成功的纯文本或Markdown响应,而没有身份验证墙、重定向惊喜或渲染错误页面。检查每个列出的URL是否具有其预期内容,而不仅仅是HTTP状态。OpenAI开发者网站以llms.txt形式公开其自身的 文档索引,提供了机器可读文档地图的具体示例。
限制和常见误解
llms.txt不控制抓取或训练。这些政策属于特定抓取器的文档、robots.txt、合同、平台控制和适用法律。llms.txt中的链接不应被解读为许可或每个下游使用的同意。访问和使用是两个不同的问题。
该文件并不取代搜索引擎基础知识。页面仍需要稳定的URL、有用的标题、内部链接、规范处理、可读内容和适当的索引控制。一个AI工具可能通过搜索、直接用户请求、浏览器操作或单独索引抵达,而根本没有咨询llms.txt。
过时性会将一个有用的地图变成错误的来源。重命名的产品、弃用的端点、移动的页面和变更的政策需要及时更新。在实际操作中从维护的内容注册中生成,但保留人类审查用于描述和优先级。生成器可以确认存在性;它不能决定哪个页面最好地回答用户任务。
上下文大小仍然很重要。一个将整个站点连接在一起的llms-full.txt文件可能对客户端来说过大、重复导航文本或组合无关版本。首先提供模块化的Markdown页面和简明的地图。让检索系统仅选择活动问题所需的材料。
如何评估llms.txt部署
测试任务完成,而不仅仅是文件存在。给检索代理代表性问题,并记录它选择了哪些llms.txt链接,这些页面是否回答了问题,最终响应是否保存了引用。将相同的任务与普通导航或网站地图发现进行比较。
测量链接健康和描述精确度。跟踪损坏的URL、重定向、重复的目标、缺失的规范主题和可能适用于多个页面的描述。分别审核可选部分,以免辅助材料挤压新用户的最小路径。
审核HTML和Markdown表示之间的一致性。比较标题、主要标题、代码示例、警告和最后更新信息。在表示有意不同的地方,记录规则。一个干净的Markdown副本应该消除表现噪音,而不默默改变技术意义。
明确记录消费者支持。一个成功的测试与一个助手或解析器并不能证明一般采用。注意产品、版本、检索模式、请求路径和观察到的行为。这保持了llms.txt实验不转变为关于所有语言模型的广泛声明。
结论
llms.txt是一种提议的Markdown地图,有助于LLM导向的工具找到网站上最有用的内容。它的强项在于策划:一个可预测的根文件可以解释网站并将客户端引导到权威的、任务具体的页面,减少发现的开销。
该文件与现有的Web堆栈协同工作。robots.txt表达抓取器偏好,网站地图枚举URL,HTML为用户提供服务,访问控制保护受限资源。维护llms.txt作为经过测试的导航工件,并将其好处描述为观察到的支持,而不是保证AI处理。
准备验证LLM友好的内容路径?
使用Scrapeless Universal Scraping API检查您的llms.txt地图背后的公共页面和响应格式,然后保持文件与规范来源同步。
今天注册并获得 $5的免费信用 — 无须信用卡.
领取您的$5信用→常见问题
llms.txt的目的是什么?
llms.txt 提供了一个简洁的 Markdown 概述和精选链接,可以帮助面向 LLM 的工具在推理时找到权威网站内容。
llms.txt 是一个官方网络标准吗?
它是一个开放的提案,实施正在增加,并不是一个通用的浏览器或搜索标准。必须检查每个消费者的支持情况。
llms.txt 取代 robots.txt 吗?
不。llms.txt 支持内容发现和定位,而 robots.txt 则传达爬虫访问偏好。两者都不取代私有内容的认证。
什么是 llms-full.txt?
llms-full.txt 是一个可选的更大内容汇编。它可以减少小型文档集的后续检索,但在大型网站上可能变得过于庞大或过时。
llms.txt 会提高 AI 排名或引用吗?
没有保证的结果。该文件可以使支持工具更容易发现选定内容,而每个 AI 系统应用其自己的检索、索引和源选择过程。