llms.txt là gì? Định dạng, Sử dụng và Hướng dẫn Trang web

llms.txt là gì?

API Qu scraping Universal không chứa rác có thể lấy định dạng phản hồi Markdown và các định dạng khác từ các trang công khai mà các nhóm có thể tổ chức thông qua tài nguyên llms.txt.

Tóm tắt

  • llms.txt là một tài nguyên trang web được đề xuất cho việc phát hiện thân thiện với LLM. Một trang đặt một tài liệu Markdown ở gốc và liên kết đến các trang đã chọn với mô tả ngắn gọn và cấu trúc.
  • Tệp là một hướng dẫn, không phải cơ chế kiểm soát truy cập. Nó không thay thế xác thực, robots.txt, thẻ chuẩn hóa, sơ đồ trang hoặc điều hướng HTML thông thường.
  • Một tệp ngắn gọn hữu ích hơn nhiều so với một danh mục rác. Tài liệu nên định hướng một trợ lý đến các nguồn tài nguyên có thẩm quyền, có giá trị cao thay vì liệt kê mọi URL trên trang.
  • Các lựa chọn thay thế Markdown có thể giảm tiếng ồn trong việc trích xuất. Đề xuất cũng thảo luận về các phiên bản Markdown sạch của các trang hữu ích và một tập hợp đầy đủ hơn tùy chọn.
  • Việc áp dụng không đảm bảo trích dẫn hoặc xếp hạng. Một hệ thống AI có thể bỏ qua tệp, truy xuất các trang thông qua các con đường khác, hoặc áp dụng chính sách lựa chọn nguồn và lập chỉ mục của riêng mình.

llms.txt Được định nghĩa

llms.txt là một đề xuất mở để công bố tổng quan ngắn gọn, thân thiện với LLM của một trang web. Trang web đặt một tệp Markdown tại đường dẫn gốc, thường là /llms.txt, và sử dụng các tiêu đề, văn bản giải thích và các liên kết mô tả để chỉ ra material mà một trợ lý có thể cần vào thời điểm suy diễn. Có thẩm quyền đề xuất llms.txt mô tả động lực và hình dạng tài liệu.

Đề xuất giải quyết một vấn đề trích xuất thực tiễn. Nhiều trang web chứa các thành phần điều hướng, kịch bản, quảng cáo, mẫu lặp lại và các trang dài mà rất tốn kém để diễn giải trong ngữ cảnh mô hình. Một bản đồ ngắn gọn, được biên soạn có thể cho biết trang web là gì, xác định tài liệu có thẩm quyền và hướng một công cụ tới các đại diện sạch hơn mà không cần mô hình suy diễn kiến trúc thông tin từ đầu.

Tệp được viết bằng Markdown vì vậy nó vẫn dễ đọc bởi con người và dễ cho phần mềm thông thường phân tích. Nó có thể chứa tên dự án cấp cao, tóm tắt, văn bản ngữ cảnh, các phần và danh sách các liên kết với mô tả. Một mô tả tốt cho biết lý do một trang quan trọng đối với một hệ thống trích xuất; một danh sách URL thô chỉ phục hồi vấn đề phát hiện trong một tệp khác.

llms.txt vẫn là một đề xuất chứ không phải tiêu chuẩn web toàn cầu được thực thi bởi trình duyệt hoặc công cụ tìm kiếm. Thực hiện khác nhau, và hỗ trợ phải được kiểm tra trên công cụ hoặc dịch vụ cụ thể. Xuất bản tệp có thể cải thiện định hướng cho các hệ thống lựa chọn đọc nó, nhưng nó không tạo ra bất kỳ lời hứa nào rằng bất kỳ mô hình nào sẽ hấp thụ, trích dẫn, xếp hạng hoặc nhớ nội dung đã liên kết.

Cách một tệp llms.txt hoạt động

Một khách hàng trước tiên yêu cầu đường dẫn gốc dự đoán. Nếu tệp tồn tại, nó đọc cấu trúc Markdown và sử dụng các mô tả để quyết định trang liên kết nào là phù hợp với nhiệm vụ hiện tại. Tệp có thể chỉ đến các trang HTML thông thường hoặc các lựa chọn thay thế Markdown sạch hơn. Hệ thống trích xuất vẫn cần lấy, xác minh và trích dẫn nguồn đã chọn.

Đề xuất ưu tiên hệ thống phân cấp được biên soạn. Một trang web tài liệu có thể tách biệt các khởi đầu nhanh, khái niệm, tham chiếu API, ví dụ và chính sách. Các phần tùy chọn có thể chứa tài liệu thứ cấp hữu ích nhưng không cần thiết cho một nhiệm vụ điển hình. Điều này cho phép một khách hàng tiêu tốn ngân sách ngữ cảnh hạn chế vào các trang có khả năng trả lời câu hỏi nhất.

Một số trang cũng tiết lộ llms-full.txt, một tài liệu lớn hơn kết hợp nội dung đáng kể để đọc trực tiếp. Bản đồ llms.txt nhỏ hơn và tập hợp đầy đủ hơn giải quyết các vấn đề khác nhau: một hỗ trợ phát hiện, trong khi cái kia có thể giảm yêu cầu theo sau cho các bộ tài liệu hạn chế. Các trang lớn hoặc thường xuyên thay đổi cần chính sách phát sinh và kích thước để tệp đầy đủ hơn không trở nên lỗi thời hoặc cồng kềnh.

Tham chiếu kho lưu trữ llms.txt chứa nguồn đề xuất và tài nguyên thực hiện. Các nhóm nên xem xét các trình phân tích và trình tạo giống như các phụ thuộc phần mềm thông thường: cố định hành vi, kiểm tra đầu ra, bảo tồn mô tả, và tránh giả định mọi người tiêu dùng thực hiện các tính năng tùy chọn theo cách giống nhau.

llms.txt so với robots.txt và sitemap.xml

Những tệp này có thể tồn tại đồng thời vì chúng trả lời những câu hỏi khác nhau cho những người tiêu dùng khác nhau.

Kích thướcÝ nghĩa chínhSai lầm phổ biến
llms.txtĐịnh hướng mô tả, được biên soạn cho việc trích xuất hướng đến LLM.Đối xử với các liên kết được liệt kê như sự cho phép, chấp thuận, hoặc khả năng hấp thụ đảm bảo.
robots.txtSở thích truy cập crawler được nhóm theo tác nhân người dùng và đường dẫn.Sử dụng nó để bảo vệ nội dung bí mật thay vì xác thực.
sitemap.xmlPhát hiện URL có thể đọc máy và siêu dữ liệu cho các crawler.Mong đợi một sơ đồ trang giải thích trang nào trả lời nhiệm vụ cụ thể.
Điều hướng HTMLCấu trúc đối với con người và phát hiện nội bộ.Loại bỏ điều hướng thông thường vì một tệp cụ thể cho AI tồn tại.
Tham số trang MarkdownBiểu diễn sạch hơn nội dung của một trang.Xuất bản một bản sao không được bảo trì mà mâu thuẫn với trang chuẩn bị.

Nơi llms.txt Hữu Ích

Đề xuất phù hợp với các trang mà một bộ tài nguyên chính xác nhỏ có thể định hướng một trợ lý nhanh hơn so với việc thu thập không có điểm dừng.

Tài liệu phát triển

Một dự án có thể chỉ ra các hướng dẫn nhanh, khái niệm, tài liệu tham khảo API, ghi chú di chuyển và các ví dụ hiện tại với các mô tả ngắn theo nhiệm vụ.

Cơ sở tri thức sản phẩm

Một trang có thể xác định các trang tính năng chính thức, chính sách, tích hợp, và xử lý sự cố trong khi tách các tài liệu nền tảng tùy chọn.

Bộ sưu tập nghiên cứu

Một phòng thí nghiệm có thể giải thích các tập dữ liệu, phương pháp, xuất bản, giấy phép, và hướng dẫn trích dẫn trong một bản đồ dễ đọc.

Khám phá công cụ đại lý

Một trợ lý duyệt có thể sử dụng bản đồ để chọn một bộ nhỏ các trang trước khi mở và xác thực nội dung nguồn.

Cách Tạo llms.txt Hữu Ích

Bắt đầu với khán giả và các nhiệm vụ phổ biến. Một trợ lý tài liệu có thể cần cài đặt, xác thực, khái niệm cốt lõi, tài liệu tham khảo API, giới hạn và xử lý sự cố. Một trang tiếp thị có thể cần định nghĩa sản phẩm, giá cả, bảo mật, và thông tin liên hệ. Chọn các trang trả lời những nhiệm vụ đó thay vì sao chép sơ đồ trang.

Viết các mô tả phân biệt các liên kết liền kề. “Hướng dẫn xác thực—tạo khóa API, lưu trữ, và tiêu đề yêu cầu” hữu ích hơn “Xác thực.” Tránh các tính từ quảng cáo và các tuyên bố không được hỗ trợ. Tệp nên giúp một hệ thống thu thập chọn bằng chứng, vì vậy độ chính xác quan trọng hơn ngôn ngữ thương hiệu.

Chọn một nguồn sự thật cho nội dung. Nếu các tùy chọn Markdown được tạo ra từ các trang chuẩn, hãy ghi lại bộ sinh và xác minh tiêu đề, mã, bảng, liên kết, và thời gian cập nhật. Nếu các biên tập viên duy trì cả hai bằng tay, hãy thêm một quy trình đánh giá mà phát hiện sự khác biệt. Các bản sao mâu thuẫn làm yếu giá trị định hướng mà tệp dự định cung cấp.

Xác nhận hiện vật đã triển khai. Xác nhận đường dẫn gốc trả về phản hồi văn bản thuần túy hoặc Markdown thành công mà không có tường xác thực, chuyển hướng bất ngờ, hoặc trang lỗi đã được xử lý. Kiểm tra từng URL được liệt kê cho nội dung dự định của nó, không chỉ trạng thái HTTP. Trang phát triển của OpenAI phơi bày mục lục tài liệu theo dạng llms.txt, cung cấp một ví dụ cụ thể về một bản đồ tài liệu có thể đọc bằng máy.

Giới hạn và Hiểu Lầm Thường Gặp

llms.txt không kiểm soát việc thu thập hoặc đào tạo. Những chính sách đó thuộc về tài liệu cụ thể cho trình thu thập, robots.txt, hợp đồng, kiểm soát nền tảng, và luật áp dụng. Một liên kết trong llms.txt không nên được hiểu như một giấy phép hoặc như sự đồng ý cho mọi sử dụng phía dưới. Quyền truy cập và sử dụng là những câu hỏi tách biệt.

Tệp không thay thế các nguyên tắc cơ bản của công cụ tìm kiếm. Các trang vẫn cần URL ổn định, tiêu đề hữu ích, liên kết nội bộ, xử lý chuẩn, nội dung dễ đọc, và các kiểm soát lập chỉ mục phù hợp. Một công cụ AI có thể đến qua tìm kiếm, yêu cầu của người dùng trực tiếp, hành động của trình duyệt, hoặc một chỉ mục riêng mà không cần tham khảo llms.txt.

Sự lỗi thời có thể biến một bản đồ hữu ích thành nguồn lỗi. Các sản phẩm đã đổi tên, các điểm kết thúc đã bị loại bỏ, các trang đã chuyển, và các chính sách đã thay đổi cần cập nhật kịp thời. Tạo từ một đăng ký nội dung được duy trì nơi phù hợp, nhưng giữ việc xem xét của con người cho các mô tả và ưu tiên. Một bộ sinh có thể xác nhận sự tồn tại; nó không thể quyết định trang nào tốt nhất trả lời một nhiệm vụ của người dùng.

Kích thước bối cảnh vẫn quan trọng. Tệp llms-full.txt gộp toàn bộ trang web có thể quá lớn cho một khách hàng, lặp lại văn bản điều hướng, hoặc kết hợp các phiên bản không liên quan. Cung cấp các trang Markdown mô-đun và một bản đồ ngắn gọn trước. Để hệ thống thu thập chỉ chọn tài liệu cần thiết cho câu hỏi đang hoạt động.

Cách Đánh Giá một Triển Khai llms.txt

Kiểm tra việc hoàn thành nhiệm vụ, chứ không chỉ là sự hiện diện của tệp. Đưa cho một đại lý thu thập các câu hỏi đại diện và ghi lại các liên kết llms.txt mà nó chọn, liệu những trang đó có trả lời câu hỏi hay không, và liệu phản hồi cuối cùng có duy trì các trích dẫn hay không. So sánh cùng những nhiệm vụ với điều hướng thông thường hoặc việc khám phá sơ đồ trang.

Đo lường sức khỏe liên kết và độ chính xác mô tả. Theo dõi các URL hỏng, các chuyển hướng, các điểm đến trùng lắp, các chủ đề chuẩn bị thiếu, và các mô tả có thể áp dụng cho vài trang. Xem xét các phần tùy chọn riêng biệt để tài liệu thứ cấp không làm chật chội con đường tối thiểu cho người dùng mới.

Kiểm toán tính nhất quán giữa các biểu diễn HTML và Markdown. So sánh tiêu đề, các tiêu đề chính, mẫu mã, cảnh báo, và thông tin cập nhật lần cuối. Nơi các biểu diễn khác nhau cố ý, tài liệu quy tắc. Một bản sao Markdown sạch nên loại bỏ tiếng ồn trình bày mà không thay đổi âm nghĩa kỹ thuật.

Ghi lại hỗ trợ của người tiêu dùng một cách công khai. Một bài kiểm tra thành công với một trợ lý hoặc phân tích không chứng minh sự áp dụng chung. Ghi chú sản phẩm, phiên bản, chế độ thu thập, đường dẫn yêu cầu, và hành vi quan sát được. Điều này giữ cho thử nghiệm llms.txt không biến thành một tuyên bố rộng về tất cả các mô hình ngôn ngữ.

Kết luận

llms.txt là một bản đồ Markdown được đề xuất giúp các công cụ định hướng LLM tìm thấy nội dung hữu ích nhất của một trang web. Điểm mạnh của nó là sự chọn lọc: một tệp gốc dự đoán có thể giải thích trang web và hướng dẫn một khách hàng đến các trang cụ thể cho nhiệm vụ với ít chi phí khám phá hơn.

Tệp hoạt động song song với ngăn xếp web hiện tại. robots.txt thể hiện sở thích của trình thu thập, sơ đồ trang định danh các URL, HTML phục vụ người dùng, và các kiểm soát truy cập bảo vệ tài nguyên hạn chế. Duy trì llms.txt như một hiện vật điều hướng đã được thử nghiệm, và mô tả lợi ích của nó như hỗ trợ quan sát được thay vì điều trị AI được đảm bảo.

Sẵn sàng xác thực các Đường dẫn Nội dung Thân thiện với LLM?

Sử dụng Scrapeless Universal Scraping API để kiểm tra các trang công khai và định dạng phản hồi phía sau bản đồ llms.txt của bạn, sau đó giữ cho tệp đồng bộ với các nguồn chuẩn.

Đăng ký hôm nay và nhận $5 tín dụng miễn phíkhông cần thẻ tín dụng.

Nhận tín dụng $5 của bạn →

Câu hỏi thường gặp

Mục đích của llms.txt là gì?

llms.txt cung cấp một cái nhìn tổng quan ngắn gọn về Markdown và các liên kết được tuyển chọn mà có thể giúp các công cụ định hướng LLM tìm nội dung trang web đáng tin cậy vào thời điểm suy diễn.

llms.txt có phải là một tiêu chuẩn web chính thức không?

Đây là một đề xuất mở với các triển khai đang lớn mạnh, không phải là một tiêu chuẩn trình duyệt hoặc tìm kiếm toàn cầu. Cần kiểm tra hỗ trợ cho mỗi người tiêu dùng.

llms.txt có thay thế robots.txt không?

Không. llms.txt hỗ trợ tìm kiếm nội dung và định hướng, trong khi robots.txt thông báo sở thích truy cập của trình thu thập dữ liệu. Cả hai không thay thế xác thực cho nội dung riêng tư.

llms-full.txt là gì?

llms-full.txt là một tập hợp tùy chọn lớn hơn của nội dung hữu ích. Nó có thể giảm thiểu việc lấy lại thông tin cho các bộ tài liệu nhỏ nhưng có thể trở nên quá lớn hoặc lỗi thời trên các trang rộng.

llms.txt có cải thiện thứ hạng AI hoặc trích dẫn không?

Không có kết quả nào được đảm bảo. Tệp có thể làm cho nội dung được chọn dễ dàng khám phá hơn cho các công cụ hỗ trợ, trong khi mỗi hệ thống AI áp dụng quy trình lấy lại, lập chỉ mục và chọn nguồn riêng.

Tài liệu tham khảo