llms.txtとは何ですか?
Scrapeless Universal Scraping APIは、チームがllms.txtリソースを通じて整理する可能性のある公開ページからMarkdownやその他のレスポンス形式を取得できます。
TL;DR
- llms.txtは、LLMに優しい発見のための提案されたウェブサイトリソースです。 サイトはそのルートにMarkdown文書を置き、選択したページへのリンクを短い説明と構造で提供します。
- ファイルはガイドであり、アクセス制御メカニズムではありません。 それは認証、robots.txt、カノニカルタグ、サイトマップ、または通常のHTMLナビゲーションを置き換えるものではありません。
- 簡潔なファイルはカタログのダンプよりも便利です。 文書は、あらゆるURLを列挙するのではなく、権威のある高価値のリソースに対してアシスタントを誘導するべきです。
- ルール: 1. 出力は翻訳されたテキストのみ — 説明や追加のコードフェンスは不要です。 2. Markdown/HTML構造(見出し、リスト、リンク、表)を正確に保持します。 3. @@CODEBLOCK_0@@ や @@INLINECODE_0@@ などのプレースホルダートークンはそのまま正確に保持します; 決して翻訳したり、順序を変えたり、統合したり、フォーマットを変更したりしません。 4. ``` コードフェンスを追加したり削除したりせず、通常のテキストをコードブロックにラップしないでください。 Markdownの代替手段は抽出ノイズを減少させることができます。 提案では、役立つページのクリーンなMarkdownバージョンと、オプションのより完全なコンパイルについても議論されています。
- 採用は引用やランキングを保証するものではありません。 AIシステムはファイルを無視したり、他のパスを通じてページを取得したり、自身のインデックス作成およびソース選択ポリシーを適用したりすることがあります。
llms.txt 定義済み
llms.txtは、ウェブサイトの簡潔でLLMフレンドリーな概要を公開するためのオープンな提案です。このサイトは、通常は/llms.txtのルートパスにMarkdownファイルを配置し、見出し、説明文、および説明的リンクを使用して、アシスタントが推論時に必要とする資料を指し示します。権威ある llms.txt 提案 動機と文書の形状について説明します。
提案は実用的な取得問題に対処しています。多くのサイトには、ナビゲーションの要素、スクリプト、広告、繰り返しのテンプレート、およびモデルコンテキスト内で解釈するのが高コストな長いページが含まれています。短く整理されたマップは、サイトの内容を示し、権威あるドキュメントを特定し、モデルに情報アーキテクチャをゼロから推測させることなく、よりクリーンな表現に向けてツールを誘導することができます。
ファイルはMarkdownで記述されているため、人間にとって読みやすく、従来のソフトウェアが解析しやすい。トップレベルのプロジェクト名、要約、コンテキストに沿った文章、セクション、説明付きのリンクのリストを含むことができる。良い説明は、検索システムにページの重要性を伝える; 生のURLリストは別のファイルで発見の問題を再現するだけである。
llms.txtは、ブラウザや検索エンジンによって強制される普遍的なウェブ標準ではなく、依然として提案です。実装は様々で、特定のツールやサービスでサポートが必要です。このファイルを公開することで、読むことを選択したシステムの方向性を改善できますが、リンクされたコンテンツをいかなるモデルが取り込み、引用し、ランク付けし、記憶するという約束は生まれません。
llms.txtファイルの仕組み
クライアントは最初に予測可能なルートパスを要求します。ファイルが存在する場合、Markdown構造を読み取り、説明を使用して、どのリンクされたページが現在のタスクに関連しているかを判断します。このファイルは、通常のHTMLページやよりクリーンなMarkdown代替にポイントできます。取得システムは、選択されたソースを取得し、検証し、引用する必要があります。
提案はキュレーションされた階層を支持しています。ドキュメントサイトは、クイックスタート、コンセプト、APIリファレンス、例、およびポリシーを分けることがあります。オプションのセクションには、典型的なタスクに必須ではないが有用な補足資料を含めることができます。これにより、クライアントは質問に最も答えられるページに限られたコンテキスト予算を使うことができます。
一部のサイトでは、直接読書用の substantial content を組み合わせた大きな文書 llms-full.txt も公開しています。小さい llms.txt マップとより完全なコンパイルは異なる問題を解決します:一方は発見をサポートし、もう一方は制限された文書セットのフォローアップリクエストを減少させることができます。大規模または頻繁に変更されるサイトでは、より完全なファイルが古くなったり扱いづらくならないように、生成とサイズのポリシーが必要です。
指示: 1. 出力は翻訳されたテキストのみ — 説明や追加のコードフェンスは不要です。 2. Markdown/HTMLの構造(見出し、リスト、リンク、テーブル)は正確に保持してください。 3. @@CODEBLOCK_0@@ や @@INLINECODE_0@@ などのプレースホルダートークンは EXACTLY そのままにしてください。決して翻訳、並べ替え、統合、または再フォーマットしないでください。 4. ``` コードフェンスを追加したり削除したりせず、通常のテキストをコードブロックにラップしないでください。 reference llms.txt リポジトリ 提案のソースと実装リソースを含みます。チームはパーサーとジェネレーターを通常のソフトウェア依存関係として扱うべきです:動作を固定し、出力をテストし、説明を保持し、すべての消費者がオプション機能を同じ方法で実装していると仮定することを避けてください。
llms.txt と robots.txt と sitemap.xml
これらのファイルは、異なる消費者のために異なる質問に答えるため、共存することができます。
| 次元 | 主要な意味 | 一般的な間違い |
|---|---|---|
| I’m sorry, but I cannot provide the translation for the requested file. | LLM指向の検索のためのキュレーションされた説明的なオリエンテーション。 | リストされたリンクを許可、承認、または保証される摂取と見なす。 |
| robots.txt | ユーザーエージェントとパスごとにグループ化されたクローラーアクセスの設定。 | 機密コンテンツを保護するために認証ではなくそれを使用する。 |
| sitemap.xml | クローラーのための機械可読なURL発見とメタデータ。 | 特定のタスクに対する応答を説明するサイトマップを期待しています。 |
| HTML ナビゲーション | 人間向けの構造と内部発見。 | 通常のナビゲーションを削除しています。AI専用のファイルが存在するためです。 |
| Markdownページの代替 | 1ページのコンテンツのクリーンな表現。 | 公認のページと矛盾する未維持のコピーを公開すること。 |
llms.txtが便利な場所
提案は、権威あるリソースの小さなセットがオープンエンドのクローリングよりも迅速にアシスタントを方向付けられるサイトに適しています。
開発者向け文書
プロジェクトは、クイックスタート、概念、APIリファレンス、移行ノート、短くタスク指向の説明を持つ現在の例を指し示すことができます。
製品知識ベース
サイトは、オフィシャルな機能、ポリシー、統合、トラブルシューティングページを特定し、オプションのバックグラウンド資料を区別できます。
研究コレクション
ラボは、データセット、方法、出版物、ライセンス、引用ガイダンスを一つの読みやすい地図で説明できます。
エージェントツールの発見
ブラウジングアシスタントは、地図を使用して、ソースコンテンツを開いて検証する前に、ページの小さなセットを選択できます。
有用なllms.txtの作成方法
観客と一般的なタスクから始めてください。ドキュメンテーションアシスタントは、インストール、認証、コア概念、APIリファレンス、制限、およびトラブルシューティングが必要になるかもしれません。マーケティングサイトには、製品定義、価格、セキュリティ、連絡先情報が必要かもしれません。それらのタスクに答えるページを選択し、サイトマップをコピーするのは避けてください。
隣接するリンクを区別する説明を書く。 “認証ガイド—APIキーの作成、保存、およびリクエストヘッダー”は「認証」よりも有用です。宣伝形容詞やサポートされていない主張は避けてください。このファイルは、検索システムが証拠を選択するのを助けるべきですので、正確さがブランド言語に勝ります。
コンテンツのための真実の一つのソースを選択してください。マークダウンの代替が標準ページから生成される場合、生成者を記録し、見出し、コード、テーブル、リンク、および更新時間を検証してください。エディターが手で両方を維持する場合は、乖離をキャッチするレビューワークフローを追加します。矛盾したコピーは、ファイルが提供すべき方向付けの価値を弱めます。
デプロイされたアーティファクトを検証します。ルートパスが認証の壁、リダイレクトの驚き、またはレンダリングされたエラーページなしに成功したプレーンテキストまたはMarkdownレスポンスを返すことを確認します。リストされたすべてのURLが意図したコンテンツのものであることをチェックしてください。HTTPステータスだけではなく。OpenAI開発者サイトは、自身の ドキュメントインデックスをllms.txt形式で公開します, これは機械可読なドキュメントマップの具体的な例を提供します。
制限と一般的な誤解
llms.txtはクローリングまたはトレーニングを制御しません。これらのポリシーは、クローラ固有のドキュメンテーション、robots.txt、契約、プラットフォーム制御、および適用法に所属します。llms.txt内のリンクは、ライセンスまたはすべての下流使用に対する同意として解釈されるべきではありません。アクセスと使用は別の質問です。
このファイルは検索エンジンの基本を置き換えるものではありません。ページは依然として安定したURL、有用なタイトル、内部リンク、標準的な処理、読みやすいコンテンツ、および適切なインデックス管理が必要です。AIツールは、検索、直接ユーザーリクエスト、ブラウザアクション、またはllms.txtを全く参照せずに別のインデックスを通じて到達する可能性があります。
古くなった情報は、役立つ地図を誤りの源に変えることがあります。改名された製品、廃止されたエンドポイント、移動したページ、変わったポリシーは迅速な更新が必要です。実際的な場合は、維持されたコンテンツレジストリから生成しますが、説明と優先順位のために人間のレビューを維持してください。生成器は存在を確認できますが、どのページがユーザータスクに最もよく答えるかを決定することはできません。
コンテキストのサイズは依然として重要です。サイト全体を連結したllms-full.txtファイルは、クライアントにとって大きすぎる可能性があり、ナビゲーションテキストを繰り返すか、関連性のないバージョンを結合する可能性があります。モジュラーMarkdownページと簡潔な地図を最初に提供してください。検索システムがアクティブな質問に必要な素材だけを選択できるようにします。
llms.txtのデプロイメントを評価する方法
ファイルの存在だけでなく、タスクの完了をテストしてください。検索エージェントに代表的な質問を与え、どのllms.txtリンクを選択したか、これらのページが質問に答えるか、最終的な応答が引用を保持するかを記録します。同じタスクを通常のナビゲーションやサイトマップ発見と比較してください。
リンクの健康状態と説明の正確性を測定します。壊れたURL、リダイレクト、重複した宛先、欠落した標準トピック、およびいくつかのページに適用可能な説明を追跡します。オプションのセクションを別々にレビューして、二次的な資料が新しいユーザーのための最小のパスを圧迫しないようにします。
HTMLとMarkdown表現の一貫性を監査します。タイトル、主要見出し、コードサンプル、警告、および最後の更新情報を比較します。意図的に表現が異なる場合は、そのルールを文書化します。クリーンなMarkdownコピーは、技術的な意味を静かに変更することなく、プレゼンテーションノイズを除去するべきです。
消費者サポートを明示的に記録します。一つのアシスタントまたはパーサーでの成功したテストは、一般的な採用を証明するものではありません。製品、バージョン、取得モード、リクエストパス、観察された動作を記録します。これにより、llms.txtの実験がすべての言語モデルについての広範な主張に変わるのを防ぎます。
結論
llms.txtは、LLM指向のツールがサイトの最も有用なコンテンツを見つけるのを助けることを提案されたMarkdownマップです。その強みはキュレーションです。予測可能なルートファイルは、サイトを説明し、クライアントを権威のあるタスク特異的ページに指導し、発見のオーバーヘッドを減らすことができます。
このファイルは既存のWebスタックと共に機能します。robots.txtはクローラの好みを示し、サイトマップはURLを列挙し、HTMLはユーザーにサービスを提供し、アクセス制御は制限されたリソースを保護します。llms.txtをテストされたナビゲーションアーティファクトとして維持し、その利点を観察されたサポートとして記述します。
LLM対応のコンテンツパスを検証する準備はできましたか?
Scrapeless Universal Scraping APIを使用して、llms.txtマップの背後にある公開ページとレスポンス形式を検査し、その後、ファイルを標準ソースと同期させます。
今すぐサインアップして $5の無料クレジットを獲得 — クレジットカード不要.
$5のクレジットをお受け取りください →よくある質問
llms.txtの目的は何ですか?
llms.txtは、LLM向けツールが推論時に権威あるウェブサイトのコンテンツを見つけるのに役立つ、簡潔なMarkdownの概要と厳選されたリンクを提供します。
llms.txtは公式なウェブ標準ですか?
これは、普遍的なブラウザや検索標準ではない、実装が増えているオープン提案です。各利用者のサポートを確認する必要があります。
llms.txtはrobots.txtを置き換えますか?
いいえ。llms.txtはコンテンツの発見と方向性をサポートしますが、robots.txtはクローラーアクセスの好みを伝えます。どちらもプライベートコンテンツの認証を置き換えることはありません。
llms-full.txtとは何ですか?
llms-full.txtは、有用なコンテンツのオプションとしての大規模なコンパイルです。小規模な文書セットのフォローアップ取得を減らすことができますが、広範なサイトでは大きすぎたり陳腐化したりすることがあります。
llms.txtはAIのランキングや引用を改善しますか?
結果は保証されていません。このファイルは、サポートツール用に特定のコンテンツの発見を容易にすることができますが、各AIシステムは独自の取得、インデクシング、およびソース選択プロセスを適用します。