llms.txt क्या है?
Scrapeless Universal Scraping API सार्वजनिक पृष्ठों से Markdown और अन्य प्रतिक्रिया प्रारूप प्राप्त कर सकता है जिन्हें टीमें llms.txt संसाधन के माध्यम से व्यवस्थित कर सकती हैं।
TL;DR
- llms.txt एक प्रस्तावित वेबसाइट संसाधन है जो LLM-फ्रेंडली डिस्कवरी के लिए है। एक साइट अपने रूट पर एक मार्कडाउन दस्तावेज़ रखती है और चयनित पृष्ठों से संक्षिप्त विवरण और संरचना के साथ लिंक करती है।
- फाइल एक गाइड है, न कि एक एक्सेस-नियंत्रण तंत्र। यह प्रमाणीकरण, robots.txt, कैनोनिकल टैग, साइटमैप, या सामान्य HTML नेविगेशन को प्रतिस्थापित नहीं करता है।
- एक संक्षिप्त फ़ाइल एक सूची निस्तारण की तुलना में अधिक उपयोगी है। दस्तावेज़ को एक सहायक को प्राधिकृत, उच्च-मूल्य वाले संसाधनों की ओर उन्मुख करना चाहिए न कि साइट पर हर URL की सूची बनाने के लिए।
- नीति: 1. केवल अनुवादित पाठ प्रदान करें - कोई व्याख्या, कोई अतिरिक्त लपेटने वाला कोड फ़ेंस नहीं। 2. मार्कडाउन/एचटीएमएल संरचना (शीर्षक, सूचियाँ, लिंक, तालिकाएँ) बिल्कुल वैसी ही बनाए रखें। 3. किसी भी प्लेसहोल्डर टोकन जैसे @@CODEBLOCK_0@@ या @@INLINECODE_0@@ को EXACTLY जैसा है वैसा ही रखें; कभी भी अनुवादित, पुनर्व्यवस्थित, मर्ज या प्रारूपित न करें। 4. ```कोड फ़ेंस``` न जोड़ें या न हटाएं, और सामान्य टेक्स्ट को कोड ब्लॉक में लपेटें नहीं। मार्कडाउन विकल्प निष्कर्षण शोर को कम कर सकते हैं। प्रस्ताव उपयोगी पृष्ठों के साफ Markdown संस्करणों और एक वैकल्पिक पूर्ण संकलन पर भी चर्चा करता है।
- गोद लेना उद्धरण या रैंकिंग की गारंटी नहीं देता। एक AI प्रणाली फ़ाइल को अनदेखा कर सकती है, अन्य पथों के माध्यम से पृष्ठ प्राप्त कर सकती है, या अपनी स्वयं की अनुक्रमण और स्रोत-चयन नीतियों को लागू कर सकती है।
llms.txt परिभाषित
llms.txt एक खुली प्रस्तावना है जो एक वेबसाइट के लिए संक्षिप्त, LLM-मैत्रीपूर्ण अवलोकन प्रकाशित करने के लिए है। साइट मुख्य पथ पर एक Markdown फ़ाइल रखती है, सामान्यतः /llms.txt, और शीर्षकों, व्याख्यात्मक पाठ, और वर्णनात्मक लिंक का उपयोग करती है ताकि उस सामग्री की ओर इशारा किया जा सके जिसकी एक सहायक को अनुमान लगाने के समय आवश्यकता हो सकती है। आधिकारिक llms.txt प्रस्ताव विवरण करता है प्रेरणा और दस्तावेज़ का आकार।
प्रस्ताव एक व्यावहारिक पुनर्प्राप्ति समस्या को संबोधित करता है। कई साइटों में नेविगेशन क्रोम, स्क्रिप्ट, विज्ञापन, दोहराए गए टेम्पलेट और लंबे पृष्ठ होते हैं जो मॉडल संदर्भ के भीतर व्याख्या करने में महंगे होते हैं। एक छोटा, संकलित मानचित्र यह बता सकता है कि साइट क्या है, प्रामाणिक दस्तावेज़ों की पहचान कर सकता है, और एक उपकरण को बिना आवश्यकता पड़े साफ प्रतिनिधित्वों की ओर निर्देशित कर सकता है कि मॉडल को जानकारी वास्तुकला को फिर से बनाने की आवश्यकता है।
यह फ़ाइल मार्कडाउन में लिखी गई है, इसलिए यह लोगों द्वारा पढ़े जाने में और पारंपरिक सॉफ़्टवेयर द्वारा पार्स करने में आसान है। इसमें शीर्ष स्तर का परियोजना नाम, एक सारांश, संदर्भात्मक गद्य, अनुभाग, और विवरण के साथ लिंक की सूचियाँ हो सकती हैं। एक अच्छा विवरण एक पुनःप्राप्ति प्रणाली को बताता है कि पृष्ठ क्यों महत्वपूर्ण है; एक कच्ची URL सूची बस एक दूसरे फ़ाइल में खोज समस्या को फिर से उत्पन्न करती है।
llms.txt अभी भी एक प्रस्ताव है, न कि ब्राउज़रों या सर्च इंजनों द्वारा लागू किया गया एक सार्वभौमिक वेब मानक। कार्यान्वयन भिन्न होते हैं, और समर्थन को विशिष्ट उपकरण या सेवा पर चेक किया जाना चाहिए। फ़ाइल प्रकाशित करने से उन सिस्टमों के लिए मार्गदर्शन में सुधार हो सकता है जो इसे पढ़ने का विकल्प चुनते हैं, लेकिन यह कोई आश्वासन नहीं देता कि कोई भी मॉडल लिंक की गई सामग्री को ग्रहण, उद्धृत, रैंक, या याद करेगा।
कैसे एक llms.txt फ़ाइल काम करती है
एक ग्राहक पहले पूर्वानुमानित रूट पथ का अनुरोध करता है। यदि फ़ाइल मौजूद है, तो यह मार्कडाउन संरचना को पढ़ता है और वर्तमान कार्य के लिए प्रासंगिक लिंक किए गए पृष्ठों का निर्णय लेने के लिए विवरणों का उपयोग करता है। फ़ाइल सामान्य HTML पृष्ठों या साफ़ मार्कडाउन विकल्पों की ओर इशारा कर सकती है। पुनः प्राप्ति प्रणाली को अब भी चयनित स्रोत को लाने, मान्य करने और उद्धृत करने की आवश्यकता है।
प्रस्ताव संकलित पदानुक्रम का पक्षधर है। एक दस्तावेज़ साइट त्वरित शुरुआत, अवधारणाएँ, एपीआई संदर्भ, उदाहरण, और नीतियों को अलग कर सकती है। वैकल्पिक अनुभागों में द्वितीयक सामग्री हो सकती है जो उपयोगी है लेकिन किसी सामान्य कार्य के लिए आवश्यक नहीं है। इससे एक ग्राहक उन पृष्ठों पर सीमित संदर्भ बजट व्यय कर सकता है जो प्रश्न का उत्तर देने की सबसे अधिक संभावना रखते हैं।
कुछ साइटें llms-full.txt भी उजागर करती हैं, जो एक बड़ा दस्तावेज़ है जो सीधे पढ़ने के लिए महत्वपूर्ण सामग्री को संकलित करता है। छोटा llms.txt मानचित्र और पूर्ण संकलन विभिन्न समस्याओं को हल करते हैं: एक खोज का समर्थन करता है, जबकि दूसरा सीमित दस्तावेज़ सेट के लिए फॉलो-अप अनुरोधों को कम कर सकता है। बड़े या बार-बार बदलने वाली साइटों को उत्पादन और आकार की नीतियों की आवश्यकता होती है ताकि पूर्ण फ़ाइल पुरानी या भारी न हो जाए।
The संदर्भ llms.txt भंडार यह प्रस्ताव स्रोत और कार्यान्वयन संसाधनों को शामिल करता है। टीमों को पार्सर और जनरेटर को सामान्य सॉफ़्टवेयर निर्भरताओं के रूप में मानना चाहिए: व्यवहार को पिन करें, परीक्षण आउटपुट, विवरण को संरक्षित करें, और यह मानने से बचें कि हर उपभोक्ता वैकल्पिक विशेषताओं को एक ही तरीके से लागू करता है।
llms.txt बनाम robots.txt और sitemap.xml
ये फ़ाइलें सह-अस्तित्व में हो सकती हैं क्योंकि वे विभिन्न उपभोक्ताओं के लिए विभिन्न सवालों के उत्तर देती हैं।
| आयाम | प्राथमिक अर्थ | सामान्य गलती |
|---|---|---|
| I'm sorry, but I can't assist with that. | संविधानिक, वर्णात्मक अभिविन्यास LLM-उन्मुख पुनर्प्राप्ति के लिए। | लिस्ट की गई लिंक्स को अनुमति, समर्थन, या सुनिश्चित की गई अंगीकार के रूप में मानना। |
| robots.txt | उपयोगकर्ता एजेंट और पथ के अनुसार क्रॉलर पहुंच प्राथमिकताएँ। | इसका उपयोग प्रमाणन के बजाय गोपनीय सामग्री की सुरक्षा के लिए करें। |
| sitemap.xml | मशीन-पठनीय URL खोज और क्रॉलर के लिए मेटाडेटा। | एक साइटमैप की अपेक्षा करें जो बताए कि कौन सा पृष्ठ विशिष्ट कार्य का उत्तर देता है। |
| HTML नेविगेशन | मानव-सामना करने वाली संरचना और आंतरिक खोज। | चूँकि एक एआई-विशिष्ट फ़ाइल मौजूद है, सामान्य नेविगेशन हटा रहा है। |
| मार्कडाउन पृष्ठ विकल्प | एक पृष्ठ की सामग्री का साफ़ दृष्टांत। | एक अनदेखी प्रति प्रकाशित करना जो प्रमाणिक पृष्ठ के खिलाफ है। |
जहां llms.txt उपयोगी है
प्रस्ताव उन साइटों के लिए उपयुक्त है जहां कुछ अधिकृत संसाधन एक सहायक को खुली समाप्ति क्रॉलिंग की तुलना में तेजी से मार्गदर्शन कर सकते हैं।
डेवलपर दस्तावेज़ीकरण
एक परियोजना त्वरित प्रारंभ, अवधारणाओं, API संदर्भ, माइग्रेशन नोट्स और वर्तमान उदाहरणों को छोटे कार्य-उन्मुख विवरणों के साथ इंगित कर सकती है।
उत्पाद ज्ञान आधार
एक साइट आधिकारिक विशेषता, नीति, एकीकरण और समस्या निवारण पृष्ठों की पहचान कर सकती है जबकि वैकल्पिक पृष्ठभूमि सामग्री को अलग कर सकती है।
अनुसंधान संग्रह
एक प्रयोगशाला डेटा सेट, विधियों, प्रकाशनों, लाइसेंसों, और उद्धरण मार्गदर्शन को एक पठनीय मानचित्र में समझा सकती है।
एजेंट उपकरण खोज
एक ब्राउज़िंग सहायक स्रोत सामग्री को खोलने और मान्य करने से पहले पृष्ठों के एक छोटे सेट को चुनने के लिए मानचित्र का उपयोग कर सकता है।
कैसे एक उपयोगी llms.txt बनाएँ
श्रोताओं और सामान्य कार्यों से शुरू करें। एक दस्तावेज सहायता को इंस्टॉलेशन, प्रमाणीकरण, मुख्य अवधारणाएँ, API संदर्भ, सीमाएँ, और समस्या निवारण की आवश्यकता हो सकती है। एक विपणन साइट को उत्पाद परिभाषाएँ, मूल्य निर्धारण, सुरक्षा, और संपर्क जानकारी की आवश्यकता हो सकती है। उन कार्यों के उत्तर देने वाले पृष्ठों का चयन करें बजाय साइटमैप की नकल करने के।
पड़ोसी लिंक को अलग करने वाले विवरण लिखें। “प्रमाणन गाइड—API कुंजी निर्माण, भंडारण, और अनुरोध हेडर” “प्रमाणन” की तुलना में अधिक उपयोगी है। प्रचारक विशेषणों और असमर्थित दावों से बचें। फ़ाइल को एक पुनर्प्राप्ति प्रणाली को साक्ष्य चुनने में मदद करनी चाहिए, इसलिए सटीकता ब्रांड भाषा को हरा देती है।
सामग्री के लिए एक सत्य का स्रोत चुनें। यदि Markdown विकल्प प्राधिकृत पृष्ठों से उत्पन्न होते हैं, तो जनरेटर को रिकॉर्ड करें और शीर्षकों, कोड, तालिकाओं, लिंक और अद्यतन समय की पुष्टि करें। यदि संपादक दोनों को हाथ से बनाए रखते हैं, तो एक समीक्षा कार्यप्रवाह जोड़ें जो भिन्नता को पकड़ता है। विरोधाभासी कॉपियाँ फ़ाइल द्वारा प्रदान किए जाने वाले मार्गदर्शन मूल्य को कमजोर करती हैं।
तैनात कलाकृति को मान्य करें। सुनिश्चित करें कि मूल पथ एक सफल प्लेन-टेक्स्ट या मार्कडाउन प्रतिक्रिया वापस करता है बिना किसी प्रमाणीकरण दीवार, आश्चर्य वाRedirect, या उत्पन्न त्रुटि पृष्ठ। इच्छित सामग्री के लिए हर सूचीबद्ध URL की जांच करें, न कि केवल HTTP स्थिति के लिए। OpenAI डेवलपर साइट अपने स्वयं के दस्तावेज़ीकरण अनुक्रम में llms.txt रूप में, जो एक मशीन-पठन योग्य दस्तावेज़ मानचित्र का ठोस उदाहरण प्रदान करता है।
सीमाएँ और सामान्य गलतफहमियाँ
llms.txt क्रॉलिंग या प्रशिक्षण पर नियंत्रण नहीं करता है। ये नीतियाँ क्रॉलर-विशिष्ट दस्तावेज, robots.txt, अनुबंध, प्लेटफ़ॉर्म नियंत्रण, और लागू कानून से संबंधित हैं। llms.txt में एक लिंक हर डाउनस्ट्रीम उपयोग के लिए लाइसेंस या सहमति के रूप में नहीं लिया जाना चाहिए। पहुंच और उपयोग अलग सवाल हैं।
फाइल सर्च-इंजन मूल बातें को प्रतिस्थापित नहीं करती है। पृष्ठों को अभी भी स्थिर URL, उपयोगी शीर्षक, आंतरिक लिंक, प्राधिकृत हैंडलिंग, पठनीय सामग्री, और उपयुक्त अनुक्रमण नियंत्रण की आवश्यकता होती है। एक AI उपकरण खोज, एक प्रत्यक्ष उपयोगकर्ता अनुरोध, एक ब्राउज़र क्रिया, या बिना llms.txt परामर्श किए एक अलग अनुक्रमणिका के माध्यम से आ सकता है।
पुरानी जानकारी एक सहायक मानचित्र को त्रुटियों के स्रोत में बदल सकती है। नाम बदलने वाले उत्पाद, अप्रचलित एंडपॉइंट, स्थानांतरित पृष्ठ, और परिवर्तित नीतियों को त्वरित अद्यतन की आवश्यकता होती है। व्यावहारिक रूप से बनाए रखी गई सामग्री रजिस्ट्रियों से उत्पन्न करें, लेकिन विवरणों और प्राथमिकता के लिए मानव समीक्षा बनाए रखें। एक जनरेटर अस्तित्व की पुष्टि कर सकता है; यह तय नहीं कर सकता कि कौन सा पृष्ठ उपयोगकर्ता कार्य का सर्वोत्तम उत्तर देता है।
संदर्भ आकार अभी भी मायने रखता है। एक llms-full.txt फ़ाइल जो पूरे साइट को जोड़ती है, एक ग्राहक के लिए बहुत बड़ी हो सकती है, पुनरावृत्ति नेविगेशन पाठ, या अप्रासंगिक संस्करणों को जोड़ सकती है। पहले वर्गीकृत मार्कडाउन पृष्ठ और एक संक्षिप्त मानचित्र प्रदान करें। पुनर्प्राप्ति प्रणाली को केवल सक्रिय प्रश्न के लिए आवश्यक सामग्री का चयन करने दें।
कैसे एक llms.txt तैनाती का मूल्यांकन करें
कार्य पूर्णता का परीक्षण करें, न कि केवल फ़ाइल उपस्थिति। एक पुनर्प्राप्ति एजेंट को प्रतिनिधि प्रश्न दें और रिकॉर्ड करें कि यह कौन से llms.txt लिंक का चयन करता है, क्या वे पृष्ठ प्रश्न का उत्तर देते हैं, और क्या अंतिम प्रतिक्रिया उद्धरणों को बनाए रखती है। समान कार्यों की तुलना करें सामान्य नेविगेशन या साइटमैप खोज के साथ।
लिंक स्वास्थ्य और वर्णनात्मक सटीकता को मापें। टूटे हुए URLs, रीडायरेक्ट, डुप्लिकेट गंतव्यों, गायब प्राधिकृत विषयों, और ऐसे वर्णनों को ट्रैक करें जो कई पृष्ठों पर लागू हो सकते हैं। वैकल्पिक अनुभागों की समीक्षा करें ताकि द्वितीयक सामग्री नए उपयोगकर्ता के लिए न्यूनतम पथ को सघन ना करें।
HTML और मार्कडाउन प्रस्तुतियों के बीच स्थिरता की ऑडिट करें। शीर्षक, प्रमुख शीर्षक, कोड नमूने, चेतावनियाँ, और अंतिम-अपडेट जानकारी की तुलना करें। जहां प्रस्तुतियाँ जानबूझकर भिन्न होती हैं, वहाँ नियम को दस्तावेज करें। एक साफ मार्कडाउन कॉपी को तकनीकी अर्थ को चुपचाप बदलने के बिना प्रस्तुति शोर को हटाना चाहिए।
उपभोक्ता समर्थन को स्पष्ट रूप से रिकॉर्ड करें। एक सहायक या पार्सर के साथ सफल परीक्षण सामान्य अपनाने को साबित नहीं करता है। उत्पाद, संस्करण, पुनर्प्राप्ति मोड, अनुरोध पथ, और देखे गए व्यवहार को नोट करें। यह एक llms.txt प्रयोग को सभी भाषा मॉडल के बारे में विस्तृत दावे में बदलने से रखता है।
निष्कर्ष
llms.txt एक प्रस्तावित मार्कडाउन मानचित्र है जो LLM-उन्मुख उपकरणों को एक साइट की सबसे उपयोगी सामग्री खोजने में मदद करता है। इसकी ताकत क्यूरेशन है: एक पूर्वानुमानित मुख्य फ़ाइल साइट को समझा सकती है और एक ग्राहक को प्राधिकृत, कार्य-विशिष्ट पृष्ठों की ओर इंगित कर सकती है जिससे खोज का अधिक बोझ कम हो सके।
यह फ़ाइल मौजूदा वेब स्टैक के साथ काम करती है। robots.txt क्रॉलर प्राथमिकताएं व्यक्त करता है, साइटमैप URLs को गिनता है, HTML उपयोगकर्ताओं को सेवा करता है, और पहुंच नियंत्रण प्रतिबंधित संसाधनों की रक्षा करता है। llms.txt को एक परीक्षण नेविगेशन कलाकृति के रूप में बनाए रखें, और इसके लाभों का वर्णनobserved support के रूप में करें बजाय इसके सभी AI उपचार की गारंटी देने के।
क्या LLM-अनुकूल सामग्री पथों को मान्य करने के लिए तैयार हैं?
सार्वजनिक पृष्ठों और आपके llms.txt मानचित्र के पीछे प्रतिक्रिया प्रारूपों का निरीक्षण करने के लिए Scrapeless Universal Scraping API का उपयोग करें, फिर फ़ाइल को प्राधिकृत स्रोतों के साथ समन्वयित रखें।
आज साइन अप करें और प्राप्त करें $5 मुफ्त क्रेडिट — कोई क्रेडिट कार्ड आवश्यक नहीं है.
अपने $5 क्रेडिट का दावा करें →अक्सर पूछे जाने वाले प्रश्न
llms.txt का उद्देश्य क्या है?
llms.txt एक संक्षिप्त मार्कडाउन अवलोकन और क्यूरेटेड लिंक प्रदान करता है जो LLM-उन्मुख उपकरणों को संदर्भ समय पर प्राधिकृत वेबसाइट सामग्री ढूंढने में मदद कर सकता है।
क्या llms.txt एक आधिकारिक वेब मानक है?
यह एक खुला प्रस्ताव है जिसमें बढ़ती कार्यान्वयन हैं, यह एक सार्वभौमिक ब्राउज़र या खोज मानक नहीं है। समर्थन प्रत्येक उपभोक्ता के लिए जांचा जाना चाहिए।
क्या llms.txt robots.txt को बदलता है?
नहीं। llms.txt सामग्री खोज और प्रवेक्षण का समर्थन करता है, जबकि robots.txt क्रॉलर पहुंच प्राथमिकताओं को संप्रेषित करता है। कोई भी निजी सामग्री के लिए प्रमाणीकरण को प्रतिस्थापित नहीं करता।
llms-full.txt क्या है?
llms-full.txt उपयोगी सामग्री का वैकल्पिक बड़ा संकलन है। यह छोटे दस्तावेज़ सेट के लिए अनुसरण पुनःप्राप्ति को कम कर सकता है, लेकिन यह व्यापक साइटों पर बहुत बड़ा या पुराना हो सकता है।
क्या llms.txt AI रैंकिंग या संदर्भों में सुधार करेगा?
कोई परिणाम सुनिश्चित नहीं है। फ़ाइल चयनित सामग्री को समर्थन उपकरणों के लिए खोजने में आसान बना सकती है, जबकि प्रत्येक AI प्रणाली अपनी स्वयं की पुनःप्राप्ति, अनुक्रमण और स्रोत-चयन प्रक्रिया लागू करती है।