कैसे लाइव वेब डेटा स्रोतों से RAG पाइपलाइन बनाएं

कैसे वेब डेटा से RAG पाइपलाइन बनाएं

स्क्रेपलेस वेब अनलॉकर और क्रॉल सार्वजनिक वेब सामग्री एकत्र करते हैं जिसे टीमें एक RAG पाइपलाइन के भीतर सामान्यीकृत, अनुक्रमित और पुनः प्राप्त कर सकती हैं।

TL;DR

  • RAG में दो पाइपलाइन हैं। एक अनुक्रमण पथ स्रोत सामग्री तैयार करता है, जबकि एक क्वेरी पथ साक्ष्य पुनः प्राप्त करता है और इसे(generator) पीढ़ी में देता है।
  • वेब अधिग्रहण गुणवत्ता अधिकतम सीमा निर्धारित करती है। खाली оболियाँ, नेविगेशन क्रोम, डुप्लिकेट और गायब मेटाडेटा बाद में पुनर्प्राप्ति की समस्याएँ बन जाते हैं।
  • टुकड़ों को पहचान की आवश्यकता होती है। हर टुकड़े को इसकी कैनोनिकल URL, दस्तावेज़ संस्करण, शीर्षक पथ और संग्रहण समय बनाए रखना चाहिए।
  • पीढ़ी से पहले पुनर्प्राप्ति की आवश्यकता है। आखिरी शब्दों के निर्णय से पहले यह मापें कि सही साक्ष्य पाया गया था या नहीं।
  • ताजगी एक नीति है। अद्यतन लय, परिवर्तन का पता लगाना, हटाना और पुनः अनुक्रमण स्रोत उतार-चढ़ाव और व्यवसाय की आवश्यकता के अनुसार होना चाहिए।

यह विषय क्यों मायने रखता है

एक पुनर्प्राप्ति-स्थायी पीढ़ी पाइपलाइन एक भाषा मॉडल को उत्तर समय पर एक बाहरी ज्ञान संग्रह तक पहुँच देती है। मूल पुनर्प्राप्ति-स्थायी पीढ़ी का पेपर पैरामीट्रिक मॉडल ज्ञान और पुनः प्राप्त गैर-पैरामीट्रिक मेमोरी के संयोजन को औपचारिक रूप से निर्धारित करता है। वेब डेटा के लिए व्यावहारिक वास्तुकला एम्बेडिंग से पहले शुरू होती है: प्रणाली को अनुमति प्राप्त पृष्ठों का पता लगाना, उनकी वास्तविक सामग्री लाना, अप्रासंगिक क्रोम को हटाना, प्रामाणिकता बनाए रखना और यह तय करना चाहिए कि प्रत्येक स्रोत को कब अद्यतन किया जाना चाहिए।

सामान्य डेमो कुछ दस्तावेज़ अपलोड करता है और एक प्रश्न पूछता है। एक उत्पादन वेब RAG प्रणाली को कैनोनिकल URLs, बार-बार की जाने वाली टेम्पलेट्स, जावास्क्रिप्ट रेंडरिंग, रीडायरेक्स, सामग्री अद्यतन, हटाई गई पृष्ठों और एक-दूसरे का विरोध करने वाले अंशों को संभालना होगा। मॉडल केवल उन टुकड़ों को देखता है जो इस पाइपलाइन में जीवित रहते हैं। अगर उन टुकड़ों में पुराना या उनके स्रोत से अलग हैं, तो एक मजबूत मॉडल गायब साक्ष्य को पुनर्निर्माण नहीं कर सकता।

एक वेब RAG प्रणाली के दो हिस्से

ऑफ़लाइन या असिंक्रोनस हिस्सा अनुक्रमण पाइपलाइन है। यह दस्तावेज़ों को खोजता है, सामग्री प्राप्त करता है, अर्थपूर्ण पाठ को पार्स करता है, पहचानकर्ताओं को सौंपता है, दस्तावेजों को पुनर्प्राप्त करने योग्य इकाइयों में विभाजित करता है, खोज प्रतिनिधित्व बनाता है और उन्हें अनुक्रमणिका में लिखता है। ऑफ़लाइन शब्द सापेक्ष है: एक अक्सर बदलने वाला स्रोत दिनभर फिर से संसाधित किया जा सकता है, लेकिन अनुक्रमणन अभी भी उपयोगकर्ता के प्रश्न से अलग है।

ऑनलाइन हिस्सा एक प्रश्न के साथ शुरू होता है। यह इरादे को वर्गीकृत कर सकता है, पहुँच फ़िल्टर लागू कर सकता है, प्रश्न को फिर से लिख सकता है, कीवर्ड या वेक्टर पुनर्प्राप्ति चला सकता है, परिणामों को एकीकृत कर सकता है और उम्मीदवारों को फिर से रैंक कर सकता है। OpenAI वेक्टर एम्बेडिंग दस्तावेज़ीकरण पुनर्प्राप्ति कार्यों के लिए उपयोगी वेक्टर अभिव्यक्तियों के रूप में एम्बेडिंग का वर्णन करता है, लेकिन केवल वेक्टर समानता यह सिद्ध नहीं करती है कि कोई अंश प्रश्न का उत्तर देता है। मेटाडेटा फ़िल्टर, शब्दावली मिलान, पुनः रैंकिंग, और स्रोत-गुणवत्ता नियम अक्सर समान महत्व रखते हैं।

जनरेटर को जानबूझकर सीमित साक्ष्य पैकेज प्राप्त होता है। अच्छे प्रॉम्प्ट स्रोत पाठ को निर्देशों से अलग करते हैं, आपूर्ति किए गए सामग्री के लिए उद्धरण की आवश्यकता होती है, और स्पष्ट रूप से अपर्याप्त-साक्ष्य उत्तर की अनुमति देते हैं। इसके बाद एप्लिकेशन उद्धरण लक्ष्यों को मान्य करता है और उपयोग किए गए अंशों को रिकॉर्ड करता है। इससे अंतिम दावे से टुकड़े, दस्तावेज़, और कैनोनिकल पृष्ठ तक एकTrace बनता है।

वेब डेटा अनुक्रमण चरण

  • स्रोत खोजें। साइटमैप, क्यूरेटेड URL सूचियों, फ़ीड, या अनुमत खोज परिणामों से शुरू करें; रिकॉर्ड करें कि प्रत्येक पृष्ठ वृत्‍त में क्यों है।
  • सामग्री प्राप्त करें। स्थिर पृष्ठों को सीधे लाएँ और केवल उन स्थानों पर रेंडर्ड अधिग्रहण का उपयोग करें जहाँ क्लाइंट-पक्ष की सामग्री सामग्री साक्ष्य को बदलती है।
  • दस्तावेज़ सामान्यीकृत करें। नेविगेशन पुनरावृत्ति, कुकी पैनल, स्क्रिप्ट, और डुप्लिकेट टेम्पलेट्स को हटा दें जबकि शीर्षक, सूचियाँ, तालिकाएँ, और लिंक संदर्भ को बनाए रखते हैं।
  • प्रामाणिकता के साथ टुकड़े करें। साक्ष्य को जोड़कर सुसंगत अंश बनाएं और कैनोनिकल URL, शीर्षक, शीर्षक पथ, भाषा, पहुँच दायरा, हैश, और संग्रहण समय संलग्न करें।
  • अनुक्रमण और संस्करण। स्थिर दस्तावेज़ पहचानकों के तहत शब्दावली और वेक्टर प्रतिनिधित्व लिखें ताकि बदले हुए और हटाए गए सामग्री को समेटा जा सके।

टुकड़ों और पुनर्प्राप्ति के निर्णय

सर्वश्रेष्ठ सेटिंग्स दस्तावेज़ के आकार और प्रश्न के प्रकार पर निर्भर करती हैं। प्रत्येक विकल्प को एक परखे जाने वाले अनुमान के रूप में मानें न कि एक सार्वभौमिक स्थायी के रूप में।

निर्णयउपयोगी डिफ़ॉल्टक्या परीक्षण करना है
टुकड़ा सीमाशीर्षक-जानकारी वाले अंशक्या उत्तरों को आसन्न अनुभागों के बीच संदर्भ विभाजन की आवश्यकता है।
टुकड़े का आकारएक सुसंगत विचारवास्तविक प्रश्नों पर पुनः प्राप्ति, उद्धरण सटीकता, और प्रॉम्प्ट लागत।
खोज विधिहाइब्रिड लेक्सिकल और वेक्टरसटीक पहचानकर्ता, पर्यायवाची, दुर्लभ शर्तें, और प्राकृतिक-भाषा इरादा।
पुनर्वर्गीकरणछोटा उम्मीदवार सेटक्या शीर्ष साक्ष्य प्रश्न का समर्थन करता है बजाय कि केवल शब्दावली साझा करने के।
ताजगीस्रोत-विशिष्ट कार्यक्रमपरिवर्तन आवृत्ति, फ़ेच लागत, कानूनी पुनर्निधारण, और व्यावसायिक प्रभाव।

सत्यापनीय चरणों में पाइपलाइन बनाएं

हर चरण को अपने इनपुट, आउटपुट, और परीक्षण उपकरण के साथ लागू करें। यह पर retrieval miss को बिना हर विफलता के लिए मॉडल को दोषी ठहराए diagnosable बनाता है।

  1. कोरपस अनुबंध परिभाषित करें। स्वीकृत डोमेन, पृष्ठ प्रकार, भाषाएँ, अपवाद, स्वामित्व, पुनर्निधारण नियम, और प्रश्न सूची बनाएं जिनका कोरपस उत्तर देनी है।
  2. कैनोनिकल दस्तावेज़ आईडी बनाएं। URLs को सावधानी से सामान्यीकृत करें, कैनोनिकल संकेतों का सम्मान करें, और उन पृष्ठों को मर्ज करने से बचें जिनका स्थानीयकरण, उत्पाद, या संस्करण उनका अर्थ बदल देता है।
  3. संरचित संदर्भ को संरक्षित करें। शीर्षकों, तालिका संबंधों, कोड सीमाओं, और नज़दीकी लिंक लेबल्स को बनाए रखें। प्लेन-टेक्स्ट फ्लैटेनिंग संक्षिप्त तकनीकी सामग्री के अर्थ को नष्ट कर सकती है।
  4. लेबल वाला प्रश्न सेट बनाएं। प्रतिनिधि प्रश्न लिखें और उन अंशों की पहचान करें जो प्रत्येक उत्तर का समर्थन करना चाहिए। उत्तर देने योग्य, अस्पष्ट, और उत्तर न देने योग्य मामलों को शामिल करें।
  5. परिवर्तन मेल सुरक्षा जोड़ें। सामग्री हैश की तुलना करें, बदले गए भागों को अणु रूप से प्रतिस्थापित करें, हटाए गए दस्तावेज़ों को हटा दें, और पूर्व के उत्तरों को स्पष्ट करने के लिए पर्याप्त संस्करण इतिहास बनाए रखें।

उत्तर गुणवत्ता से पहले पुनर्प्राप्ति का मूल्यांकन करें।

एक प्रवाही उत्तर एक पुनर्प्राप्ति मिस को छिपा सकता है, और एक कमजोर शब्दों वाला उत्तर अभी भी उत्तम साक्ष्य प्राप्त कर सकता है। चरणों को अलग-अलग स्कोर करें, फिर पूर्ण उपयोगकर्ता परिणाम का मूल्यांकन करें।

  • कोरपस कवरेज। क्या अनुक्रमित संग्रह में प्रत्येक समर्थित प्रश्न वर्ग के लिए प्राधिकृत दस्तावेज़ है?
  • पुनर्प्राप्ति पुनः कॉल। क्या उम्मीदवार सेट में एक अंश शामिल है जो अपेक्षित उत्तर का समर्थन करता है?
  • रैंकिंग सटीकता। क्या समर्थन करने वाले अंश केवल संबंधित या डुप्लिकेट टेक्स्ट से ऊपर रखे जाते हैं?
  • उद्धरण समर्थन। क्या प्रत्येक उद्धृत अंश के साथ जुड़े विशेष दावे को शामिल करता है?
  • उत्तर संयम। क्या सिस्टम उस उत्तर को अस्वीकार या योग्य करता है जब कोरपस में पर्याप्त साक्ष्य की कमी होती है?

वेब-विशिष्ट विफलता मोड

वेब सामग्री अविश्वसनीय इनपुट है HTTP अर्थशास्त्र विनिर्देश।अधिग्रहण कोड को होस्ट, सामग्री-प्रकार, आकार, और पुनर्निर्देशन नियमों को लागू करना चाहिए इससे पहले कि सामग्री पार्सिंग या मॉडल चरणों तक पहुंचे।

  • टेम्पलेट प्रदूषण। दोहराए गए शीर्षक और फ़ुटर समानता खोज पर हावी होते हैं और उस पैराग्राफ को भीड़ देते हैं जिसमें उत्तर होता है।
  • डुप्लिकेट पहचान। ट्रैकिंग पैरामीटर और वैकल्पिक पथ एक पृष्ठ के लिए कई रिकॉर्ड बनाते हैं, साक्ष्य कोinflate करते हैं बिना स्वतंत्र समर्थन जोड़े।
  • निर्देश संदूषण। एक पृष्ठ में मॉडल के लिए प्रयोजित निर्देश शामिल हो सकते हैं। स्रोत पाठ को उद्धृत साक्ष्य के रूप में संग्रहीत करें और इसे पुनर्प्राप्ति या प्रणाली नीति पर नियंत्रण नहीं दें।
  • पुरानी एम्बेडिंग। कच्चे पाठ को अद्यतन करना बिना उसके वेक्टर प्रतिनिधित्व को प्रतिस्थापित करने से इंडेक्स आंतरिक रूप से असंगत रहता है।
  • असमर्थित संश्लेषण। जनरेटर व्यक्तिगत रूप से सत्यापित अंशों को एक निष्कर्ष में जोड़ सकता है जो कोई स्रोत नहीं बताता। दावा स्तर के उद्धरण जाँचें उस अंतर को पकड़ें।

वेब RAG पैटर्न

डॉक्यूमेंटेशन सहायक

संस्करण मेटाडेटा के साथ अनुमोदित उत्पाद और नीति पृष्ठों को अनुक्रमित करें ताकि उत्तर वर्तमान अनुभाग की ओर इंगित करें।

अनुसंधान कार्यक्षेत्र

प्राथमिक स्रोत एकत्र करें, अंशों को संरक्षित करें, और विश्लेषकों को पृष्ठ की ट्रेल खोये बिना स証ों की तुलना करने दें।

ज्ञान का समर्थन करें

सार्वजनिक मार्गदर्शन को पहुंच-नियंत्रित आंतरिक सामग्री के साथ संयोजित करें जबकि पुनर्प्राप्ति समय पर स्रोत अनुमतियों को लागू करें।

परिवर्तन-गृह्य ब्रीफिंग

महत्वपूर्ण पृष्ठ अपडेट का पता लगाएं, प्रभावित खंडों को फिर से अनुक्रमित करें, और पुराने और नए संस्करणों में जमीनी सारांश उत्पन्न करें।

पायलट से उत्पादन तक

वेब डेटा के लिए RAG पाइपलाइन का उपयोगी पायलट रिकॉर्ड-के-रिकॉर्ड निरीक्षण के लिए इतना छोटा होना चाहिए। शुरू करें कॉर्पस अनुबंध को परिभाषित करें: अनुमोदित डोमेन, पृष्ठ प्रकार, भाषाएँ, exclusions, स्वामित्व, निर्भाग नियम, और प्रश्न जो कॉर्पस को उत्तर देने चाहिए की सूची बनाएं। फिर लागू करें कैनोनिकल दस्तावेज़ आईडी बनाएँ: URLs को सावधानीपूर्वक मानकीकरण करें, कैनोनिकल संकेतों का सम्मान करें, और उन पृष्ठों को मिश्रित करने से बचें जिनका स्थान, उत्पाद या संस्करण उनका अर्थ बदलता है। पहले मूल्यांकन सेट को जानबूझकर मिश्रित रखें, जिसमें सामान्य मामले, अस्पष्ट मामले, गायब स証, और एक क्रिया जो प्रणाली को अस्वीकार करना या सौंपना चाहिए शामिल है। यह दर्शाता है कि क्या कार्यप्रवाह अपनी सीमा को समझता है इससे पहले कि उच्च मात्रा डिज़ाइन की गलतियों को सामूहिक मैट्रिक्स के अंदर छिपा दें।

उत्पादन तत्परता के लिए हर माप और कलाकृति के लिए एक मालिक की आवश्यकता होती है। ट्रैक करें कॉर्पस कवरेज उत्तर देने के लिए कि क्या अनुक्रमित संग्रह में प्रत्येक समर्थित प्रश्न वर्ग के लिए प्राधिकृत दस्तावेज़ है? ट्रैक करें पुनर्प्राप्ति पुनःकाल यह निर्धारित करने के लिए कि क्या उम्मीदवार सेट में एक अंश शामिल है जो अपेक्षित उत्तर का समर्थन करता है? जोड़ें रैंकिंग सटीकता ताकि टीम देख सके कि क्या समर्थन अंश केवल संबंधित या दुहराए गए पाठ से ऊपर रखे गए हैं? ये माप अंतर्निहित रिकॉर्ड से जुड़े होने चाहिए न कि केवल डैशबोर्ड टोटल के रूप में मौजूद होना चाहिए। एक समीक्षक को एक बदलते मीट्रिक से उस सटीक क्वेरी, स्रोत, अवलोकन, या क्रिया पर जाना चाहिए जिसने इसे उत्पन्न किया।

ऑपरेशनल नियंत्रणों को उन विफलता मोड को लक्षित करना चाहिए जो व्यापार निर्णय को बदलने की संभावना सबसे अधिक हैं। पहला समीक्षा नियम को कवर करना चाहिए टेम्पलेट प्रदूषण: दोहराए गए शीर्ष और पैराग्राफ समानता खोज पर हावी होते हैं और उस पैराग्राफ को बाहर निकाल देते हैं जिसमें उत्तर मौजूद है। निष्कासन समीक्षा को कवर करना चाहिए असहाय संश्लेषण: जनरेटर व्यक्तिगत रूप से सत्यापित अंशों को एक निष्कर्ष में जोड़ सकता है जो कोई स्रोत नहीं बताता। दावा स्तर के उद्धरण जाँचें उस अंतर को पकड़ें। एक प्रतिक्रिया मालिक को असाइन करें, परिभाषित करें कि कौन सा साक्ष्य समस्या को हल करता है, और रिकॉर्ड करें कि क्या परिणाम डेटा, प्रम्पट्स, टूल, अनुमतियाँ, या स्रोत नीति को बदलता है। वह रिकॉर्ड उसी दोष को फिर से खोजने से रोकता है जो एक अज्ञात गुणवत्ता उतार-चढ़ाव के रूप में प्रकट होता है।

पायलट की भविष्यवाणी के बाद विस्तार करें। एक टीम अनुमोदित उत्पाद और नीति पृष्ठों के अनुक्रमण के लिए दस्तावेज़ सहायक के साथ शुरू कर सकती है ताकि उत्तर वर्तमान अनुभाग की ओर इंगित करें। एक दूसरा चरण अनुसंधान कार्यक्षेत्र जोड़ सकता है, जहां कार्यप्रवाह प्राथमिक स्रोत एकत्र करना, अंशों को संरक्षित करना, और विश्लेषकों को पृष्ठ की ट्रेल खोये बिना स証ों की तुलना करने देना चाहिए। मूल परीक्षण सेट को चलाते रहें जैसे-जैसे दायरा बढ़ता है। नए स्रोत, बाजार, टूल, और अनुमतियाँ एक सीमा पर एक समय में पेश की जानी चाहिए ताकि पुनर्स्थापनाएँ एक विशिष्ट परिवर्तन में निर्धारित की जा सकें न कि एक साथ मंच का पुनर्लेखन।

निष्कर्ष

एक वेब RAG पाइपलाइन सफलता होती है जब अधिग्रहण, सामान्यीकरण, पुनर्प्राप्ति, और उत्पादन एक ही उत्पत्ति मॉडल साझा करते हैं। हर उत्तर एक खंड तक, हर खंड एक संस्करणित दस्तावेज़ तक, और हर दस्तावेज़ एक अनुमति प्राप्त स्रोत तक पहुंचना चाहिए। वह श्रृंखला वेक्टर डेटाबेस के चयन से अधिक महत्वपूर्ण है।

एक छोटा सा कॉर्पस बनाएँ जो एक वास्तविक प्रश्न सेट को कवर करता है, लेबल वाले उदाहरणों पर पुनर्प्राप्ति का मूल्यांकन करें, और विस्तार से पहले ताजगी नियम जोड़ें। वेब स्केल प्रबंधनीय हो जाता है जब प्रत्येक नया स्रोत एक ही पहचान, साक्ष्य, और रद्दीकरण अनुबंध का पालन करता है।

क्या आप एक ताजा वेब कॉर्पस बनाने के लिए तैयार हैं?

Scrapeless Web Unlocker और Crawl का उपयोग करें सार्वजनिक पृष्ठों को अधिग्रहित करने के लिए जिनका प्रारूप कोरोन खोज पर अनुक्रमित और सामान्यीकृत किया जा सकता है।

आज साइन अप करें और प्राप्त करें $5 का निःशुल्क क्रेडिटकोई क्रेडिट कार्ड की आवश्यकता नहीं है.

अपने $5 क्रेडिट का दावा करें →

अक्सर पूछे जाने वाले प्रश्न

न्यूनतम वेब RAG आर्किटेक्चर क्या है?

न्यूनतम आर्किटेक्चर में अधिग्रहण, सफाई, छंटाई, अनुक्रमणिका, पुनर्प्राप्ति, जनरेटर, और उद्धरण भंडारण होता है। इसे स्थिर दस्तावेज़ पहचानकर्ता भी चाहिए ताकि अपडेट अनियंत्रित डुप्लिकेट न बनाएं।

क्या सभी वेब पृष्ठों को ब्राउज़र रेंडरिंग की आवश्यकता है?

नहीं। उन पृष्ठों के लिए सीधे पुनर्प्राप्ति का उपयोग करें जिनका अर्थपूर्ण सामग्री प्रतिक्रिया में आता है। केवल तब रेंडर किया गया पथ का उपयोग करें जब जावास्क्रिप्ट, इंटरैक्शन, या सत्र की स्थिति कॉर्पस द्वारा आवश्यक सामग्री को बदल दे।

एक वेब RAG अनुक्रमणिका को कितनी बार ताज़ा किया जाना चाहिए?

स्रोत की अस्थिरता और पुराने उत्तरों की लागत के अनुसार ताज़ा करें। उत्पाद उपलब्धता को बार-बार जांचने की आवश्यकता हो सकती है, जबकि स्थिर मानक दस्तावेज़ शायद ही कभी बदलता है। परिवर्तन का पता लगाना अपरिवर्तित पृष्ठों को फिर से संसाधित करने से बचाता है।

क्या RAG के लिए वेक्टर खोज पर्याप्त है?

आम तौर पर नहीं। सटीक नाम, पहचानकर्ता, और उद्धृत वाक्यांश अक्सर शब्दार्थीय प्रश्नों के लिए लेकिन शब्दार्थ प्रश्नों से लाभ लेते हैं। हाइब्रिड पुनर्प्राप्ति और पुनः रैंकिंग को लेबल किए गए प्रश्नों के खिलाफ परीक्षण किया जाना चाहिए।

हटे हुए वेब सामग्री को कैसे संभाला जाना चाहिए?

स्रोत को अनुपलब्ध के रूप में चिह्नित करें, इसके सक्रिय खंडों को हटा दें या संगरोध करें, और केवल नीति द्वारा अनुमत इतिहास रखें। उत्तर को उस सामग्री का उल्लेख नहीं करना चाहिए जिसे वर्तमान कॉर्पस अब अधिकृत नहीं करता।

संदर्भ