वापस ब्लॉग पर

एक एजेंटिक RAG पाइपलाइन कैसे बनाएं जिसमें लाइव वेब डेटा शामिल हो

Daniel Kim
Daniel Kim

Lead Scraping Automation Engineer

17-Aug-2026

TL;DR:

  • एजेंटिक RAG एक एजेंट को सबूत पुनर्प्राप्त करने का समय और तरीका तय करने देता है। पुनर्प्राप्ति लूप एक प्रश्न का पुनर्परिभाषित कर सकता है, एक अन्य स्रोत की जांच कर सकता है, सबूतों का मूल्यांकन कर सकता है, और स्पष्ट सीमाओं के अंतर्गत रुक सकता है।
  • लाइव वेब डेटा के लिए एक अलग अधिग्रहण परत की आवश्यकता है। ढूंढने से संभावित स्रोत मिलते हैं, ब्राउज़र रेंडरिंग क्लाइंट-साइड पृष्ठों को उजागर करती है, और सामान्यीकरण पृष्ठ की सामग्री को ट्रेस करने योग्य दस्तावेजों में बदलता है।
  • स्क्रेपलेस MCP सर्वर एक MCP क्लाइंट को खोज, पृष्ठ निकासी और क्लाउड-ब्राउज़र क्रियाओं के लिए एक उपकरण सतह देता है। एजेंट उन उपकरणों को कार्य से चुन सकता है बजाय इसके कि एक पुनर्प्राप्ति पथ को हार्ड-कोड किया जाए।
  • मूल्यांकन हर सीमा पर होना चाहिए। स्रोत की प्रासंगिकता, निकासी की पूर्णता, उद्धरण सहायता, उत्तर की गुणवत्ता, विलंबता, और लागत को स्वतंत्र रूप से मापें।

एजेंटिक RAG आर्किटेक्चर एक नज़र में

एक एजेंटिक RAG पाइपलाइन पुनर्प्राप्ति निर्णयों को एजेंट लूप के अंदर रखती है, न कि एक निश्चित पुनर्प्राप्त-फिर-उत्पन्न अनुक्रम चलाने के।

मूल पुनर्प्राप्ति-संवृद्धि पीढ़ी आर्किटेक्चर एक जनरेटर को पुनर्प्राप्त किए गए बाहरी मेमोरी के साथ जोड़ती है। एजेंटिक RAG उस आधार के चारों ओर योजना और उपकरणों का उपयोग जोड़ता है:

प्रश्न → योजना → खोज → रेंडर या प्राप्त करें → सामान्यीकरण → ग्रेड करें → स्टोर या उत्तर दें → उद्धृत करें

प्रत्येक तीर एक अनुबंध है। खोज उम्मीदवारों को लौटाती है, सत्य नहीं। रेंडरिंग पृष्ठ स्थिति लौटाती है, साफ रिकॉर्ड नहीं। एक वेक्टर स्टोर समान खंड लौटाता है, जरूरी नहीं कि पर्याप्त सबूत हों। एजेंट को केवल तब आगे बढ़ना चाहिए जब वर्तमान कलाकृति अगले चरण की जांच पास कर ले।

जब एजेंटिक RAG एक निश्चित पाइपलाइन को मात देता है

एजेंटिक RAG तब उपयोगी होता है जब पुनर्प्राप्ति की आवश्यकताएँ प्रश्न-दर-प्रश्न भिन्न होती हैं।

एक निश्चित पाइपलाइन आमतौर पर एक ज्ञात कॉर्पस के लिए सरल होती है जिसमें स्थिर खंडन और एक पुनर्प्राप्ति रणनीति होती है। एजेंटिक नियंत्रण अपनी लागत तब प्राप्त करता है जब एक प्रश्न को कई खोजों, स्रोत के तुलनात्मक अध्ययन, एक JavaScript-रेंडर की गई पृष्ठ, एक ताजगी जांच, या कमजोर सबूतों के बाद एक दूसरे पास की आवश्यकता हो सकती है।

ReAct शोध पैटर्न तर्क के निशान को क्रियाओं और अवलोकनों के साथ इंटरलीव करता है। एक पुनर्प्राप्ति प्रणाली में, वह पैटर्न एक सीमित लूप बन जाता है: एक उपकरण पर निर्णय लें, उसके आउटपुट की जांच करें, सबूत की स्थिति को अपडेट करें, और या तो आगे बढ़ें या रुकें।

एक एजेंट को केवल एक निश्चित अनुक्रम का नाम बदलने के लिए न जोड़ें। यदि प्रत्येक अनुरोध वही प्रश्न, पुनर्प्राप्तकर्ता, खंड की संख्या, और उत्तर संकेत का उपयोग करता है, तो एक साधारण RAG पाइपलाइन को परीक्षण और संचालन करना आसान होता है।

पूर्वापेक्षाएँ

एक एजेंटिक RAG निर्माण को एक काम करने वाले पुनर्प्राप्ति उपकरण परत की आवश्यकता होती है इससे पहले कि इसे एक मॉडल लूप की आवश्यकता हो।

  • Node.js और एक प्रोजेक्ट जो ECMAScript मॉड्यूल चलाने में सक्षम हो।
  • @modelcontextprotocol/sdk और scrapeless-mcp-server प्रोजेक्ट में स्थापित।
  • एक स्क्रेपलेस खाता और SCRAPELESS_KEY पर्यावरण चर।
  • अंतिम योजना और उत्तर-उत्पन्न लूप के लिए एक मॉडल प्रदाता कुंजी।
  • एक दस्तावेज़ स्टोर जो कैनोनिकल URL, शीर्षक, पुनर्प्राप्ति समय, सामग्री हैश, और खंड ऑफ़सेट को संरक्षित करता है।

नोट: नीचे दिए गए MCP क्लाइंट हैंडशेक के लिए SCRAPELESS_KEY की आवश्यकता है। पैकेज इंस्टॉलेशन चलाया गया था, जबकि ऑथेंटिकेटेड हैंडशेक और लाइव टूल कॉल एक पूर्वापेक्षा रह जाते हैं जब वह उत्पाद कुंजी रनटाइम में उपस्थित नहीं होती।

स्क्रेपलेस MCP सर्वर से कनेक्ट करें

स्क्रेपलेस MCP सर्वर किसी भी मानक-अनुरूप MCP क्लाइंट से एक स्थानीय stdio प्रक्रिया या होस्ट की गई स्ट्रीम करने योग्य HTTP एंडपॉइंट के माध्यम से कनेक्ट होता है।

सटीक क्लाइंट SDK और सर्वर पैकेज स्थापित करें:

bash Copy
pnpm add @modelcontextprotocol/sdk scrapeless-mcp-server

एक क्लाइंट बनाएं, stdio के माध्यम से कनेक्ट करें, उपकरण सतह की जांच करें, और परिवहन को साफ-सुथरी तरीके से बंद करें:

javascript Copy
import { Client } from "@modelcontextprotocol/sdk/client/index.js";
import { StdioClientTransport } from "@modelcontextprotocol/sdk/client/stdio.js";

const transport = new StdioClientTransport({
  command: "pnpm",
  args: ["exec", "scrapeless-mcp-server"],
  env: {
    ...process.env,
    SCRAPELESS_KEY: process.env.SCRAPELESS_KEY,
  },
});

const client = new Client(
  { name: "agentic-rag-client", version: "1.0.0" },
  { capabilities: {} },
);

await client.connect(transport);
const { tools } = await client.listTools();
console.log(tools.map((tool) => tool.name));

// Attach `tools` to the tool adapter used by your agent framework.

await client.close();

MCP जीवन चक्र विनिर्देशन सामान्य संचालन से पहले प्रारंभिककरण और क्षमता बातचीत को परिभाषित करता है। उपकरणों की सूची बनाना इसलिए सही धूम्रपान परीक्षण है: यह साबित करता है कि क्लाइंट और सर्वर ने एक एजेंट उन पर निर्भर करने से पहले प्रोटोकॉल हैंडशेक पूरा कर लिया।

स्क्रेपलेस MCP लॉन्च लेख सर्वर की भूमिका को कवर करता है, जबकि मास्ट्रा एकीकरण एक विशिष्ट एजेंट ढांचे से जुड़े उसी उपकरण सतह को दिखाता है।

आप वास्तव में इसका उपयोग कैसे करते हैं: पुनर्प्राप्ति एजेंट को संकेत दें

एजेंट को एक लक्ष्य, एक सबूत अनुबंध, और एक रुकने का नियम प्राप्त करना चाहिए।

एक उपयोगी संकेत ठोस है:

मौजूदा प्राथमिक स्रोत खोजें जो प्रश्न का उत्तर देते हैं। पहले खोजें, पृष्ठ को रेंडर करें केवल तब जब आवश्यक सामग्री प्राप्त प्रतिक्रिया से अनुपस्थित हो, प्रत्येक दावे के लिए कैनोनिकल URL रखें, उन स्रोतों को अस्वीकार करें जो उत्तर का सीधे समर्थन नहीं करते, और रुकें जब सबूत पर्याप्त हो या पुनर्प्राप्ति बजट समाप्त हो जाए।
सूचना स्रोत खोज को सबूत स्वीकार करने से अलग करती है। यह खुली समाप्ति ब्राउज़िंग लूप को भी रोकती है।

अनुकूलित करने के लिए प्रेरणाएँ

पुनर्प्राप्ति कार्य प्रेरणा बाधा
उत्पाद परिवर्तन ट्रैकिंग विक्रेता की अपनी रिलीज नोट और इसके प्रकाशन तिथि की आवश्यकता है
मानदंड अनुसंधान मानदंड निकाय को प्राथमिकता दें और अनुभाग यूआरएल को बनाए रखें
बाजार तुलना समान क्षेत्रों की आवश्यकता है और गायब मूल्यों को स्पष्ट रूप से दर्ज करें
तकनीकी समस्या निवारण आधिकारिक दस्तावेज़ और पुन: उत्पादक कॉन्फ़िगरेशन को प्राथमिकता दें

Scrapeless के साथ स्क्रैपिंग शुरू करें

Scrapeless के साथ अपने वेब स्क्रैपिंग और ऑटोमेशन वर्कफ़्लो को पावर अप करें!
आज ही साइन अप करें और $5 का मुफ्त क्रेडिट प्राप्त करें — कोई क्रेडिट कार्ड की आवश्यकता नहीं

अपने मुफ्त क्रेडिट का दावा करें Scrapeless Dashboard में।

Scrapeless Dashboard showing $5.00 in Team Credits

ताजगी के स्रोतों की खोज और प्रस्तुत करें

सीधा वेब पुनर्प्राप्ति सबसे सस्ती विश्वसनीय स्रोत से समृद्ध स्रोत तक बढ़ना चाहिए।

उम्मीदवार यूआरएल और स्निपेट्स इकट्ठा करने के लिए खोज के साथ शुरू करें। जब प्रतिक्रिया एचटीएमएल में उत्तर होता है तो साफ पृष्ठ सामग्री लाएं। ब्राउज़र रेंडरिंग का उपयोग केवल तब करें जब ग्राहक-पृष्ठ पर कार्यान्वयन प्रासंगिक पृष्ठ स्थिति को नियंत्रित करे। यह अधिग्रहण परत को तेज रखता है बिना यह दिखाए कि हर पृष्ठ स्थिर है।

प्रत्येक स्वीकार किए गए दस्तावेज़ के लिए एक पुनर्प्राप्ति लिफाफा रिकॉर्ड करें:

json Copy
{
  "canonicalUrl": "https://example.com/primary-source",
  "title": "Primary source title",
  "retrievedAt": "illustrative timestamp",
  "contentHash": "illustrative hash",
  "retrievalMethod": "search_then_render",
  "text": "Illustrative normalized page text"
}

ऊपर दिए गए मान एक संख्या का उदाहरण हैं; क्षेत्रों के लिए अनुबंध है। मूल यूआरएल को बनाए रखें भले ही मानकीकृत पाठ किसी अन्य स्टोर में चला जाए।

मानकीकरण, टुकड़े करना, और स्टोर करना

मानकीकरण पृष्ठ सामग्री को स्थिर दस्तावेज़ों में बदलता है बिना स्रोत को मिटाए।

दिशा-निर्देशों की नकल, अदृश्य यूआई क्रोम, और अप्रासंगिक बोइलरप्लेट को हटा दें। शीर्षकों, सूचियों, तालिकाओं और कोड सीमाओं को बनाए रखें क्योंकि वे अर्थ ले जाते हैं। टुकड़ों को बनाने से पहले कैनोनिकल यूआरएल और सामग्री हैश द्वारा डिडुप्लिकेट करें।

पहले दस्तावेज़ संरचना पर कुंडलित करें, फिर मॉडल के संदर्भ बाधाओं को लागू करें। प्रत्येक टुकड़े में दस्तावेज़ आईडी, कैनोनिकल यूआरएल, शीर्षक पथ, वर्ण अनुक्रमणिका, और पुनर्प्राप्ति समय को बनाए रखना चाहिए। Self-RAG अनुसंधान दिखाता है कि क्यों पुनर्प्राप्ति और आलोचना संकेत उत्पन्न प्रक्रिया में होना चाहिए न की अदृश्य पूर्व-प्रसंस्करण चरण के रूप में।

कच्चे मानकीकृत दस्तावेज़ों को एम्बेडिंग से अलग स्टोर करें। यह अलगाव टीम को एम्बेडिंग मॉडल या टुकड़ा नीति को बदलने की अनुमति देता है बिना हर स्रोत को फिर से लाए।

पुनर्प्राप्त करें, ग्रेड करें, और उत्तर दें

ग्रेडिंग चरण यह निर्धारित करता है कि पुनर्प्राप्त साक्ष्य अनुरोधित उत्तर का समर्थन कर सकता है या नहीं।

प्रत्येक उम्मीदवार को सीधेपन, स्रोत की प्राधिकरण, ताजगी, अन्य सबूतों के साथ सहमति, और निष्कर्षण की पूर्णता पर स्कोर करें। उच्च वेक्टर-समरूपता स्कोर यह साबित नहीं करता कि पाठ प्रश्न का उत्तर देता है।

उत्तर नोड को केवल स्वीकृत साक्ष्य प्राप्त करना चाहिए, प्रत्येक अनुच्छेद पर स्रोत पहचानकर्ताओं के साथ। यदि साक्ष्य अपर्याप्त हैं, तो एजेंट प्रश्न को पुनः-प्रारूपित करता है या किसी अन्य अधिग्रहण उपकरण का चयन करता है। यदि पुनर्प्राप्ति बजट समाप्त हो गया है, तो यह एक सीमित "अपर्याप्त साक्ष्य" परिणाम लौटाता है बजाय इसके कि अप्रतिबंधित मॉडल मेमोरी से अंतर को भर दे।

एकल-एजेंट बनाम मल्टी-एजेंट डिज़ाइन

एकल पुनर्प्राप्ति एजेंट डिफ़ॉल्ट होता है क्योंकि एक राज्य मशीन को ट्रेस करना आसान होता है।

वर्कफ़्लो को तब ही विभाजित करें जब भूमिकाएँ वास्तव में अलग उपकरणों, नीतियों, या मूल्यांकन मानदंडों के साथ होती हैं। एक एजेंट स्रोत अधिग्रहण का मालिक हो सकता है, दूसरा साक्ष्य ग्रेडिंग का और अंतिम एजेंट उत्तर संश्लेषण का। एक मल्टी-एजेंट डिज़ाइन समन्वय राज्य, डुप्लिकेट संदर्भ, और अधिक विफलता सीमाएं जोड़ता है, इसलिए प्रत्येक हैंडऑफ़ को एक स्पष्ट स्कीमा की आवश्यकता होती है।

जब वर्कफ़्लो को एक एजेंट की आवश्यकता होती है जो वेब उपकरणों का संचालन कर सके, तो Scrapeless AI Agent का उपयोग करें। जब मौजूदा एजेंट ढांचा पहले से ही योजना का स्वामित्व रखता है और केवल सीधे वेब क्षमताओं की आवश्यकता होती है, तो होस्ट किए गए एमसीपी एंडपॉइंट का उपयोग करें।

मूल्यांकन और प्रेक्षणीयता

एजेंटिक RAG मूल्यांकन को अधिग्रहण, पुनर्प्राप्ति, और उत्तर गुणवत्ता को अलग करना चाहिए।

ट्रैक करें कि क्या खोज ने अपेक्षित प्राथमिक स्रोत पाया, क्या रेंडरिंग ने आवश्यक सामग्री का खुलासा किया, क्या मानकीकरण ने सहायक अनुच्छेद को संरक्षित किया, क्या ग्रेडिंग ने सही साक्ष्य को स्वीकार किया, और क्या अंतिम दावा उस साक्ष्य द्वारा समर्थित है।

टूल का चयन, प्रश्न पुन: प्रारूपण, स्रोत यूआरएल, दस्तावेज़ हैश, टुकड़ा पहचानकर्ता, रोकने का कारण, व्यतीत समय, और लागत भी रिकॉर्ड करें। यह ट्रेस एक कमजोर उत्तर को निदान योग्य बनाता है। इसके बिना, प्रत्येक समस्या एक मॉडल समस्या की तरह लगती है।
समीक्षा Scrapeless प्राइसिंग को अपेक्षित खोज, फ़ेच और रेंडर मिश्रण के खिलाफ, और वर्तमान Scrapeless दस्तावेज़ीकरण के साथ MCP क्लाइंट सेटअप को संरेखित रखें।

निष्कर्ष: सबूत को एक प्रथम श्रेणी के आर्टिफैक्ट बनाएं

एक एजेंटिक RAG पाइपलाइन तब उपयोगी होती है जब पुनःप्राप्ति को अनुकूलित करना आवश्यक हो, लेकिन एजेंट लूप संविधानों की आवश्यकता को समाप्त नहीं करता है।

खोज, रेंडरिंग, सामान्यीकरण, ग्रेडिंग, और उत्पादन को प्रत्येक निरीक्षणीय आर्टिफैक्ट्स उत्पन्न करना चाहिए। पहले MCP टूल लेयर को कनेक्ट करें, हैंडशेक की सत्यापन करें, फिर पुनःप्राप्ति बजट और साक्ष्य आधारित रोकने के नियम के साथ मॉडल लूप जोड़ें।


एजेंटिक RAG पाइपलाइन बनाने के लिए तैयार?

हमारे समुदाय में शामिल हों एक मुफ्त योजना का दावा करने और उन डेवलपर्स के साथ कनेक्ट करने के लिए जो लाइव-वेब पुनर्प्राप्ति सिस्टम बना रहे हैं: Discord · Telegram.

app.scrapeless.com पर साइन अप करें और मॉडल-चालित योजना लूप जोड़ने से पहले Scrapeless MCP टूल लेयर को कनेक्ट करें।


सामान्य प्रश्न

प्रश्न: एजेंटिक RAG क्या है?

एजेंटिक RAG एक पुनर्प्राप्ति-सशक्त उत्पादन डिज़ाइन है जिसमें एक एजेंट पुनर्प्राप्ति क्रियाओं का चयन करता है, साक्ष्य का मूल्यांकन करता है, और यह तय करता है कि जारी रखा जाए या उत्तर दिया जाए। यह लूप स्पष्ट उपकरण, समय, और लागत सीमाओं के तहत संचालित होता है।

प्रश्न: एजेंटिक RAG मानक RAG से कैसे अलग है?

मानक RAG सामान्यतः उत्पादन से पहले एक निश्चित पुनर्प्राप्ति चरण चलाता है, जबकि एजेंटिक RAG प्रश्नों को पुनःफार्मुलेट कर सकता है, विभिन्न उपकरणों का चयन कर सकता है, परिणामों को ग्रेड कर सकता है, और एक और सीमित पुनर्प्राप्ति चरण कर सकता है।

प्रश्न: क्या एजेंटिक RAG के लिए एक वेक्टर डेटाबेस की आवश्यकता है?

एजेंटिक RAG को एक वेक्टर डेटाबेस की आवश्यकता नहीं होती है। एजेंट कीवर्ड खोज, संरचित डेटाबेस, लाइव वेब टूल, या हाइब्रिड पुनर्प्राप्तकर्ता का उपयोग कर सकता है जब तक कि साक्ष्य संविदा स्पष्ट हो।

प्रश्न: RAG पाइपलाइन में लाइव वेब डेटा का उपयोग क्यों करें?

लाइव वेब डेटा उपयोगी है जब उत्तर उस जानकारी पर निर्भर करता है जो मॉडल के प्रशिक्षण कटऑफ के बाद या एक स्थिर आंतरिक कॉर्पस के बाहर बदलती है। पाइपलाइन को स्रोत यूआरएल और पुनर्प्राप्ति मेटाडेटा को संरक्षित करना चाहिए ताकि ताजगी का ऑडिट किया जा सके।

प्रश्न: MCP एजेंटिक RAG प्रणाली में क्या जोड़ता है?

MCP ग्राहक को सर्वर टूल खोजने और कॉल करने के लिए एक मानक जीवनचक्र प्रदान करता है। Scrapeless MCP सर्वर उस टूल सीमा के माध्यम से खोज, पृष्ठ निष्कर्षण, और ब्राउज़र क्रियाओं को उजागर करता है।

प्रश्न: क्या एजेंट को हर स्रोत को ब्राउज़र में रेंडर करना चाहिए?

नहीं। एजेंट को केवल तब एक स्रोत को रेंडर करना चाहिए जब प्रतिक्रिया सामग्री आवश्यक जानकारी को उजागर नहीं करती है या एक इंटरएक्शन आवश्यक है। HTTP-प्रथम पुनर्प्राप्ति पाइपलाइन को तेज और संचालित करने के लिए आसान रखता है।

प्रश्न: आप अंतहीन पुनर्प्राप्ति लूप को कैसे रोकते हैं?

उपकरण कॉल, बीता समय, स्वीकृत स्रोत, प्रश्न पुनःफार्मुलेशन, और कुल लागत पर सीमाएँ निर्धारित करें। रोकने की नीति “अपर्याप्त सबूत” परिणाम को अनुमति देनी चाहिए।

प्रश्न: क्या मल्टी-एजेंट डिज़ाइन एजेंटिक RAG के लिए बेहतर है?

मल्टी-एजेंट डिज़ाइन केवल तभी बेहतर होता है जब अलग-अलग भूमिकाओं को विशिष्ट उपकरणों, नीतियों, या मूल्यांकन मानदंडों की आवश्यकता होती है। एक एजेंट के साथ शुरुआत करें और स्पष्ट सीमा दिखने के बाद भूमिकाओं को विभाजित करें।

स्क्रैपलेस में, हम केवल सार्वजनिक रूप से उपलब्ध डेटा का उपयोग करते हैं, जबकि लागू कानूनों, विनियमों और वेबसाइट गोपनीयता नीतियों का सख्ती से अनुपालन करते हैं। इस ब्लॉग में सामग्री केवल प्रदर्शन उद्देश्यों के लिए है और इसमें कोई अवैध या उल्लंघन करने वाली गतिविधियों को शामिल नहीं किया गया है। हम इस ब्लॉग या तृतीय-पक्ष लिंक से जानकारी के उपयोग के लिए सभी देयता को कोई गारंटी नहीं देते हैं और सभी देयता का खुलासा करते हैं। किसी भी स्क्रैपिंग गतिविधियों में संलग्न होने से पहले, अपने कानूनी सलाहकार से परामर्श करें और लक्ष्य वेबसाइट की सेवा की शर्तों की समीक्षा करें या आवश्यक अनुमतियाँ प्राप्त करें।

सबसे लोकप्रिय लेख

सूची