एक एआई एजेंट वेब का उपयोग कैसे करता है?
स्क्रेपलेस एजेंट ब्राउज़र एआई एजेंटों को सार्वजनिक वेब पृष्ठों की खोज, रेंडरिंग, पढ़ने और बातचीत के लिए एक प्रबंधित ब्राउज़र रनटाइम देता है।
TL;DR
- एक एजेंट उपकरणों के माध्यम से वेब का उपयोग करता है। मॉडल बाउंडेड सर्च, फेच, ब्राउज़र, एक्सट्रैक्शन, या क्रिया कॉल में से चुनता है; एप्लिकेशन कोड उन्हें निष्पादित करता है।
- खोज और ब्राउज़िंग विभिन्न नौकरियों को हल करते हैं। खोज उम्मीदवार स्रोतों का पता लगाती है, जबकि एक ब्राउज़र पृष्ठ खोलता है, जावास्क्रिप्ट को रेंडर करता है, और सत्र की स्थिति को बनाए रखता है।
- अवलोकन अगले कदम को चलाते हैं। हर परिणाम, पृष्ठ स्थिति, त्रुटि, या निकाली गई फ़ील्ड एजेंट के अगले निर्णय के लिए इनपुट बन जाती है।
- साक्ष्य को कार्यप्रवाह से जीवित रहना चाहिए। URLs, अंश, स्क्रीनशॉट, टाइमस्टैम्प, और उपकरण के आउटपुट अंतिम उत्तर की समीक्षा योग्य बनाते हैं।
- अधिकार मॉडल के बाहर रहता है। अनुमति सूची, अनुमोदन, बजट, स्कीमाएँ, और रोकने की शर्तें निर्धारित करती हैं कि एजेंट क्या कर सकता है।
यह विषय महत्वपूर्ण क्यों है
एक एआई एजेंट वेब तक कठिनाई से सोचकर नहीं पहुंचता। यह वेब तक इसलिए पहुंचता है क्योंकि एक होस्ट एप्लिकेशन उसे परिभाषित इनपुट और आउटपुट वाले उपकरण देता है। OpenAI वेब खोज दस्तावेज़ वेब खोज को एक उपकरण के रूप में वर्णित करता है जो एक मॉडल को वर्तमान स्रोत सामग्री लौटा सकता है। एक ब्राउज़र उपकरण एक और परत जोड़ता है: यह चयनित पृष्ठ को लोड कर सकता है, रेंडर की गई इंटरफ़ेस का अवलोकन कर सकता है, और अनुमत क्रियाएँ कर सकता है। मॉडल अगला क्या होना चाहिए, का प्रस्ताव करता है, लेकिन आसपास की प्रणाली क्रेडेंशियल्स, नेटवर्किंग, निष्पादन, और नीति प्रवर्तन का स्वामित्व रखती है।
एक उपयोगी मानसिक मॉडल एक लूप है: लक्ष्य को समझें, एक उपकरण चुनें, परिणाम का अवलोकन करें, स्थिति को अपडेट करें, और तय करें कि कार्य पूरा हुआ या नहीं। लूप एक खोज कॉल या कई ब्राउज़र क्रियाओं तक चल सकता है। विश्वसनीय प्रणाली प्रत्येक संक्रमण को स्पष्ट बनाती हैं। वे लंबे क्लिक की श्रृंखला को एक अस्पष्ट घटना के रूप में नहीं मानती हैं, और वे अनुमति नहीं देती हैं कि एक संभावित अंतिम वाक्य रास्ते में एकत्रित कमजोर या लापता साक्ष्य को मिटा दे।
वेब-उपयोग लूप
वेब-उपयोग लूप एक कार्य अनुबंध से शुरू होता है। अनुबंध उद्देश्य, अनुमति प्राप्त साइटें, स्वीकार्य डेटा, आवश्यक साक्ष्य, और स्थितियों का नाम रखता है जो एक व्यक्ति को हस्तक्षेप करने की आवश्यकता होती है। एक अनुसंधान कार्य केवल सार्वजनिक पठन की अनुमति दे सकता है। एक खाता कार्य नेविगेशन की अनुमति दे सकता है लेकिन एक प्रस्तुतिकरण से पहले अनुमोदन की आवश्यकता हो सकती है। ये सीमाएं एक खुले अंत वाले संकेत को काम में बदल देती हैं जिसे परखा जा सकता है।
फिर एजेंट एक छोटे क्षमता सेट में से चुनता है। फ़ंक्शन कॉलिंग एक सामान्य मॉडल-मुखी पैटर्न प्रदान करती है: स्कीमाएँ उपलब्ध संचालन का वर्णन करती हैं, और मॉडल संरचित तर्क उत्पन्न करता है बजाय इसके कि खुद कोड निष्पादित करे। OpenAI फ़ंक्शन कॉलिंग दस्तावेज़ उस विभाजन को स्पष्ट करता है। खोज, सीधे HTTP पुनर्प्राप्ति, ब्राउज़र नेविगेशन, एक्सट्रैक्शन, और फ़ाइल लेखन अलग-अलग उपकरण बने रहने चाहिए क्योंकि इनके साथ अलग-अलग लागतें, जोखिम, और साक्ष्य होते हैं।
निष्पादन के बाद, उपकरण एक अवलोकन लौटाता है। एक खोज उपकरण क्रमबद्ध उम्मीदवारों और स्रोत URLs को लौटाता है। एक फेच उपकरण पृष्ठ सामग्री और प्रतिक्रिया मेटाडेटा लौटाता है। एक ब्राउज़र स्क्रीनशॉट, DOM स्नैपशॉट, पहुंच पेड़, वर्तमान URL, या क्रिया परिणाम लौटाता है। एजेंट उस अवलोकन की तुलना लक्ष्य से करता है, उपयोगी स्थिति को रिकॉर्ड करता है, और या तो रुक जाता है या दूसरे बाउंडेड क्रिया को चुनता है। यह अवलोकन-क्रिया चक्र वह व्यावहारिक अर्थ है जिसका एक एजेंट वेब का उपयोग करता है।
एक एजेंट द्वारा जोड़े गए पांच क्षमताएँ
- खोजें। एक प्रश्न बनाएं, उम्मीदवार स्रोत पुनर्प्राप्त करें, परिणाम क्रम को बनाए रखें, और किसी भी उत्पन्न उपप्रश्न के साथ मूल प्रश्न को रखें।
- अर्जित करें। HTTP क्लाइंट या रेंडर्ड ब्राउज़र के माध्यम से चुने गए स्रोत को खोलें, जावास्क्रिप्ट, सत्र, और इंटरएक्शन की जरूरतों के आधार पर।
- समझें। अंश, संस्थाएँ, लिंक, तालिकाएँ, या संरचित फ़ील्ड बिना URL और पृष्ठ संदर्भ को खोए निकालें जो उन्हें समर्थन करते हैं।
- क्रिया करें। केवल तभी क्लिक करें, टाइप करें, स्क्रॉल करें, अपलोड करें, या एक API कॉल करें जब कार्य अनुबंध उस क्रिया की श्रेणी को अधिकृत करता है।
- सत्यापन करें। अंतिम URL, आवश्यक फ़ील्ड, स्रोत समर्थन, और पूर्णता की स्थिति की जांच करें इससे पहले कि एजेंट सफलता घोषित करे।
जो सबसे हल्का वेब उपकरण फिट करे उसे चुनें।
उपकरण चयन पृष्ठ व्यवहार और कार्य का पालन करना चाहिए, न कि ब्राउज़र स्वचालन के प्रति एक पसंद। एक हल्की पुनर्प्राप्ति पथ संचालन में आसान है जब यह उस साक्ष्य को लौटाता है जिसकी आवश्यकता होती है।
| ज़रूरत | सर्वश्रेष्ठ प्रारंभिक उपकरण | कारण |
|---|---|---|
| संबंधित पृष्ठ खोजें | खोज API | बिना हर पृष्ठ खोले क्रमबद्ध उम्मीदवारों और स्रोत URLs को लौटाता है। |
| एक स्थिर सार्वजनिक पृष्ठ पढ़ें | प्रत्यक्ष फेच या वेब अनलॉक करने वाला | जब रेंडर्ड इंटरएक्शन आवश्यक नहीं है तो ब्राउज़र स्थिति से बचता है। |
| एक क्लाइंट-रेंडर्ड इंटरफेस पढ़ें | एजेंट ब्राउज़र | JavaScript निष्पादित करता है और अंतिम प्रस्तुत किए गए राज्य को उजागर करता है। |
| एक बहु-चरण इंटरफ़ेस पूरा करें | नीति जांचों के साथ एजेंट ब्राउज़र | क्रियाओं के बीच टैब, कुकीज़ और पृष्ठ स्थिति को बनाए रखता है। |
| एक ज्ञात व्यवसाय संचालन को कॉल करें | टाइप की गई फ़ंक्शन या API | दृश्यमान रूप से नियंत्रण स्थानांतरित करने के बजाय एक स्थिर स्कीमा का उपयोग करता है। |
एक विश्वसनीय एजेंट-वेब कार्यप्रवाह डिजाइन करें
एक विश्वसनीय कार्यान्वयन प्रॉम्प्ट से साक्ष्य तक का मार्ग स्पष्ट करता है। नीचे हर चरण को एक ऐसा पदार्थ या निर्णय उत्पन्न करना चाहिए जिसे कोई अन्य इंजीनियर निरीक्षण कर सके।
- कार्य अनुबंध लिखें। लक्षित परिणाम, अनुमोदित क्षेत्र, निषिद्ध क्रियाएँ, आउटपुट स्कीमा, समय बजट निर्दिष्ट करें, और क्या प्रमाणित स्थिति की अनुमति है।
- खोज को पढ़ने से अलग करें। उम्मीदवार सेट बनाने के लिए खोज का उपयोग करें, फिर केवल उन स्रोतों को खोलें जिनकी सवाल का उत्तर देने के लिए आवश्यकता हो। परिणाम URL और निर्धारित गंतव्य दोनों को बनाए रखें।
- अवलोकनों को सामान्य करें। संभावित फ़ील्ड लौटाएं जैसे वर्तमान URL, शीर्षक, पाठ, लिंक, स्क्रीनशॉट संदर्भ, और कार्रवाई की स्थिति ताकि योजनाकार बेतरतीब लेख को न पढ़े।
- निर्धारणात्मक मान्यता जोड़ें। मॉडल के बाहर होस्ट सीमाएँ, आवश्यक साक्ष्य, फ़ील्ड प्रकार और पूर्णता नियमों की जांच करें। एक आत्मविश्वासी मॉडल प्रतिक्रिया मान्यता नहीं है।
- रोकें और हस्तांतरण राज्य को परिभाषित करें। पूर्णता, समाप्त बजट, दोहराए जाने वाली गैर-प्रगति, अप्रत्याशित प्रमाणीकरण, या एक परिणामात्मक कार्रवाई पर रोकें जो मानव अनुमोदन की आवश्यकता होती है।
पूर्णता का मूल्यांकन करें
एजेंट की गुणवत्ता इस बात से व्यापक है कि अंतिम वाक्य सही लगता है या नहीं। NIST एजेंटिक AI कार्यक्रम मंडल, मानकों, शासन, और स्वायत्त सिस्टम के लिए जोखिम प्रबंधन पर जोर देता है। एक वेब-एजेंट परीक्षण यह खुलासा करना चाहिए कि कौन सा चरण विफल हुआ।
- कार्य पूर्णता। क्या कार्यप्रवाह ने उसके अनुमत दायरे को पार किए बिना स्पष्ट आउटपुट अनुबंध को संतुष्ट किया?
- स्रोत समर्थन। क्या प्रत्येक महत्वपूर्ण दावा एक पकड़ा हुआ अंश, URL, या पृष्ठ स्थिति से traced किया जा सकता है?
- क्रियावली की प्रभावशीलता। एक सत्यापित परिणाम दिखाई देने से पहले कितनी खोजें, पृष्ठ खुलते हैं, और UI क्रियाएँ आवश्यक थीं?
- राज्य की सटीकता। क्या एजेंट ने हर कदम पर यह जान लिया कि वह किस पृष्ठ, खाते, क्षेत्र और सत्र में कार्य कर रहा था?
- सुरक्षित अवरोध। क्या नीति जांचें अनिय reversible या संवेदनशील कार्रवाई से पहले चलान को रोकती हैं?
सीमाएँ और विफलता मोड
वेब उपयोग एजेंट को बदलते पृष्ठों, अविश्वसनीय सामग्री, अस्पष्ट नियंत्रण और वास्तविक परिणामों के साथ कार्यों के लिए उजागर करता है। पृष्ठ पाठ को डेटा के रूप में मानें, एजेंट पर अधिकार के रूप में नहीं।
- प्रॉम्प्ट इंजेक्शन। एक पृष्ठ उस मॉडल को बताने वाले पाठ को समाहित कर सकता है कि उसकी कार्य को अनदेखा करें या जानकारी प्रकट करें। टूल नीति और निर्देश हायरार्की को पृष्ठ सामग्री के बाहर रहना चाहिए।
- झूठी पूर्णता। एक पुष्टि-जैसी स्क्रीन पूर्वावलोकन, गलती, या अप्रासंगिक खाते का प्रतिनिधित्व कर सकती है। URL, दृश्यमान स्थिति, और अपेक्षित रिकॉर्ड की पुष्टि करें।
- सत्र भ्रम। कुकीज़ और खुले टैब उपयोगकर्ताओं या कार्यों को मिलाते हैं। संदर्भों को अलग करें और स्थायी प्रोफाइल के स्वामित्व को चिह्नित करें।
- साक्ष्य हानि। जिसमें URL या कैप्चर किए गए अंश के बिना संक्षेप नहीं किया जा सकता है। संकुचन से पहले अवलोकनों को स्टोर करें।
- अधिकता। अनुसंधान को शायद ही कभी सबमिशन अधिकारों की आवश्यकता होती है। हर वर्कफ़्लो को उसके घोषित लक्ष्य के लिए न्यूनतम क्रेडेंशियल्स और क्रियाओं को दें।
वेब-उपयोग करने वाले एजेंट कहाँ फिट होते हैं
वर्तमान अनुसंधान
हाल के स्रोतों की खोज करें, प्राथमिक पृष्ठों को खोलें, दावों की तुलना करें, और एक उद्धृत संक्षिप्तता वापस करें।
बाजार निगरानी
एक निर्दिष्ट सार्वजनिक स्रोत सेट पर जाएँ, परिवर्तनों को निकालें, और समीक्षा के लिए सामग्री में भिन्नताओं को कतारबद्ध करें।
सहायक संचालन
स्वीकृत ज्ञान को स्थानांतरित करें, एक आंतरिक इंटरफ़ेस पर नेविगेट करें, और एक ऑपरेटर के लिए उलटने वाले अगले कदम को तैयार करें।
ब्राउज़र कार्य
जब कोई स्थिर एपीआई मौजूद नहीं होता है और इंटरफ़ेस खुद उपलब्ध सतह होती है, तब नियंत्रित वेब इंटरैक्शन को पूरा करें।
पायलट से उत्पादन में
कैसे एआई एजेंट वेब का उपयोग करते हैं इसका एक उपयोगी पायलट इतना छोटा होना चाहिए कि रिकॉर्ड को रिकॉर्ड द्वारा निरीक्षण किया जा सके। शुरू करें कार्य अनुबंध लिखें: लक्ष्य परिणाम, अनुमोदित डोमेन, निषिद्ध क्रियाएं, आउटपुट स्कीमा, समय बजट, और यह कि क्या प्रमाणीकृत राज्य की अनुमति है, को निर्दिष्ट करें। फिर लागू करें पढ़ने से अलग खोज: एक उम्मीदवार सेट बनाने के लिए खोज का उपयोग करें, फिर केवल उन स्रोतों को खोलें जिनकी आवश्यकता प्रश्न का उत्तर देने के लिए है। परिणाम URL और निकास स्थान दोनों को बनाए रखें। पहले मूल्यांकन सेट को जानबूझकर मिश्रित रखें, जिसमें सामान्य मामले, अस्पष्ट मामले, गुम सबूत और एक क्रिया शामिल हो जो सिस्टम को अस्वीकार करनी चाहिए या सौंपनी चाहिए। इससे यह पता चलता है कि क्या वर्कफ़्लो अपनी सीमाओं को समझता है इससे पहले कि उच्च मात्रा डिजाइन की गलतियों को समग्र मेट्रिक्स के अंदर छुपा ले।
उत्पादन तैयार होने के लिए हर माप और कलाकृति के लिए एक मालिक की आवश्यकता होती है। ट्रैक करें कार्य पूर्णता इसका उत्तर देने के लिए कि क्या वर्कफ़्लो ने अनुमोदित आउटपुट अनुबंध को संतोषजनक तरीके से पूरा किया है या इसकी अनुमति दी गई सीमा को पार किया है? ट्रैक करें स्रोत समर्थन यह निर्धारित करने के लिए कि क्या हर महत्वपूर्ण दावा एक पकड़े गए उद्धरण, URL, या पृष्ठ स्थिति से ट्रेस किया जा सकता है? जोड़ें क्रिया दक्षता ताकि टीम देख सके कि कितनी खोजें, पृष्ठ खोलने और यूआई क्रियाओं की आवश्यकता थी इससे पहले कि एक सत्यापित परिणाम प्रकट हुआ? ये माप संरक्षित रिकॉर्ड से जुड़े रहना चाहिए बजाय केवल डैशबोर्ड टोटल के रूप में मौजूद रहना चाहिए। एक समीक्षक को एक बदले हुए मेट्रिक से ठीक प्रश्न, स्रोत, अवलोकन या कार्रवाई पर जाने की आवश्यकता होती है जिसने इसे उत्पन्न किया।
संचालनात्मक नियंत्रण को उन विफलता मोड को लक्षित करना चाहिए जो सबसे अधिक संभावना है कि वे व्यापार निर्णय को बदल देंगे। पहली समीक्षा नियम को कवर करना चाहिए प्रॉम्प्ट इंजेक्शन: एक पृष्ठ में टेक्स्ट शामिल हो सकता है जो मॉडल को अपने कार्य को अनदेखा करने या जानकारी प्रकट करने के लिए कहता है। उपकरण नीति और निर्देशों की हायरार्की को पृष्ठ सामग्री के बाहर रहना चाहिए। निकासी समीक्षा को कवर करना चाहिए अधिकार का अतिरेक: अनुसंधान को शायद ही कभी सबमिशन अधिकारों की आवश्यकता होती है। हर वर्कफ़्लो को उसके घोषित लक्ष्य के लिए न्यूनतम क्रेडेंशियल्स और क्रियाओं को दें। एक प्रतिक्रिया मालिक नियुक्त करें, परिभाषित करें कि कौन सा साक्ष्य समस्या को हल करता है, और रिकॉर्ड करें कि क्या परिणाम डेटा, प्रॉम्प्ट, उपकरण, अनुमति, या स्रोत नीति को बदलता है। यह रिकॉर्ड एक ही दोष को एक अज्ञात गुणवत्ता उतार-चढ़ाव के रूप में फिर से खोजने से रोकता है।
उनके प्रक्षिप्त व्यवहार में वृत्तिपूर्ण होने के बाद ही विस्तार करें। एक टीम वर्तमान अनुसंधान के साथ शुरू कर सकती है, जहां काम हाल के स्रोतों की खोज करना है, प्राथमिक पृष्ठों को खोलना है, दावों की तुलना करना है, और एक उद्धृत संक्षिप्तता लौटाना है। एक दूसरा चरण बाजार निगरानी जोड़ सकता है, जहां वर्कफ़्लो को एक निर्दिष्ट सार्वजनिक स्रोत सेट पर जाना है, परिवर्तनों को निकालना है, और समीक्षा के लिए सामग्री की भिन्नताओं को कतारबद्ध करना है। मूल परीक्षण सेट को चलाना जारी रखें क्योंकि दायरा बढ़ता है। नए स्रोतों, बाजारों, उपकरणों और अनुमतियों को एक समय में एक सीमा में पेश किया जाना चाहिए ताकि रिग्रेशनों को एक विशिष्ट परिवर्तन के लिए सौंपा जा सके, बजाय एक समवर्ती प्लेटफ़ॉर्म पुनर्लेखन के।
निष्कर्ष
एक एआई एजेंट वेब का उपयोग मॉडल निर्णयों और बाहरी रूप से निष्पादन किए गए उपकरणों के बीच बारी-बारी से करके करता है। खोज स्रोतों को ढूंढती है, पुनर्प्राप्ति उन्हें पढ़ती है, एक ब्राउज़र प्रशासित इंटरफेस को संभालता है, और मान्यताओं यह तय करती हैं कि क्या साक्ष्य और कार्रवाई अनुबंध को संतोषजनक बनाते हैं। मॉडल इन क्षमताओं का समन्वय करता है; यह उन्हें प्रतिस्थापित नहीं करता।
एक संकीर्ण कार्य, एक छोटी उपकरण सूची, और एक साक्ष्य-धारक आउटपुट स्कीमा से शुरू करें। केवल तब ब्राउज़र क्रियाओं को जोड़ें जब सरल पुनर्प्राप्ति आवश्यकताओं को पूरा नहीं कर सके। उस डिज़ाइन से सिस्टम को समझने योग्य बनाए रखता है क्योंकि इसकी वेब पहुंच बढ़ती है।
क्या आप अपने एजेंट को एक वेब रनटाइम देने के लिए तैयार हैं?
एक बाउंडेड एजेंट वर्कफ़्लो को रेंडर्ड सार्वजनिक वेब पृष्ठों से कनेक्ट करने के लिए स्क्रैपलेस एजेंट ब्राउज़र का उपयोग करें जिसमें सत्र स्थिति और अवलोकनीय क्रियाएँ हैं।
आज साइन अप करें और प्राप्त करें $5 मुफ्त क्रेडिट — कोई क्रेडिट कार्ड की आवश्यकता नहीं है.
अपने $5 क्रेडिट का दावा करें →अक्सर पूछे जाने वाले प्रश्न
क्या एक एआई एजेंट बिना ब्राउज़र के वेब ब्राउज़ कर सकता है?
हाँ। एक एजेंट खोज एपीआई या सीधे फेच उपकरण का उपयोग कर सकता है जब कार्य को केवल खोज या स्थिर सामग्री की आवश्यकता हो। जब जावास्क्रिप्ट रेंडरिंग, सत्र स्थिति, या इंटरैक्शन परिणाम को प्रभावित करता है, तो ब्राउज़र की आवश्यकता होती है।
क्या मॉडल स्वयं क्लिक करता है?
नहीं। मॉडल एक उपकरण का चयन करता है और तर्क प्रदान करता है; एक एप्लिकेशन या ब्राउज़र रनटाइम क्रिया को निष्पादित करता है और एक अवलोकन लौटाता है। यह विभाजन मेज़बान को तर्कों को मान्य करने और नीति लागू करने की अनुमति देता है।
एक एजेंट को कैसे पता चलता है कि कब ब्राउज़िंग बंद करनी है?
वर्कफ़्लो एक पूर्णता परीक्षण, साक्ष्य आवश्यकताओं, और संसाधन सीमाओं को परिभाषित करता है। एजेंट तब रुक जाता है जब ये शर्तें पार हो जाती हैं या जब प्रगति, अधिकार, या विश्वास अनुबंध के बाहर गिरता है तो सौंप देता है।
एक वेब एजेंट को कौन सा साक्ष्य रखना चाहिए?
मूल प्रॉम्प्ट, प्रश्न, समाधान किए गए URL, प्रासंगिक उद्धरण, समय-चिह्न, उपकरण आउटपुट, पृष्ठ-स्थिति कलाकृतियों, और अंतिम दावा-से-स्रोत मैपिंग को बनाए रखें। परिणामस्वरूप वर्कफ़्लो को अनुमोदनों और कार्रवाई लॉग को भी बनाए रखना चाहिए।
क्या ब्राउज़र स्वचालन एक एआई एजेंट के समान है?
नहीं। ब्राउज़र स्वचालन एक निर्दिष्ट अनुक्रम को निष्पादित करता है, जबकि एक एजेंट अवलोकनों में से अगली सीमित क्रिया चुन सकता है। कई उत्पादन प्रणालियाँ एजेंट योजना के साथ निर्णायक ब्राउज़र और मान्यकरण कोड को संयोजित करती हैं।