ब्राउज़र एजेंट क्या है?
स्क्रेपलेस स्क्रैपिंग ब्राउज़र प्रबंधित ब्राउज़र सत्र प्रदान करता है जिन्हें ब्राउज़र एजेंट मानक स्वचालन और एजेंट-फेसिंग इंटरफेस के माध्यम से नियंत्रित कर सकते हैं।
TL;DR
- एक ब्राउज़र एजेंट वेब पर एक धारणा-क्रिया लूप को बंद करता है। यह एक पृष्ठ का अवलोकन करता है, एक क्रिया चुनता है, इसे ब्राउज़र उपकरणों के माध्यम से कार्यान्वित करता है, नए राज्य को पढ़ता है, और जब लक्ष्य या सुरक्षा सीमा पहुंच जाती है, तो रुक जाता है।
- भाषा मॉडल एक घटक है, संपूर्ण एजेंट नहीं। एक कार्यशील प्रणाली को उपकरणों, स्थिति, अनुमतियों, त्रुटि प्रबंधन, मान्यता, और एक स्पष्ट रोकने की शर्त की आवश्यकता है।
- ब्राउज़र एजेंट निश्चित स्क्रिप्ट से भिन्न होते हैं। स्क्रिप्ट पूर्वनिर्धारित कदमों का पालन करते हैं; एजेंट वर्तमान पृष्ठ स्थिति से कदमों का चयन करते हैं और जब पथ भिन्न होता है, तो अनुकूलित कर सकते हैं।
- अवलोकन गुणवत्ता कार्रवाई गुणवत्ता को नियंत्रित करता है। स्क्रीनशॉट, DOM डेटा, पहुंच पेड़, नेटवर्क प्रतिक्रियाएं, और निकाले गए पाठ विभिन्न सबूत और विभिन्न विफलता मोड प्रकट करते हैं।
- संवेदनशील क्रियाओं को स्पष्ट अनुमोदन की आवश्यकता होती है। एक सार्वजनिक पृष्ठ को पढ़ना और क्रेडेंशियल्स, खरीदारी, या खाता परिवर्तनों को प्रस्तुत करना विभिन्न प्राधिकरण स्तरों के अंतर्गत आता है।
ब्राउज़र एजेंटों को परिभाषित किया गया है
एक ब्राउज़र एजेंट एक सॉफ़्टवेयर प्रणाली है जो क्रिया वातावरण के रूप में ब्राउज़र का उपयोग करती है। एक लक्ष्य के आधार पर, यह वर्तमान वेब पृष्ठ का अवलोकन करता है, अगले कदम के बारे में तर्क करता है, एक ब्राउज़र ऑपरेशन को सक्रिय करता है, और परिणाम का निरीक्षण करता है। चक्र तब तक जारी रहता है जब तक कार्य पूर्ण नहीं होता, आगे बढ़ नहीं सकता, या नीति सीमा तक नहीं पहुँचता। एजेंट खोज, नेविगेट, क्लिक, टाइप, स्क्रॉल, सूचना निकाल सकता है, फ़ाइल डाउनलोड कर सकता है, या किसी व्यक्ति से संवेदनशील कदम को अनुमोदित करने के लिए कह सकता है।
एक ब्राउज़र एजेंट एक ब्राउज़िंग बटन के साथ चैट मॉडल से व्यापक है। मॉडल निर्णय प्रस्तावित करता है, जबकि आसपास का अनुप्रयोग उपकरणों, क्रेडेंशियल्स, मेमोरी, नेटवर्क एक्सेस, अनुमत डोमेन, बजट, लॉगिंग, और अनुमोदनों को नियंत्रित करता है। WebArena अनुसंधान वास्तविक, पुनरुत्पादित वेब कार्यों का वर्णन करता है और कार्यात्मक पूर्णता का मूल्यांकन करता है, जो एजेंट के प्रदर्शन की परिभाषा के लिए एक बेहतर परिभाषा है कि क्या एक उत्पन्न योजना यथार्थवादी लगती है।
ब्राउज़र एजेंटों में खोज प्रणालियों से भी भिन्न होते हैं। खोज उम्मीदवार जानकारी को पुनर्प्राप्त करती है। एक ब्राउज़र एजेंट एक परिणाम का पालन कर सकता है, गंतव्य को प्रस्तुत कर सकता है, पृष्ठ स्थिति के साथ इंटरैक्ट कर सकता है, और कई साइटों में सबूत एकत्र कर सकता है। खोज एजेंट के भीतर एक उपकरण हो सकता है, लेकिन खोज पूरी नियंत्रण लूप प्रदान नहीं करती है। वही भेद खोदने वालों पर लागू होता है: एक खोदने वाला एक पृष्ठ से डेटा पढ़ता है, जबकि एक एजेंट यह तय करता है कि अगला पृष्ठ और अगली कार्रवाई क्या होनी चाहिए।
यह पद वेब एजेंट, कंप्यूटर-उपयोग एजेंट, और ब्राउज़र स्वचालन एजेंट के साथ ओवरलैप करता है। एक वेब एजेंट बिना दृश्य ब्राउज़र खोले HTTP एपीआई को कॉल कर सकता है। एक कंप्यूटर-उपयोग एजेंट वेब के परे डेस्कटॉप अनुप्रयोगों को नियंत्रित कर सकता है। एक ब्राउज़र एजेंट उस वातावरण द्वारा परिभाषित किया जाता है जिसमें वह कार्य करता है: ब्राउज़र टैब, नेविगेशन इतिहास, पृष्ठ सामग्री, ब्राउज़र भंडारण, डाउनलोड, और वेब इंटरैक्शन।
एक ब्राउज़र एजेंट कैसे काम करता है
लूप एक लक्ष्य और एक सीमित कार्य स्थिति से शुरू होता है। “तीन आधिकारिक विनिर्देश खोजें और उन्हें लिंक के साथ संक्षेपित करें” एक आउटपुट आकार और सबूत की आवश्यकताओं को प्रदान करता है। “इस विषय पर शोध करें” का कोई स्वाभाविक अंत नहीं है और खुले-समाप्त ब्राउज़िंग को प्रोत्साहित करता है। अच्छा आयोजन लक्ष्य को स्वीकृति मानदंड में बदलता है, पहुँच योग्य डोमेन या क्रिया प्रकारों को सीमित करता है, और रिकॉर्ड करता है कि कौन से प्रमाण अंतिम उत्तर में जीवित रहने चाहिए।
अवलोकन एक जटिल पृष्ठ को मॉडल-पठनीय प्रमाण में परिवर्तित करता है। एक दृश्य एजेंट पिक्सेल और चिह्नित नियंत्रण प्राप्त कर सकता है। एक अभिज्ञान एजेंट सुलभ भूमिकाएँ, नाम, DOM पाठ, और तत्व संदर्भ प्राप्त कर सकता है। एक डेटा-उन्मुख एजेंट एक नेटवर्क प्रतिक्रिया या संरचित पृष्ठ मेटाडेटा की जाँच कर सकता है। W3C वेबड्राइवर विनिर्देश ब्राउज़र स्वचालन द्वारा उपयोग किए जाने वाले कमांड मॉडल को दर्शाता है, जबकि आधुनिक एजेंट स्टैक अक्सर प्रोटोकॉल-स्तरीय नियंत्रण को उच्च-स्तरीय अवलोकनों के साथ जोड़ते हैं।
योजना अगली अनुमत कार्रवाई का चयन करती है। कुछ प्रणाली मॉडल से एक बार में एक कदम पूछती हैं; अन्य एक छोटा योजना बनाती हैं और प्रत्येक अवलोकन के बाद इसे संशोधित करती हैं। एक-चरण नियंत्रण को मान्य करना आसान है क्योंकि नियंत्रणकर्ता हर प्रस्तावित क्लिक, लक्ष्य, और मूल्य की जाँच कर सकता है। लंबी योजनाएँ मॉडल कॉल को कम कर सकती हैं, लेकिन जैसे ही एक पृष्ठ अप्रत्याशित शाखा लेता है, वे पुरानी हो जाती हैं।
कार्यान्वयन वातावरण को बदलता है, और मान्यता लूप को बंद करती है। एक सफल क्लिक यह प्रमाण नहीं है कि इच्छित पृष्ठ लोड हो गया है। एजेंट को परिणामस्वरूप URL, दृश्यमान स्थिति, या संरचित पुष्टि का निरीक्षण करना चाहिए। एक फॉर्म सबमिशन को फॉर्म भरने से भिन्न किया जाना चाहिए, और एक खरीद को अंतिम समीक्षा स्क्रीन पर पहुँचने से भिन्न किया जाना चाहिए। यह पृथक्करण मानव अनुमोदन के लिए स्थान बनाता है।
ब्राउज़र एजेंट बनाम ब्राउज़र स्वचालन स्क्रिप्ट
दोनों प्रणाली एक ब्राउज़र को संचालित करती हैं, लेकिन वे अगली कार्रवाई कैसे चुनी जाती है और वे कितनी अनिश्चितता को अवशोषित कर सकती हैं, में भिन्न होती हैं।
| आयाम | प्राथमिक अर्थ | सामान्य त्रुटि |
|---|---|---|
| नियंत्रण तर्क | एजेंट वर्तमान अवलोकन से एक क्रिया का चयन करता है। | किसी भी मॉडल-चालित ब्राउज़र कार्यप्रवाह को एजेंट के रूप में कॉल करना भले ही हर कदम निश्चित हो। |
| अनुकूलन | पथ तब बदल सकता है जब पृष्ठ स्थिति या उपलब्ध नियंत्रण बदलता है। | मान लेना कि अनुकूलन से चयनकर्ताओं, मान्यता, या परीक्षणों की आवश्यकता समाप्त हो जाती है। |
| प्रमाण | एजेंट स्रोत पृष्ठों और स्थिति संक्रमणों को बनाए रखता है जो परिणाम का समर्थन करते हैं। | उत्तर लौटाना बिना उन पृष्ठों या अवलोकनों के जो इसे व्युत्पन्न करने के लिए उपयोग किए गए। |
| सर्वश्रेष्ठ उपयुक्तता | परिवर्तनीय, बहु-चरणीय कार्य जहाँ मार्ग सस्ते में गणनाफ़ोर्ड नहीं किया जा सकता। | एक एजेंट का उपयोग करना स्थिर थोक क्रियाओं के लिए जो एक छोटी निर्धारण स्क्रिप्ट बेहतर संभालती है। |
| जोखिम | एक गलत व्याख्या एक वास्तविक ब्राउज़र क्रिया बन सकती है। | एक प्रवाही स्पष्टीकरण को प्राधिकरण या कार्यान्वयन प्रमाण के रूप में मान लेना। |
सामान्य ब्राउज़र-एजेंट उपयोग मामले
ब्राउज़र एजेंट तब सबसे उपयोगी होते हैं जब गंतव्य इंटरैक्टिव होता है और मार्ग उस पृष्ठ स्थिति पर निर्भर करता है जो कार्य के दौरान सामने आती है।
साक्ष्य-आधारित अनुसंधान
एजेंट खोजता है, प्राथमिक स्रोतों को खोलता है, दावों को निकालता है, और लिंक लौटाता है जिन्हें एक समीक्षक जांच सकता है।
ऑपरेशंस वर्कफ़्लोज़
एजेंट डैशबोर्ड या फॉर्म के माध्यम से चलता है, परिवर्तनों को तैयार करता है, और महत्वपूर्ण सबमिशन से पहले रुकता है।
वेब डेटा संग्रहण
एजेंट पृष्ठांकन का पता लगाता है, गतिशील सामग्री प्रस्तुत करता है, और संरचित रिकॉर्ड को एक स्टोरेज या विश्लेषण चरण में सौंपता है।
गुणवत्ता आश्वासन
एजेंट कार्य प्रवाहितियों की खोज करता है, स्क्रीनशॉट और कंसोल साक्ष्य रिकॉर्ड करता है, और रिपोर्ट करता है जहाँ अपेक्षित व्यवहार भिन्न होता है।
एक उत्पादन ब्राउज़र एजेंट के घटक
टूल अनुबंधों को टाइप किया जाना चाहिए और संकीर्ण होना चाहिए। एक नेविगेशन टूल को एक यूआरएल और एक अनुमति सूची की जांच की आवश्यकता होती है। एक क्लिक टूल को एक वर्तमान तत्व संदर्भ की आवश्यकता होती है। एक टेक्स्ट-एंट्री टूल को एक लक्ष्य और एक मान वर्गीकरण की आवश्यकता होती है ताकि रहस्यों को मजबूत नियंत्रण प्राप्त हो सकें। मॉडल संदर्भ प्रोटोकॉल विशिष्टता एक मानक तरीका प्रदान करता है ताकि क्लाइंट और सर्वर कॉल करने योग्य उपकरणों का वर्णन कर सकें, लेकिन एक स्कीमा को अभी भी एप्लिकेशन-स्तर की अनुमतियों की आवश्यकता है।
स्मृति को स्वीकृत तथ्यों और वर्तमान कार्य स्थिति को बनाए रखना चाहिए बिना पूरे ब्राउज़िंग इतिहास को अगले संकेत में बदलने के। कार्यशील स्मृति सक्रिय लक्ष्य, देखी गई URLs, निकाले गए तथ्य, और लंबित अनुमोदनों को रख सकती है। स्थायी स्मृति को केवल उस जानकारी को स्टोर करना चाहिए जिसके लिए एप्लिकेशन के पास कोई कारण और अनुमति हो। ब्राउज़र कुकीज़ और लॉगिन स्थिति को कथा कार्य स्मृति से अलग उपचार की आवश्यकता है।
ब्राउज़र परत रेंडरिंग, सत्र, डाउनलोड, संग्रहण, और प्रोटोकॉल पहुंच प्रदान करती है। एक प्रबंधित क्लाउड ब्राउज़र स्थानीय ब्राउज़र रखरखाव को हटा सकता है, लेकिन यह निर्णय नहीं लेता कि एजेंट क्या कर सकता है। मेज़बान प्रणाली को डोमेन प्रतिबंध, प्रमाणपत्र सीमाएँ, क्रिया वर्ग, ऑडिट लॉग, और अनुमोदन नीति को मॉडल प्रॉम्प्ट के बाहर रखना चाहिए ताकि ये नियम बातचीत के सलाह के रूप में फिर से व्याख्यायित न किए जा सकें।
मूल्यांकन के लिए कार्यात्मक जांचों की आवश्यकता होती है। एक अनुसंधान कार्य तब पास होता है जब अनुरोधित तथ्य संरक्षित स्रोतों द्वारा समर्थित होते हैं। एक फ़ॉर्म कार्यप्रवाह तब पास होता है जब फ़ील्ड में इच्छित मान होते हैं और सिस्टम आवश्यक सीमा पर रुकता है। एक स्क्रैपर तब पास होता है जब आउटपुट स्कीमा पूर्ण और पृष्ठ प्रमाण से ट्रेस करने योग्य होता है। दृश्य समानता या एक आत्मविश्वास से भरा अंतिम वाक्य पर्याप्त नहीं है।
जोखिम और विफलता के तरीके
वेब पृष्ठों में अविश्वसनीय निर्देश होते हैं। किसी पृष्ठ पर पाठ एक एजेंट को अपना कार्य नजरअंदाज करने, डेटा प्रकट करने, या किसी अन्य डोमेन पर जाने के लिए कह सकता है। नियंत्रक को पृष्ठ सामग्री को प्रमाण के रूप में मानना चाहिए, न कि उच्च-प्राथमिकता नीति के रूप में। उपकरण अनुमतियों, गुप्त पहुंच, और अनुमत गंतव्यों को मॉडल द्वारा पढ़े जाने वाले पाठ के बाहर लागू किया जाना चाहिए।
गतिशील स्थिति समय और पहचान समस्याएँ उत्पन्न करती है। एक स्थाननिर्धारक नेविगेशन या पुनः-रेंडरिंग के बाद एक अलग तत्व की ओर इशारा कर सकता है। एक पुरानी स्क्रीनशॉट उन नियंत्रणों का वर्णन कर सकता है जो अब मौजूद नहीं हैं। तत्व संदर्भों को अवलोकन के साथ समाप्त होना चाहिए, और क्रियाओं को वर्तमान URL, फ्रेम, और पृष्ठ स्थिति के खिलाफ मान्य किया जाना चाहिए। उच्च-प्रभाव वाले संचालन के लिए एक ताज़ा कैप्चर की आवश्यकता होती है।
एजेंट लूप में भी समय बर्बाद कर सकते हैं। एक स्पष्ट कदम बजट, समय बजट, और रोकने की स्थिति विफलता को स्पष्ट बनाती है। सिस्टम को "लक्ष्य प्राप्त नहीं हुआ" को "लक्ष्य बिना सबूत के प्राप्त किया गया" और "अप्रूवल की प्रतीक्षा में अवरुद्ध" से अलग करना चाहिए। ये परिणाम विभिन्न अगले कदमों की ओर ले जाते हैं और एक सामान्य सफलता क्षेत्र में नहीं समाहित होने चाहिए।
गोपनीयता और प्राधिकरण संपूर्ण श्रृंखला पर लागू होते हैं। एक ब्राउज़र एजेंट व्यक्तिगत डेटा, प्रमाणित पृष्ठों, अपलोड किए गए दस्तावेज़ों, या भुगतान नियंत्रणों का सामना कर सकता है। केवल वही इकट्ठा करें जो कार्य की आवश्यकता है, संवेदनशील टिप्पणियों को मॉडल को भेजने से पहले हटा दें जब संभव हो, और केवल इसलिए सबमिट या खुलासा करने की अनुमति लगाने का अनुमान न लगाएं क्योंकि ब्राउज़र नियंत्रण तक पहुँच सकता है।
ब्राउज़र एजेंट का मूल्यांकन कैसे करें
कार्य की सफलता की शुरुआत करें, लेकिन सफलता को एक बाहरी रूप से जांचे जाने वाले राज्य के रूप में परिभाषित करें। एक खरीद कार्य एक समीक्षा स्क्रीन पर समाप्त हो सकता है, भुगतान के बाद नहीं। एक शोध कार्य को प्राथमिक स्रोतों की एक निश्चित संख्या की आवश्यकता हो सकती है। एक डेटा कार्य को एक स्कीमा, उत्पत्ति क्षेत्र और डुप्लिकेट प्रबंधन की आवश्यकता हो सकती है। मूल्यांकनकर्ता को उसी मॉडल से यह पूछने के बजाय वातावरण या कलाकृति की जांच करनी चाहिए कि क्या यह सफल रहा।
पर्यवेक्षण, निर्णय, क्रिया, और सत्यापन में परिणामों को विभाजित करें। पर्यवेक्षण पूछता है कि क्या आवश्यक नियंत्रण या तथ्य अवलोकन में उपस्थित था। निर्णय पूछता है कि क्या चुना गया अगला कदम कार्य के साथ मेल खाता था। क्रिया जांचती है कि क्या ब्राउज़र ने इच्छित संचालन किया। सत्यापन जांचता है कि क्या नई स्थिति ने अपेक्षित स्थिति को संतुष्ट किया। यह विघटन असफलताओं को क्रियान्वित करने योग्य बनाता है।
खर्च और पर्यवेक्षण को भी मापें। ब्राउज़र चरणों, मॉडल कॉल, दीवार समय, दोहराए गए अवलोकनों, मानव अनुमोदनों, और अनसुलझी अवस्थाओं की गणना करें। एक प्रणाली जो कई अनावश्यक कार्यों के साथ कार्य पूरा करती है, वह एक छोटे स्क्रिप्ट की तुलना में कम उपयुक्त हो सकती है। एक प्रणाली जो स्पष्ट सीमाओं पर अनुमोदन के लिए पूछती है, वह अधिक सुरक्षित और उपयोगी हो सकती है बनिस्बत एक ऐसी प्रणाली के जो अधिकतम स्वायत्तता का पीछा करती है।
दोनों पुनरुत्पादनीय परीक्षण स्थलों और सीमित लाइव-साइट जांचों का उपयोग करें। पुनरुत्पादनीय वातावरण रोकथाम की तुलना करने में मदद करते हैं। लाइव साइटें लेआउट भिन्नता, प्रमाणीकरण सीमाएँ, और वास्तविक रेंडरिंग व्यवहार को उजागर करती हैं, लेकिन उनकी स्थिति समय के साथ बदलती है। कार्य परिभाषा, दृश्यपटल, भाषा, मॉडल, उपकरण संस्करण, और प्रत्येक परिणाम को समझाने के लिए आवश्यक साक्ष्य को संग्रहीत करें।
निष्कर्ष
एक ब्राउज़र एजेंट एक नियंत्रित लूप है जो वेब अवलोकनों को ब्राउज़र क्रियाओं में बदलता है। इसका मूल्य पृष्ठ स्थिति के अनुकूलन और एक बहु-चरण लक्ष्य के बीच खोज, नेविगेशन, इंटरएक्शन और निष्कर्षण का समन्वय करने से आता है। मॉडल कारण स्थापित करता है, जबकि एप्लिकेशन उपकरण, मेमोरी, नीति और सत्यापन प्रदान करता है।
विश्वसनीय ब्राउज़र एजेंट अनिश्चितता को स्पष्ट करते हैं। वे साक्ष्य को संरक्षित करते हैं, पुरानी संदर्भ समाप्त करते हैं, क्रियाओं को सीमित करते हैं, और महत्वपूर्ण परिवर्तनों से पहले अनुमोदन के लिए रुकते हैं। यह डिज़ाइन एजेंट द्वारा सहायता के बिना किए गए क्लिकों की संख्या से अधिक महत्वपूर्ण है।
क्या आप ब्राउज़र-एजेंट वर्कफ़्लो बनाने के लिए तैयार हैं?
अपने एप्लिकेशन को योजना, साक्ष्य, और अनुमोदनों पर नियंत्रण रखते हुए प्रबंधित ब्राउज़र सत्रों के लिए Scrapeless Scraping Browser का उपयोग करें।
आज साइन अप करें और पाएं $5 मुफ्त क्रेडिट — कोई क्रेडिट कार्ड अनिवार्य नहीं.
अपना $5 क्रेडिट प्राप्त करें →प्रश्नोत्तरी
ब्राउज़र एजेंट की सबसे सरल परिभाषा क्या है?
एक ब्राउज़र एजेंट वह सॉफ़्टवेयर है जो एक वेब पृष्ठ को देखता है, एक ब्राउज़र क्रिया को चुनता और निष्पादित करता है, नए राज्य का मूल्यांकन करता है, और तब तक दोहराता है जब तक कि यह एक परिभाषित लक्ष्य या रोकने की स्थिति नहीं पहुँच जाता।
क्या एक ब्राउज़र एजेंट वेब स्क्रैपर के समान है?
नहीं। एक स्क्रैपर डेटा निकालने पर केंद्रित होता है। एक ब्राउज़र एजेंट स्क्रैप कर सकता है, लेकिन यह नेविगेट, इंटरएक्ट, राज्यों की तुलना करने, और अगली क्रिया या स्रोत तय करने की भी क्षमता रखता है।
क्या एक ब्राउज़र एजेंट को स्क्रीनशॉट की आवश्यकता होती है?
नहीं। एजेंट स्क्रीनशॉट, DOM डेटा, एक्सेसिबिलिटी पेड़, नेटवर्क प्रतिक्रियाएं, या मिश्रित अवलोकनों का उपयोग कर सकते हैं। सबसे अच्छी प्रतिनिधित्व पृष्ठ और कार्य पर निर्भर करती है।
कब एक स्थिर स्क्रिप्ट एक एजेंट से बेहतर होती है?
एक स्थिर स्क्रिप्ट आमतौर पर स्थिर, दोहराने योग्य, उच्च-मात्रा कार्य प्रक्रियाओं के लिए अधिक बेहतर होती है जिनमें ज्ञात कदम होते हैं। एक एजेंट तब उपयोगी होता है जब मार्ग भिन्न होता है और पृष्ठ की समझ अगली क्रिया निर्धारित करती है।
संवेदनशील ब्राउज़र क्रियाओं को कैसे संभाला जाना चाहिए?
मॉडल के बाहर अनुमतियों को लागू करें, क्रेडेंशियल्स को स्कोप में रखें, वर्तमान स्थिति के खिलाफ लक्ष्यों को मान्य करें, और खरीद, सबमिशन, खाता परिवर्तनों, या संवेदनशील डेटा के प्रकटीकरण से पहले स्पष्ट मानव अनुमोदन की आवश्यकता करें।