गूज + स्क्रेपलेस: ब्लॉक के एआई एजेंट को MCP के माध्यम से लाइव वेब डेटा दें।
Lead Scraping Automation Engineer
TL;DR:
- गूज ब्लॉक का ओपन-सोर्स एआई एजेंट है, और यह मॉडल कॉन्टेक्स्ट प्रोटोकॉल (MCP) के जरिए बाहरी टूल्स तक पहुँचता है। स्क्रैपलेस MCP सर्वर जोड़ने से गूज को लाइव वेब खोज और स्क्रैपिंग मिलती है जो कि इसे खुद नहीं है।
- स्क्रैपलेस MCP सर्वर 21 टूल प्रदान करता है —
google_search,google_trends,scrape_html,scrape_markdown,scrape_screenshot, और क्लाउड ब्राउज़र को चलाने के लिए 16browser_*क्रियाएँ। - आप इसे एक stdio एक्सटेंशन के रूप में जोड़ते हैं, या तो गूज के
config.yamlमें याgoose run --with-extensionके साथ इनलाइन,npx -y scrapeless-mcp-serverपर अपने स्क्रैपलेस की के साथSCRAPELESS_KEYपर्यावरण चर इंगित करते हुए। - गूज तब अपने आप टूल्स को कॉल करता है। एक कार्य दिए जाने पर, एजेंट सही स्क्रैपलेस टूल चुनता है, इसे चलाता है, और वापस किए गए डेटा से उत्तर देता है — बिना किसी गोंद कोड के।
- फ्री शुरू करें। नए स्क्रैपलेस खातों में मुफ्त क्रेडिट शामिल होते हैं — app.scrapeless.com पर साइन अप करें।
गूज, ब्लॉक का ओपन-सोर्स एजेंट, कोड लिखता है और चलाता है, कार्यप्रवाह को चलाता है, और अपने आप बाहरी सेवाओं को कॉल करता है। जो वह बॉक्स से बाहर नहीं कर सकता, वह लाइव वेब को देखना है — इसका ज्ञान मॉडल के प्रशिक्षण के कट-ऑफ पर रुकता है। गूज उसी तरह उस अंतर को बंद करता है जैसे हर MCP होस्ट करता है: मॉडल कॉन्टेक्स्ट प्रोटोकॉल सर्वरों से कनेक्ट करके जो टूल्स को एक्सपोज करता है। यह गाइड गूज को स्क्रैपलेस MCP सर्वर से कनेक्ट करता है, ताकि एजेंट Google को खोज सके और अपनी तर्क प्रक्रिया के हिस्से के रूप में पृष्ठों को स्क्रैप कर सके। नीचे दी गई हर कमांड, टूल का नाम, और परिणाम एक लाइव रन से कैद किए गए हैं।
यह एकीकरण क्या सक्षम करता है
स्क्रैपलेस MCP सर्वर एक stdio सर्वर है: गूज इसे एक उप-प्रक्रिया के रूप में लॉन्च करता है और मानक इनपुट और आउटपुट के माध्यम से MCP — एक JSON-RPC प्रोटोकॉल — में बात करता है। एक बार कनेक्ट होने के बाद, गूज को प्राप्त होता है:
- लाइव खोज — वास्तविक समय के परिणामों और रुचि डेटा के लिए
google_searchऔरgoogle_trends। - पृष्ठ निष्कर्षण — किसी भी URL को HTML, साफ Markdown, या एक छवि में बदलने के लिए
scrape_html,scrape_markdown, औरscrape_screenshot। - क्लाउड-ब्राउज़र नियंत्रण — इंटरैक्शन की आवश्यकता वाले पृष्ठों के लिए 16
browser_*टूल्स (browser_goto,browser_click,browser_type,browser_get_text,browser_snapshot, और अधिक) एक प्रबंधित ब्राउज़र को चलाते हैं।
एजेंट तय करता है कि इनमें से किसे कॉल करना है; आप कार्य का वर्णन स्पष्ट भाषा में करते हैं।
पूर्वापेक्षाएँ
- गूज स्थापित (CLI या डेस्कटॉप) — इंस्टॉलर के लिए गूज प्रोजेक्ट देखें।
- Node.js जिसमें
npxउपलब्ध है, ताकि गूजnpx -y scrapeless-mcp-serverके साथ सर्वर को लॉन्च कर सके। - एक स्क्रैपलेस एपीआई कुंजी — app.scrapeless.com पर मुफ्त योजना पर एक प्राप्त करें।
- गूज में एक मॉडल प्रदाता कॉन्फ़िगर किया गया (एजेंट की तर्क प्रक्रिया आपके चुने हुए मॉडल पर चलती है)।
गूज में स्क्रैपलेस MCP सर्वर जोड़ें
एक्सटेंशन को पंजीकृत करने के लिए दो तरीके हैं। एक स्थायी सेटअप के लिए, इसे गूज के config.yaml (Linux पर, ~/.config/goose/config.yaml) में, extensions के तहत जोड़ें:
yaml
extensions:
scrapeless:
name: scrapeless
type: stdio
cmd: npx
args:
- -y
- scrapeless-mcp-server@0.4.9
envs:
SCRAPELESS_KEY: your-scrapeless-api-key
enabled: true
bundled: false
timeout: 300
description: स्क्रैपलेस वेब खोज और स्क्रैपिंग टूल्स
डेस्कटॉप ऐप पर, वही मान Extensions → Add custom extension में जाते हैं: नाम scrapeless, कमांड npx -y scrapeless-mcp-server, और एक पर्यावरण चर SCRAPELESS_KEY।
एक बार-बार रन के लिए, कॉन्फ़िग फ़ाइल को छोड़ दें और इनलाइन एक्सटेंशन पास करें। --with-extension फ्लैग एक पूर्ण कमांड लेता है जिसमें इसके पर्यावरण चर होते हैं:
bash
goose run --with-extension "SCRAPELESS_KEY=your-key npx -y scrapeless-mcp-server@0.4.9" \
--text "Google पर 'वेब स्क्रैपिंग' के लिए खोजें और मुझे पहला परिणाम दें।"
गूज क्या देखता है: टूल सूची
कनेक्शन पर, गूज MCP हैंडशेक करता है और सर्वर के टूल को लोड करता है। स्क्रैपलेस MCP सर्वर (प्रोटोकॉल 2024-11-05) 21 टूल का विज्ञापन करता है:
text
google_search google_trends scrape_html scrape_markdown
scrape_screenshot browser_create browser_goto browser_click
browser_type browser_press_key browser_get_text browser_get_html
browser_snapshot browser_screenshot browser_scroll browser_scroll_to
browser_go_back browser_go_forward browser_wait browser_wait_for
browser_close
पहले पांच रिटर्न डेटा सीधे भेजते हैं; browser_* सेट Scrapeless Scraping Browser पर एक स्थायी सत्र संचालित करता है — एक बनाएं, नेविगेट करें, कार्य करें, पढ़ें और बंद करें। इन उपकरणों पर बनाए गए अधिक एजेंट कार्यों के लिए, 5 Scrapeless MCP उपयोग केस देखें।
प्रॉम्प्ट-प्रेरित उपयोग
एक्सटेंशन पंजीकृत होने के साथ, आप गूज को एक कार्य सौंपते हैं और यह उपकरण चुनता है। इसे खोज करने के लिए कहने पर:
bash
goose run --no-session \
--text "Scrapeless google_search उपकरण का उपयोग करके Google पर 'वेब स्क्रैपिंग' के लिए खोजें। रिपोर्ट करें कि कितने जैविक परिणाम वापस आए और पहले जैविक परिणाम का सटीक शीर्षक क्या है।"
गूज आपके मॉडल पर एक सत्र शुरू करता है, उपकरण को कॉल करता है और परिणाम से उत्तर देता है। लाइव रन ने एजेंट को उपकरण को कॉल करते और वास्तविक डेटा रिपोर्ट करते हुए दिखाया:
text
▸ google_search (q: वेब स्क्रैपिंग)
"वेब स्क्रैपिंग" के लिए Google खोज ने 8 जैविक परिणाम लौटाए।
पहले जैविक परिणाम का सटीक शीर्षक "वेब स्क्रैपिंग" है जो विकिपीडिया से है।
एजेंट ने google_search चुना, क्वेरी दी, और सुसंगत उत्तर से संख्या और पहले शीर्षक को पढ़ा — आपकी साइड पर कोई पार्सिंग कोड नहीं।
निष्कर्ष
गूज सिर्फ उतना ही सक्षम है जितना कि वह उपकरणों तक पहुंच सकता है, और Scrapeless MCP सर्वर इसे 21 उपकरण प्रदान करता है: खोज, प्रवृत्तियाँ, तीन पृष्ठ-से-डेटा परिवर्तक, और एक पूर्ण क्लाउड-ब्राउजर टूलसेट। सर्वर को एक stdio एक्सटेंशन के रूप में पंजीकृत करें — config.yaml में या --with-extension के साथ इनलाइन — SCRAPELESS_KEY सेट करें, और गूज हर कार्य के लिए सही उपकरण कॉल करता है और लाइव वेब डेटा से उत्तर देता है। संपूर्ण एकीकरण एक एक्सटेंशन प्रविष्टि है; एजेंट जो कुछ भी इसके साथ करता है वह एक प्रॉम्प्ट है।
क्या आप अपने गूज एजेंट को लाइव वेब डेटा देना चाहते हैं? Scrapeless डैशबोर्ड से मुफ्त में शुरू करें, MCP सर्वर डॉक्यूमेंटेशन पढ़ें, या Scrapeless मूल्य निर्धारण पर योजनाओं की तुलना करें।
अक्सर पूछे जाने वाले प्रश्न
प्रश्न: गूज क्या है?
उत्तर: गूज ब्लॉक का एक ओपन-सोर्स एआई एजेंट है जो कमांड लाइन और डेस्कटॉप ऐप के रूप में कार्य करता है। यह स्वतंत्र रूप से कार्य करता है और मॉडल कंटेक्स्ट प्रोटोकॉल के माध्यम से बाहरी उपकरणों से जुड़ता है, इसलिए इसकी क्षमताएं बढ़ती हैं जब आप हर MCP सर्वर जोड़ते हैं।
प्रश्न: गूज Scrapeless से कैसे जुड़ता है?
उत्तर: गूज Scrapeless MCP सर्वर को stdio उपप्रक्रिया के रूप में लॉन्च करता है (npx -y scrapeless-mcp-server) और मानक इनपुट/आउटपुट पर MCP के माध्यम से बात करता है। आप इसे एक बार config.yaml में या goose run --with-extension के साथ इनलाइन एक्सटेंशन के रूप में पंजीकृत करते हैं।
प्रश्न: Scrapeless MCP सर्वर कौन से उपकरण प्रदान करता है?
उत्तर: इक्कीस उपकरण: google_search, google_trends, scrape_html, scrape_markdown, scrape_screenshot, और 16 browser_* क्रियाएँ जो एक क्लाउड ब्राउज़र को संचालित करने के लिए हैं (नेविगेट, क्लिक, टाइप, टेक्स्ट या HTML पढ़ें, स्क्रीनशॉट, स्क्रॉल, इंतजार करें, और बंद करें)।
प्रश्न: मैं अपना Scrapeless API कुंजी कहां डालूं?
उत्तर: एक्सटेंशन के लिए SCRAPELESS_KEY पर्यावरण चर में — या तो config.yaml में envs ब्लॉक में या --with-extension कमांड स्ट्रिंग के भाग के रूप में। गूज इसे सर्वर उपप्रक्रिया को पास करता है।
प्रश्न: क्या मुझे अभी भी एक मॉडल प्रदाता की आवश्यकता है?
उत्तर: हाँ। Scrapeless उपकरण प्रदान करता है; गूज का अपना मॉडल प्रदाता यह निर्णय लेता है कि कब उन्हें कॉल करना है। अपने प्रदाता को गूज में सामान्य रूप से कॉन्फ़िगर करें।
प्रश्न: क्या एजेंट स्वचालित रूप से उपकरणों को कॉल करता है?
उत्तर: हाँ। एक बार जब एक्सटेंशन पंजीकृत हो जाता है, आप कार्य को साधारण भाषा में वर्णित करते हैं और गूज उचित Scrapeless उपकरण का चयन करता है, इसे चलाता है, और लौटाए गए डेटा से उत्तर देता है।
प्रश्न: क्या गूज पृष्ठों के साथ बातचीत कर सकता है, न कि केवल उन्हें लाना?
उत्तर: हाँ। browser_* उपकरण एक स्थायी क्लाउड-ब्राउज़र सत्र को संचालित करते हैं — browser_create, browser_goto, browser_click, browser_type, browser_get_text, और browser_close — इसलिए एजेंट उन पृष्ठों पर काम कर सकता है जिन्हें बातचीत की आवश्यकता होती है।
स्क्रैपलेस में, हम केवल सार्वजनिक रूप से उपलब्ध डेटा का उपयोग करते हैं, जबकि लागू कानूनों, विनियमों और वेबसाइट गोपनीयता नीतियों का सख्ती से अनुपालन करते हैं। इस ब्लॉग में सामग्री केवल प्रदर्शन उद्देश्यों के लिए है और इसमें कोई अवैध या उल्लंघन करने वाली गतिविधियों को शामिल नहीं किया गया है। हम इस ब्लॉग या तृतीय-पक्ष लिंक से जानकारी के उपयोग के लिए सभी देयता को कोई गारंटी नहीं देते हैं और सभी देयता का खुलासा करते हैं। किसी भी स्क्रैपिंग गतिविधियों में संलग्न होने से पहले, अपने कानूनी सलाहकार से परामर्श करें और लक्ष्य वेबसाइट की सेवा की शर्तों की समीक्षा करें या आवश्यक अनुमतियाँ प्राप्त करें।



