🎯 कस्टमाइज़ करने योग्य, डिटेक्शन-प्रतिरोधी क्लाउड ब्राउज़र जो स्व-विकसित Chromium द्वारा संचालित है, वेब क्रॉलर और एआई एजेंट्स के लिए डिज़ाइन किया गया। 👉अभी आज़माएं
वापस ब्लॉग पर

गूज + स्क्रेपलेस: ब्लॉक के एआई एजेंट को MCP के माध्यम से लाइव वेब डेटा दें।

Daniel Kim
Daniel Kim

Lead Scraping Automation Engineer

16-Jul-2026

TL;DR:

  • गूज ब्लॉक का ओपन-सोर्स एआई एजेंट है, और यह मॉडल कॉन्टेक्स्ट प्रोटोकॉल (MCP) के जरिए बाहरी टूल्स तक पहुँचता है। स्क्रैपलेस MCP सर्वर जोड़ने से गूज को लाइव वेब खोज और स्क्रैपिंग मिलती है जो कि इसे खुद नहीं है।
  • स्क्रैपलेस MCP सर्वर 21 टूल प्रदान करता हैgoogle_search, google_trends, scrape_html, scrape_markdown, scrape_screenshot, और क्लाउड ब्राउज़र को चलाने के लिए 16 browser_* क्रियाएँ।
  • आप इसे एक stdio एक्सटेंशन के रूप में जोड़ते हैं, या तो गूज के config.yaml में या goose run --with-extension के साथ इनलाइन, npx -y scrapeless-mcp-server पर अपने स्क्रैपलेस की के साथ SCRAPELESS_KEY पर्यावरण चर इंगित करते हुए।
  • गूज तब अपने आप टूल्स को कॉल करता है। एक कार्य दिए जाने पर, एजेंट सही स्क्रैपलेस टूल चुनता है, इसे चलाता है, और वापस किए गए डेटा से उत्तर देता है — बिना किसी गोंद कोड के।
  • फ्री शुरू करें। नए स्क्रैपलेस खातों में मुफ्त क्रेडिट शामिल होते हैं — app.scrapeless.com पर साइन अप करें।

गूज, ब्लॉक का ओपन-सोर्स एजेंट, कोड लिखता है और चलाता है, कार्यप्रवाह को चलाता है, और अपने आप बाहरी सेवाओं को कॉल करता है। जो वह बॉक्स से बाहर नहीं कर सकता, वह लाइव वेब को देखना है — इसका ज्ञान मॉडल के प्रशिक्षण के कट-ऑफ पर रुकता है। गूज उसी तरह उस अंतर को बंद करता है जैसे हर MCP होस्ट करता है: मॉडल कॉन्टेक्स्ट प्रोटोकॉल सर्वरों से कनेक्ट करके जो टूल्स को एक्सपोज करता है। यह गाइड गूज को स्क्रैपलेस MCP सर्वर से कनेक्ट करता है, ताकि एजेंट Google को खोज सके और अपनी तर्क प्रक्रिया के हिस्से के रूप में पृष्ठों को स्क्रैप कर सके। नीचे दी गई हर कमांड, टूल का नाम, और परिणाम एक लाइव रन से कैद किए गए हैं।

यह एकीकरण क्या सक्षम करता है

स्क्रैपलेस MCP सर्वर एक stdio सर्वर है: गूज इसे एक उप-प्रक्रिया के रूप में लॉन्च करता है और मानक इनपुट और आउटपुट के माध्यम से MCP — एक JSON-RPC प्रोटोकॉल — में बात करता है। एक बार कनेक्ट होने के बाद, गूज को प्राप्त होता है:

  • लाइव खोज — वास्तविक समय के परिणामों और रुचि डेटा के लिए google_search और google_trends
  • पृष्ठ निष्कर्षण — किसी भी URL को HTML, साफ Markdown, या एक छवि में बदलने के लिए scrape_html, scrape_markdown, और scrape_screenshot
  • क्लाउड-ब्राउज़र नियंत्रण — इंटरैक्शन की आवश्यकता वाले पृष्ठों के लिए 16 browser_* टूल्स (browser_goto, browser_click, browser_type, browser_get_text, browser_snapshot, और अधिक) एक प्रबंधित ब्राउज़र को चलाते हैं।

एजेंट तय करता है कि इनमें से किसे कॉल करना है; आप कार्य का वर्णन स्पष्ट भाषा में करते हैं।

पूर्वापेक्षाएँ

  • गूज स्थापित (CLI या डेस्कटॉप) — इंस्टॉलर के लिए गूज प्रोजेक्ट देखें।
  • Node.js जिसमें npx उपलब्ध है, ताकि गूज npx -y scrapeless-mcp-server के साथ सर्वर को लॉन्च कर सके।
  • एक स्क्रैपलेस एपीआई कुंजी — app.scrapeless.com पर मुफ्त योजना पर एक प्राप्त करें।
  • गूज में एक मॉडल प्रदाता कॉन्फ़िगर किया गया (एजेंट की तर्क प्रक्रिया आपके चुने हुए मॉडल पर चलती है)।

गूज में स्क्रैपलेस MCP सर्वर जोड़ें

एक्सटेंशन को पंजीकृत करने के लिए दो तरीके हैं। एक स्थायी सेटअप के लिए, इसे गूज के config.yaml (Linux पर, ~/.config/goose/config.yaml) में, extensions के तहत जोड़ें:

yaml Copy
extensions:
  scrapeless:
    name: scrapeless
    type: stdio
    cmd: npx
    args:
      - -y
      - scrapeless-mcp-server@0.4.9
    envs:
      SCRAPELESS_KEY: your-scrapeless-api-key
    enabled: true
    bundled: false
    timeout: 300
    description: स्क्रैपलेस वेब खोज और स्क्रैपिंग टूल्स

डेस्कटॉप ऐप पर, वही मान Extensions → Add custom extension में जाते हैं: नाम scrapeless, कमांड npx -y scrapeless-mcp-server, और एक पर्यावरण चर SCRAPELESS_KEY

एक बार-बार रन के लिए, कॉन्फ़िग फ़ाइल को छोड़ दें और इनलाइन एक्सटेंशन पास करें। --with-extension फ्लैग एक पूर्ण कमांड लेता है जिसमें इसके पर्यावरण चर होते हैं:

bash Copy
goose run --with-extension "SCRAPELESS_KEY=your-key npx -y scrapeless-mcp-server@0.4.9" \
  --text "Google पर 'वेब स्क्रैपिंग' के लिए खोजें और मुझे पहला परिणाम दें।"

गूज क्या देखता है: टूल सूची

कनेक्शन पर, गूज MCP हैंडशेक करता है और सर्वर के टूल को लोड करता है। स्क्रैपलेस MCP सर्वर (प्रोटोकॉल 2024-11-05) 21 टूल का विज्ञापन करता है:

text Copy
google_search      google_trends      scrape_html        scrape_markdown
scrape_screenshot  browser_create     browser_goto       browser_click
browser_type       browser_press_key  browser_get_text   browser_get_html
browser_snapshot   browser_screenshot browser_scroll     browser_scroll_to
browser_go_back    browser_go_forward browser_wait       browser_wait_for
browser_close

पहले पांच रिटर्न डेटा सीधे भेजते हैं; browser_* सेट Scrapeless Scraping Browser पर एक स्थायी सत्र संचालित करता है — एक बनाएं, नेविगेट करें, कार्य करें, पढ़ें और बंद करें। इन उपकरणों पर बनाए गए अधिक एजेंट कार्यों के लिए, 5 Scrapeless MCP उपयोग केस देखें।

प्रॉम्प्ट-प्रेरित उपयोग

एक्सटेंशन पंजीकृत होने के साथ, आप गूज को एक कार्य सौंपते हैं और यह उपकरण चुनता है। इसे खोज करने के लिए कहने पर:

bash Copy
goose run --no-session \
  --text "Scrapeless google_search उपकरण का उपयोग करके Google पर 'वेब स्क्रैपिंग' के लिए खोजें। रिपोर्ट करें कि कितने जैविक परिणाम वापस आए और पहले जैविक परिणाम का सटीक शीर्षक क्या है।"

गूज आपके मॉडल पर एक सत्र शुरू करता है, उपकरण को कॉल करता है और परिणाम से उत्तर देता है। लाइव रन ने एजेंट को उपकरण को कॉल करते और वास्तविक डेटा रिपोर्ट करते हुए दिखाया:

text Copy
▸ google_search  (q: वेब स्क्रैपिंग)

"वेब स्क्रैपिंग" के लिए Google खोज ने 8 जैविक परिणाम लौटाए।
पहले जैविक परिणाम का सटीक शीर्षक "वेब स्क्रैपिंग" है जो विकिपीडिया से है।

एजेंट ने google_search चुना, क्वेरी दी, और सुसंगत उत्तर से संख्या और पहले शीर्षक को पढ़ा — आपकी साइड पर कोई पार्सिंग कोड नहीं।

निष्कर्ष

गूज सिर्फ उतना ही सक्षम है जितना कि वह उपकरणों तक पहुंच सकता है, और Scrapeless MCP सर्वर इसे 21 उपकरण प्रदान करता है: खोज, प्रवृत्तियाँ, तीन पृष्ठ-से-डेटा परिवर्तक, और एक पूर्ण क्लाउड-ब्राउजर टूलसेट। सर्वर को एक stdio एक्सटेंशन के रूप में पंजीकृत करें — config.yaml में या --with-extension के साथ इनलाइन — SCRAPELESS_KEY सेट करें, और गूज हर कार्य के लिए सही उपकरण कॉल करता है और लाइव वेब डेटा से उत्तर देता है। संपूर्ण एकीकरण एक एक्सटेंशन प्रविष्टि है; एजेंट जो कुछ भी इसके साथ करता है वह एक प्रॉम्प्ट है।

क्या आप अपने गूज एजेंट को लाइव वेब डेटा देना चाहते हैं? Scrapeless डैशबोर्ड से मुफ्त में शुरू करें, MCP सर्वर डॉक्यूमेंटेशन पढ़ें, या Scrapeless मूल्य निर्धारण पर योजनाओं की तुलना करें।

अक्सर पूछे जाने वाले प्रश्न

प्रश्न: गूज क्या है?
उत्तर: गूज ब्लॉक का एक ओपन-सोर्स एआई एजेंट है जो कमांड लाइन और डेस्कटॉप ऐप के रूप में कार्य करता है। यह स्वतंत्र रूप से कार्य करता है और मॉडल कंटेक्स्ट प्रोटोकॉल के माध्यम से बाहरी उपकरणों से जुड़ता है, इसलिए इसकी क्षमताएं बढ़ती हैं जब आप हर MCP सर्वर जोड़ते हैं।

प्रश्न: गूज Scrapeless से कैसे जुड़ता है?
उत्तर: गूज Scrapeless MCP सर्वर को stdio उपप्रक्रिया के रूप में लॉन्च करता है (npx -y scrapeless-mcp-server) और मानक इनपुट/आउटपुट पर MCP के माध्यम से बात करता है। आप इसे एक बार config.yaml में या goose run --with-extension के साथ इनलाइन एक्सटेंशन के रूप में पंजीकृत करते हैं।

प्रश्न: Scrapeless MCP सर्वर कौन से उपकरण प्रदान करता है?
उत्तर: इक्कीस उपकरण: google_search, google_trends, scrape_html, scrape_markdown, scrape_screenshot, और 16 browser_* क्रियाएँ जो एक क्लाउड ब्राउज़र को संचालित करने के लिए हैं (नेविगेट, क्लिक, टाइप, टेक्स्ट या HTML पढ़ें, स्क्रीनशॉट, स्क्रॉल, इंतजार करें, और बंद करें)।

प्रश्न: मैं अपना Scrapeless API कुंजी कहां डालूं?
उत्तर: एक्सटेंशन के लिए SCRAPELESS_KEY पर्यावरण चर में — या तो config.yaml में envs ब्लॉक में या --with-extension कमांड स्ट्रिंग के भाग के रूप में। गूज इसे सर्वर उपप्रक्रिया को पास करता है।

प्रश्न: क्या मुझे अभी भी एक मॉडल प्रदाता की आवश्यकता है?
उत्तर: हाँ। Scrapeless उपकरण प्रदान करता है; गूज का अपना मॉडल प्रदाता यह निर्णय लेता है कि कब उन्हें कॉल करना है। अपने प्रदाता को गूज में सामान्य रूप से कॉन्फ़िगर करें।

प्रश्न: क्या एजेंट स्वचालित रूप से उपकरणों को कॉल करता है?
उत्तर: हाँ। एक बार जब एक्सटेंशन पंजीकृत हो जाता है, आप कार्य को साधारण भाषा में वर्णित करते हैं और गूज उचित Scrapeless उपकरण का चयन करता है, इसे चलाता है, और लौटाए गए डेटा से उत्तर देता है।

प्रश्न: क्या गूज पृष्ठों के साथ बातचीत कर सकता है, न कि केवल उन्हें लाना?
उत्तर: हाँ। browser_* उपकरण एक स्थायी क्लाउड-ब्राउज़र सत्र को संचालित करते हैं — browser_create, browser_goto, browser_click, browser_type, browser_get_text, और browser_close — इसलिए एजेंट उन पृष्ठों पर काम कर सकता है जिन्हें बातचीत की आवश्यकता होती है।

स्क्रैपलेस में, हम केवल सार्वजनिक रूप से उपलब्ध डेटा का उपयोग करते हैं, जबकि लागू कानूनों, विनियमों और वेबसाइट गोपनीयता नीतियों का सख्ती से अनुपालन करते हैं। इस ब्लॉग में सामग्री केवल प्रदर्शन उद्देश्यों के लिए है और इसमें कोई अवैध या उल्लंघन करने वाली गतिविधियों को शामिल नहीं किया गया है। हम इस ब्लॉग या तृतीय-पक्ष लिंक से जानकारी के उपयोग के लिए सभी देयता को कोई गारंटी नहीं देते हैं और सभी देयता का खुलासा करते हैं। किसी भी स्क्रैपिंग गतिविधियों में संलग्न होने से पहले, अपने कानूनी सलाहकार से परामर्श करें और लक्ष्य वेबसाइट की सेवा की शर्तों की समीक्षा करें या आवश्यक अनुमतियाँ प्राप्त करें।

सबसे लोकप्रिय लेख

सूची