कैसे GitHub Copilot CLI में वेब खोज जोड़ें: Scrapeless MCP एकीकरण गाइड
Advanced Bot Mitigation Engineer
मुख्य निष्कर्ष:
- एक कॉन्फ़िग फ़ाइल Copilot CLI में लाइव वेब एक्सेस को कनेक्ट करती है।
~/.copilot/mcp-config.jsonमें एकलscrapelessब्लॉक डालें और आपका टर्मिनल एजेंट एक Google SERP स्क्रैपर, एक ट्रेंड्स स्क्रैपर, HTML/Markdown/स्क्रीनशॉट पृष्ठ सहायकों, और एक पूर्ण क्लाउड-ब्राउज़र ऑटोमेशन सतह प्राप्त करता है - कोई SDK कोड नहीं, कोई अतिरिक्त सेवा चलाने की आवश्यकता नहीं। - एजेंट सर्च करता है, रेंडर करता है, और साधारण प्रॉम्प्ट्स से एक ब्राउज़र को चलाता है। इसे प्राकृतिक भाषा में कहें कि Google पर खोजें, एक JavaScript-भारी पृष्ठ रेंडर करें, या एक बहु-चरण प्रवाह में क्लिक करें, और यह स्थानीय फ़ाइलों और प्रशिक्षण-कटऑफ ज्ञान पर सीमित होने के बजाय सही उपकरण कॉल तैयार करता है।
- रेज़िडेंशियल प्रॉक्सी और एंटी-डिटेक्शन क्लाउड-साइड पर हैंडल किए जाते हैं। प्रत्येक अनुरोध Scrapeless एंटी-डिटेक्शन क्लाउड ब्राउज़र के माध्यम से होता है जिसमें 195+ देशों में रेजिडेंशियल प्रॉक्सी शामिल हैं, इसलिए एजेंट को व्यावसायिक साइटों पर बिना किसी प्रॉक्सी या फिंगरप्रिंट सेटअप के रेंडर किया गया, उपयोगी प्रतिक्रिया मिलती है।
- यह Copilot के कोडिंग उपकरणों के साथ उसी सत्र में चलता है। Scrapeless उपकरण Copilot CLI के फ़ाइल संपादनों, टर्मिनल comandos, और कोड जनरेशन के बगल में होते हैं, इसलिए एकल एजेंट टर्न लाइव वेब को स्क्रैप कर सकता है और परिणाम को सीधे आपके द्वारा बनाए जा रहे कोड में लिख सकता है।
- SERP, स्टेटलेस स्क्रैपिंग, और ब्राउज़र स्वचालन में 21 उपकरण। Scrapeless MCP सर्वर
google_search,google_trends,scrape_html/scrape_markdown/scrape_screenshot, के साथ-साथ 16browser_*ऑटोमेशन उपकरणों को उजागर करता है - एक नामस्थान जो एजेंट का योजनाकार हर मोड़ पर खींचता है। - HTTP-स्ट्रीम करने योग्य परिवहन होस्ट किए गए सेटअप को कवर करता है। कार्यस्थल पर
npxके माध्यम से स्टडियो डिफॉल्ट है; दूरस्थ विकास कंटेनरों या CI धावकों के लिए जहाँ एक चाइल्ड प्रक्रिया शुरू करना कठिन होता है, उसी कॉन्फ़िग को स्ट्रीम करने योग्य HTTP अंत बिंदु पर इंगित करें। - शुरू करने के लिए मुफ्त। नए Scrapeless खाते में मुफ्त स्क्रैपिंग ब्राउज़र रनटाइम शामिल है - Scrapeless पर साइन अप करें।
परिचय: आपका टर्मिनल एजेंट, अब लाइव वेब पर नज़र रखता है
GitHub Copilot CLI 25-फरवरी-2026 को एक टर्मिनल-नेटिव कोडिंग एजेंट के रूप में GA पर गया, जो डिफ़ॉल्ट रूप से Claude Sonnet 4.5 का उपयोग करता है। यह आपकी रिपॉजिटरी को पढ़ता है, फ़ाइलों को संपादित करता है, आदेश चलाता है, और सामने मौजूद प्रोजेक्ट पर तर्क करता है - बिना शेल को छोड़े। जो कार्य यह डिबॉक्स से बाहर नहीं कर सकता है, वह लाइव वेब को देखना है। इसका ज्ञान प्रशिक्षण कटऑफ और डिस्क पर फ़ाइलों पर रुक जाता है।
जब भी किसी कार्य को वर्तमान, सार्वजनिक डेटा की आवश्यकता होती है, तो यह अंतर दिखाई देता है। एजेंट लाइव SERP को नहीं खींच सकता, प्रतियोगी की प्राइसिंग पृष्ठ को नहीं पढ़ सकता, नवीनतम चेंजलॉग की जांच नहीं कर सकता, या केवल JavaScript ऐप को नहीं रेंडर कर सकता - इसलिए उत्तर पुराने हो जाते हैं, समय-संवेदनशील कुछ को ब्राउज़र से मैन्युअल कॉपी-पेस्ट में बदल दिया जाता है, और एजेंट अपनी कटौती के बाद प्रकाशित किसी भी चीज़ पर अंधा उड़ता है।
यह पोस्ट उस अंतर को बंद करती है जिससे Scrapeless MCP सर्वर को GitHub Copilot CLI में कनेक्ट किया जाता है। एक कॉन्फ़िग ब्लॉक एजेंट को Google खोज, JavaScript रेंडरिंग, और एक पूर्ण क्लाउड ब्राउज़र प्रदान करता है, जो सभी को एक ही प्राकृतिक-भाषा प्रॉम्प्ट के माध्यम से पहुँचा जा सकता है, जो पहले से कोड के लिए लिया जाता है। अन्य MCP क्लाइंट्स के माध्यम से समान Scrapeless सतह के लिए, Google एंटीग्रेविटी वॉकथ्रू और MCP सर्वर वॉकथ्रू देखें।
इसके साथ आप क्या कर सकते हैं
- लाइव SERP अनुसंधान टर्मिनल में। एजेंट से एक क्वेरी के लिए
google_searchचलाने के लिए कहें और शीर्ष परिणामों को JSON के रूप में वापस प्राप्त करें, ताकि अनुसंधान शेल में होता है, न कि एक अलग ब्राउज़र टैब में। - प्रतिस्पर्धी और मूल्य निर्धारण स्नैपशॉट। एक प्रतिस्पर्धी URL को प्रॉम्प्ट में डालें और एजेंट से प्राइसिंग पृष्ठ को रेंडर करके योजना नाम, कीमतें, और सुविधाएँ निकालने के लिए कहें जिसे आप अपने कोड के बगल में डाल सकते हैं।
- डॉक और चेंजलॉग लुकअप जो कोड को फीड करते हैं। एजेंट से एक पुस्तकालय के वर्तमान डॉक या रिलीज नोट्स को साफ मार्कडाउन के रूप में लाने के लिए कहें और रेंडर किए गए पाठ के खिलाफ लिखें बजाय इसके कि API की पुरानी स्मृति पर लिखें।
- मार्केट और ट्रेंड्स चेक।
google_trendsका उपयोग करें ताकि एक विषय के लिए लक्षित क्षेत्र में रुचि संकेतों को खींचा जा सके, फिर फीचर कॉपी, सामग्री टेम्पलेट, या प्रयोग विचारों के साथ वर्तमान सबूत के साथ बीज अंकित करें। - JS-पृष्ठ के निष्कर्षण को टाइप की गई रिकॉर्ड में। एजेंट को एक JavaScript-रेंडर किए गए पृष्ठ पर इंगित करें; क्लाउड ब्राउज़र इसे हाइड्रेट करता है और एजेंट परिणाम को आपके द्वारा लिखे जा रहे स्क्रिप्ट के लिए एक टाइप की गई वस्तु में पार्स करता है।
- बहु-चरण ब्राउज़र प्रवाह।
browser_goto,browser_click,browser_type, औरbrowser_scrollको जोड़कर एजेंट को पृष्ठांकन के माध्यम से नेविगेट करने, पैनल को विस्तारित करने, या निकासी के पहले एक विजार्ड के माध्यम से कदम उठाने में मदद करें। - समीक्षा के लिए स्क्रीनशॉट कैप्चर।
scrape_screenshotयाbrowser_screenshotका उपयोग करें ताकि एजेंट बातचीत से संलग्न करने के लिए या कार्यक्षेत्र में सहेजने के लिए एक छवि के रूप में रेंडर किए गए पृष्ठ को पकड़ सके। - खोज-फिर-पूरी पाइपलाइनों।
google_searchकोscrape_markdownके साथ मिलाकर, एजेंट शीर्ष परिणामों को खोजता है, प्रत्येक को पढ़ता है, और उन्हें एक ही टर्मिनल टर्न में संक्षेपित करता है।
स्क्रेपलेस में, हम केवल सार्वजनिक रूप से उपलब्ध डेटा तक पहुंचते हैं, जबकि लागू कानूनों, विनियमों और वेबसाइट की गोपनीयता नीतियों का सख्ती से पालन करते हैं। इस पोस्ट का कंटेंट केवल प्रदर्शनी उद्देश्यों के लिए है।
स्क्रेपलेस MCP सर्वर क्यों
स्क्रेपलेस MCP सर्वर एक अनुकूलन योग्य, एंटी-डिटेक्शन ब्रिज है जो एक एआई एजेंट और लाइव वेब के बीच है। विशेष रूप से GitHub Copilot CLI के लिए, यह लाता है:
- एंटी-डिटेक्शन क्लाउड ब्राउज़र जिसमें JavaScript रेंडरिंग होती है। पृष्ठ निकालने के पहले पूर्ण स्क्रेपलेस स्क्रैपिंग ब्राउज़र में हाइड्रेट होते हैं, इसलिए SPAs, अनंत-स्क्रॉल फ़ीड्स और लेज़ी-लोडेड पैनल पहले श्रेणी के लक्ष्यों में बदल जाते हैं
browser_goto+browser_get_htmlके लिए। - 195+ देशों में आवासीय प्रॉक्सी। भू-सीमा वाले प्रश्न स्थानीय उपयोगकर्ता द्वारा देखे जाने वाले लिस्टिंग को लौटाते हैं, प्रॉक्सी निकासी पूरी तरह से स्क्रेपलेस साइड पर हैंडल की जाती है।
- एक stdio कमांड के माध्यम से
npx, कोई SDK कोड नहीं। सर्वरnpx -y scrapeless-mcp-serverसे एक चाइल्ड प्रोसेस के रूप में लॉन्च होता है; आपकी परियोजना में बनाने, होस्ट करने या आयात करने के लिए कुछ भी नहीं है। - SERP, Stateless scraping और पूर्ण ब्राउज़र ऑटोमेशन में फैले 21 टूल्स।
google_searchऔरgoogle_trendsSERP डेटा को कवर करते हैं,scrape_html/scrape_markdown/scrape_screenshotएक-बार के पृष्ठ फेच करते हैं, और 16browser_*टूल्स Stateful नेविगेशन, क्लिकिंग, टाइपिंग, स्क्रॉलिंग और स्क्रीनशॉट को कवर करते हैं। - हॉस्ट किए गए एजेंटों के लिए HTTP-स्ट्रीम करने योग्य ट्रांसपोर्ट। जब Copilot CLI एक दूरस्थ कंटेनर या CI रनर में चलता है, तो वही सतह स्ट्रीम करने योग्य HTTP एंडपोइंट के माध्यम से पहुँच योग्य होती है, stdio के बजाय।
फ्री प्लान इसे सेट करने और वास्तविक प्रोम्प्ट चलाने के लिए पर्याप्त है; जब आप इससे बड़े होते हैं, तो प्राइसिंग पेज पर कोटा की तुलना करें। फ्री प्लान पर अपना API कुंजी app.scrapeless.com पर प्राप्त करें।
पूर्वापेक्षाएँ
- Node.js 18 या नया वर्कस्टेशन पर — Copilot CLI npm से इंस्टॉल होता है, और stdio MCP सर्वर
npxके साथ प्रारंभ किया जाता है। - GitHub Copilot CLI इंस्टॉल किया गया और एक सक्रिय GitHub Copilot सब्सक्रिप्शन। CLI आपके GitHub खाते के खिलाफ प्रमाणीकरण करता है, और एजेंट लूप Copilot कोटा पर निर्भर करता है; बिना सक्रिय सब्सक्रिप्शन के मॉडल स्टेप नहीं चलेगा।
- एक स्क्रेपलेस खाता और API कुंजी — स्क्रेपलेस पर फ्री प्लान पर साइन अप करें और सेटिंग्स → API कुंजी प्रबंधन से कुंजी कॉपी करें।
- बुनियादी टर्मिनल परिचितता — पूरा सेटअप एक मुट्ठी भर कमांड और एक छोटे JSON फ़ाइल से है।
इंस्टॉल
सेटअप पांच उप-चरण हैं; प्रत्येक स्वतंत्र रूप से सत्यापित किया जा सकता है।
1. GitHub Copilot CLI इंस्टॉल करें
npm से CLI को वैश्विक स्तर पर इंस्टॉल करें, फिर इसे लॉन्च करें:
bash
npm install -g @github/copilot
copilot
पहली लॉन्च आपको इंटरैक्टिव Copilot सत्र में ले जाती है जहाँ शेष चरण चलते हैं।
2. Copilot को प्रमाणीकरण करें
सत्र के भीतर, /login स्लेश कमांड के साथ साइन इन करें और GitHub डिवाइस-प्राधिकरण प्रवाह का पालन करें:
text
/login
यह सक्रिय GitHub Copilot सब्सक्रिप्शन की आवश्यकता होती है — CLI आपकी GitHub पहचान का उपयोग करता है दोनों प्रमाणीकरण और मॉडल कोटा के लिए। Copilot CLI स्वचालित रूप से Claude Sonnet 4.5 पर सेट होता है; कभी भी /model स्लेश कमांड के साथ बैकएंड बदल सकते हैं।
3. स्क्रेपलेस MCP सर्वर (stdio) जोड़ें
Copilot CLI ~/.copilot/mcp-config.json से MCP सर्वरों को पढ़ता है। फ़ाइल बनाएँ (या मौजूदा mcpServers ऑब्जेक्ट में scrapeless ब्लॉक जोड़ें) stdio कॉन्फ़िगरेशन के साथ:
json
{
"mcpServers": {
"scrapeless": {
"type": "local",
"command": "npx",
"args": ["-y", "scrapeless-mcp-server"],
"env": { "SCRAPELESS_KEY": "आपकी_स्क्रेपलेस_कुंजी" },
"tools": ["*"]
}
}
}
एक विवरण जो लोगों को उलझाता है: स्क्रेपलेस MCP सर्वर अपनी कुंजी SCRAPELESS_KEY से पढ़ता है, न कि SCRAPELESS_API_KEY से। स्क्रेपलेस CLI और SDK SCRAPELESS_API_KEY का उपयोग करते हैं, लेकिन MCP सर्वर इसका प्रलेखित अपवाद है — यहाँ SCRAPELESS_KEY का उपयोग करें, अन्यथा सर्वर बिना क्रेडेंशियल्स के शुरू होगा। सर्वर का स्रोत github.com/scrapeless-ai/scrapeless-mcp-server पर है।
आपकी_स्क्रेपलेस_कुंजी के लिए अपनी असली कुंजी डालें। "tools": ["*"] लाइन पूरी टूल सतह को उजागर करती है। आप /mcp स्लेश आदेशों के साथ एक सत्र के भीतर भी सर्वरों का प्रबंधन कर सकते हैं — /mcp add, /mcp show, /mcp edit, /mcp delete, /mcp enable, और /mcp disable — जो उसी कॉन्फ़िगरेशन फ़ाइल में लिखते हैं।
4. या HTTP स्ट्रीम करने योग्य मोड का उपयोग करें
यदि होस्ट npx को विश्वसनीय रूप से स्टार्ट नहीं कर सकता — एक होस्टेड डेवलप कंटेनर, एक दूरस्थ कार्यक्षेत्र, या एक CI सैंडबॉक्स — तो Copilot को स्थानीय प्रक्रिया के बजाय स्क्रेपलेस HTTP एंडपॉइंट पर इंगित करें:
json
{
"mcpServers": {
"scrapeless": {
"type": "http",
"url": "https://api.scrapeless.com/mcp",
"headers": { "x-api-token": "आपकी_स्क्रेपलेस_कुंजी" },
"tools": ["*"]
}
}
}
एक ही कुंजी मूल्य दोनों मोड में काम करता है; ध्यान दें कि HTTP स्ट्रीम करने योग्य इसे x-api-token हेडर के रूप में पारित करता है न कि SCRAPELESS_KEY एन्वायरनमेंट वेरिएबल के रूप में। स्टैडियो एक डेवलपर कार्यस्थल पर सही डिफ़ॉल्ट है; HTTP स्ट्रीम करने योग्य कहीं भी सही डिफ़ॉल्ट है जहाँ एक लंबे समय तक चलने वाले चाइल्ड प्रोसेस को जीवित रखना कठिन हो।
5. कनेक्शन सत्यापित करें
CLI लॉन्च करें और जुड़े हुए MCP सर्वरों की सूची बनाएं:
text
copilot
/mcp
scrapeless सर्वर 21 उपकरणों के साथ प्रकट होना चाहिए — Google डेटा उपकरण (google_search, google_trends), एक बार की मदद करने वाले पृष्ठ (scrape_html, scrape_markdown, scrape_screenshot), और क्लाउड-ब्राउज़र प्राइमिटिव (browser_create, browser_goto, browser_get_html, browser_get_text, browser_click, browser_type, browser_press_key, browser_scroll, browser_scroll_to, browser_screenshot, browser_snapshot, browser_wait, browser_wait_for, browser_go_back, browser_go_forward, browser_close)। यदि सर्वर सूचीबद्ध है और उपकरण गिनती करते हैं, तो वायरिंग सही है और API कुंजी मान्य है।
आप इसका उपयोग कैसे करते हैं: अपने Copilot CLI एजेंट को प्रेरित करें
MCP सर्वर को वायर करने के बाद, आप टर्मिनल में Copilot CLI से बात करके लाइव वेब डेटा प्राप्त करते हैं — टूल कॉल्स को हाथ से लिखने के बजाय। एजेंट Scrapeless MCP सर्वर द्वारा उजागर किए गए टूल सूची को पढ़ता है और google_search, scrape_markdown, या आवश्यकतानुसार browser_* टूल को चुनता है, उन्हें प्राकृतिक भाषा के प्रॉम्प्ट से टर्न दर टर्न जोड़ता है। आपके पक्ष में कोई टूल JSON लेखन की आवश्यकता नहीं होती और कोई मैनुअल MCP कॉल जारी करने की आवश्यकता नहीं होती। (Copilot CLI इंटरैक्टिव रूप से एक सत्र में प्रॉम्प्ट चलाता है, या एक बार की रन और स्क्रिप्टिंग के लिए copilot -p "<prompt>" के साथ नॉन-इंटरैक्टिव रूप से।)
प्रॉम्प्ट्स जिन्हें आप पेस्ट कर सकते हैं
| प्रॉम्प्ट | एजेंट क्या करता है |
|---|---|
| "‘vector database benchmarks 2026’ के लिए शीर्ष Google परिणाम खोजें और उन्हें JSON के रूप में लौटाएं।" | google_search q, hl, gl के साथ → टाइप की गई परिणाम पंक्तियाँ। |
"अभी अमेरिका में developer tools के लिए कौन से सर्च टॉपिक्स बढ़ रहे हैं?" |
google_trends। |
| "‘https://react.dev/learn/synchronizing-with-effects’ पर React दस्तावेज़ पृष्ठ को साफ मार्कडाउन के रूप में खींचें।" | scrape_markdown। |
| "‘https://pricing.example.com’ खोलें, यह एक JavaScript ऐप है — इसे रेंडर करें और योजना का नाम, मूल्य और सुविधाएँ JSON के रूप में निकालें।" | browser_create → browser_goto → browser_get_html → टाइप की गई निकासी। |
| "‘https://a.example.com/pricing’ और ‘https://b.example.com/pricing’ पर मूल्य निर्धारण पृष्ठों की तुलना करें और बताएं कि वे कहाँ भिन्न हैं।" | browser_create → browser_goto (पृष्ठ A) → browser_get_html → browser_goto (पृष्ठ B) → browser_get_html → अंतर। |
| "‘https://example.com/landing’ का पूरा पृष्ठ स्क्रीनशॉट लें।" | scrape_screenshot। |
| "‘https://example.com’ का रेंडर किया गया HTML खींचें ताकि मैं मार्कअप पढ़ सकूं।" | scrape_html। |
| "‘https://example.com/jobs’ खोलें, लिस्टिंग के लोड होने की प्रतीक्षा करें, पृष्ठ का स्नैपशॉट लें, फिर JSON के रूप में हर नौकरी के शीर्षक और स्थान को निकालें।" | browser_create → browser_goto → browser_wait_for → browser_snapshot → टाइप की गई निकासी → browser_close। |
कार्यरत उदाहरण
आप टाइप करते हैं:
bash
copilot -p "‘web scraping python’ के लिए शीर्ष ऑर्गेनिक परिणाम खोजें और शीर्ष 3 का सारांश दें जिसमें लिंक हों।"
एजेंट की योजना (साधारण अंग्रेजी में):
google_searchकोq: "web scraping python",hl: "en",gl: "us"के साथ कॉल करें।- परिणाम पंक्तियों का एक ऐरे प्राप्त करें और
position,title,link, औरsnippetफ़ील्ड पढ़ें। positionद्वारा क्रमबद्ध करें और पहले तीन पंक्तियों को रखें।- प्रत्येक परिणाम का सारांश
snippetसे बनाएं और सारांश को पंक्ति केtitleऔरlinkके साथ जोड़ें। - तीन सारांशों को उनके लिंक के साथ टर्मिनल में लौटाएं।
आपको वापस मिलता है (चित्रण आकार — एजेंट इन जैसी पंक्तियों से काम करता है):
json
[
{
"position": 1,
"title": "Python वेब स्क्रैपिंग ट्यूटोरियल",
"link": "https://www.example.com/python-web-scraping",
"snippet": "Python, requests, और एक पार्सर के साथ वेब पृष्ठों को स्क्रैप करने के लिए चरण-दर-चरण मार्गदर्शिका।",
"source": "example.com"
},
{
"position": 2,
"title": "Beautiful Soup डॉक्यूमेंटेशन",
"link": "https://www.example.org/beautifulsoup/docs",
"snippet": "Python में HTML और XML दस्तावेज़ों को पार्स करने के लिए संदर्भ।",
"source": "example.org"
},
{
"position": 3,
"title": "Python में डायनामिक साइट्स को स्क्रैप करना",
"link": "https://blog.example.net/dynamic-scraping",
"snippet": "डेटा निकालने से पहले JavaScript पृष्ठों को रेंडर करने का तरीका।",
"source": "example.net"
}
]
// फ़ील्ड नाम google_search पंक्ति आकार से मेल खाते हैं; मान चित्रण नमूने हैं।
स्टेटलेस डेटा उपकरण (google_search, google_trends, scrape_html, scrape_markdown) अपने पेलोड को Response:\n\n के साथ एक बॉडी के रूप में लौटाते हैं; एजेंट JSON को पार्स करने से पहले उस प्रिफिक्स को अनरैप करता है, इसलिए आप उत्तर में इसे कभी नहीं देखते हैं।
प्रॉम्प्ट्स को आकार देना
| ऐसा कहें | प्रभाव |
|---|---|
| "…जर्मनी से" / "…जर्मन परिणाम" | proxyCountry के माध्यम से एग्रेस को रूट करता है और खोज पर gl=de सेट करता है। |
| "…मार्कडाउन के रूप में, नैविगेशन और बॉयलरप्लेट छोड़ें" | scrape_markdown को एक साफ़ टेक्स्ट पेलोड के लिए और कच्चे HTML के बजाय चुनता है। |
| "…पहले इसे रेंडर करें, यह एक सिंगल-पेज ऐप है" | browser_* पथ (browser_create → browser_goto → browser_get_html) को बल देता है ताकि निष्कर्षण हाइड्रेटेड DOM के खिलाफ चल सके। |
| "…केवल शीर्ष 5" | लौटाई गई श्रृंखला को पहले पांच पंक्तियों तक छोटा करता है। |
| "…प्रत्येक परिणाम के लिए उद्धरण शामिल करें" | आउटपुट पंक्तियों में snippet फ़ील्ड को बनाए रखता है। |
| "…जब आप समाप्त कर लें तो सत्र बंद करें" | browser_create से sessionId के साथ एक अंतिम browser_close जोड़ता है। |
Scrapeless MCP टूल सतह
एक बार सर्वर जोड़ा गया, GitHub Copilot CLI 21 टूल देखता है जो SERP डेटा, स्टेटलेस स्क्रैपिंग, और पूर्ण एंटी-डिटेक्शन क्लाउड ब्राउज़र नियंत्रण को फैलाते हैं।
| टूल | यह क्या करता है |
|---|---|
google_search |
एक Google खोज (q, hl, gl) करता है और संरचित ऑर्गेनिक परिणाम पंक्तियाँ लौटाता है। |
google_trends |
एक क्वेरी के लिए Google ट्रेंड्स रुचि डेटा खींचता है। |
scrape_html |
एक URL प्राप्त करता है और इसका रेंडर किया गया HTML लौटाता है। |
scrape_markdown |
एक URL प्राप्त करता है और उस पृष्ठ के लिए साफ़ मार्कडाउन लौटाता है। |
scrape_screenshot |
एक लक्षित URL का स्क्रीनशॉट लेता है। |
browser_create |
एंटी-डिटेक्शन क्लाउड ब्राउज़र पर एक सत्र खोलता है। |
browser_goto |
सत्र को एक URL पर नेविगेट करता है। |
browser_click |
लाइव पृष्ठ में एक तत्व पर क्लिक करता है। |
browser_type |
एक इनपुट या संपादनीय क्षेत्र में टेक्स्ट टाइप करता है। |
browser_get_text / browser_get_html |
पृष्ठ के टेक्स्ट या HTML को पढ़ता है। |
browser_screenshot |
लाइव सत्र का स्क्रीनशॉट लेता है। |
browser_snapshot |
पृष्ठ का एक पहुंच / संरचना स्नैपशॉट लौटाता है। |
browser_wait / browser_wait_for |
एक निश्चित अंतराल के लिए, या एक स्थिति / तत्व के लिए रुकता है। |
browser_scroll / browser_scroll_to |
पृष्ठ को स्क्रॉल करता है, या एक विशेष तत्व के लिए। |
browser_go_back / browser_go_forward |
सत्र इतिहास के माध्यम से चलता है। |
browser_press_key |
पृष्ठ पर एक कीबोर्ड कुंजी भेजता है। |
browser_close |
क्लाउड ब्राउज़र सत्र समाप्त करता है। |
मुफ्त योजना पर अपना API कुंजी प्राप्त करें: Scrapeless
आपको क्या मिलता है
google_search कॉल एक JSON श्रृंखला लौटाता है जो ऑर्गेनिक परिणाम पंक्तियाँ हैं। प्रत्येक पंक्ति में समान कुंजियाँ होती हैं, ताकि एजेंट सीधे शीर्षक, लिंक और उद्धरण पर मैप कर सके:
json
// फ़ील्ड नाम google_search टूल आउटपुट को प्रतिबिंबित करते हैं; मान सामान्य नमूने हैं।
[
{
"position": 1,
"title": "Python वेब स्क्रैपिंग ट्यूटोरियल",
"link": "https://example.com/python-web-scraping",
"snippet": "Python के साथ वेब को स्क्रैप करने और HTML को पार्स करने के लिए एक कदम-दर-कदम मार्गदर्शिका।",
"source": "example.com"
},
{
"position": 2,
"title": "वेब स्क्रैपिंग सर्वोत्तम प्रथाएँ",
"link": "https://example.org/best-practices",
"snippet": "जिम्मेदारी से स्क्रैप करने के लिए: दर सीमाएँ, robots.txt, और संरचित आउटपुट।",
"source": "example.org"
}
]
कुछ ईमानदार अवलोकन जब आप प्रांप्ट चलाना शुरू करते हैं:
- स्टेटलेस टूल जैसे
google_searchऔरscrape_markdownएक शरीर लौटाते हैं जिसेResponse:\n\nद्वारा पूर्वोत्तरित किया गया है जिसके बाद JSON पेलोड होता है; एजेंट उस पूर्वोत्तरित को स्वचालित रूप से अनरैप करता है, ताकि आप डेटा के साथ काम कर सकें, न कि आवरण के साथ। browser_*टूल साधारण टेक्स्ट लौटाते हैं जिसमें कोईResponse:\n\nपूर्वोत्तरित नहीं होता है।- टूल तर्क कैमेलकेस होते हैं:
sessionId,proxyCountry, और समान फ़ील्ड को ठीक उसी नाम से पास करें। proxyCountryएक अनुरोध है, ना कि एक गारंटी - यह आपके खाते पर कॉन्फ़िगर की गई क्षेत्र पर निर्भर हो सकता है।- टूल आउटपुट में मान सामग्री पर निर्भर होते हैं: परिणामों की संख्या, क्रम, और उद्धरण टेक्स्ट लाइव क्वेरी के साथ भिन्न होते हैं।
निष्कर्ष: टर्मिनल से खोजें, रेंडर करें और ब्राउज़ करें
पूरा एकीकरण एक MCP कॉन्फ़िग ब्लॉक और प्राकृतिक-भाषा प्रांप्ट्स में घटित होता है। scrapeless-mcp-server एंट्री के स्थापित होने और आपके कुंजी को वातावरण में रखते हुए, GitHub Copilot CLI को लाइव Google खोज, JavaScript रेंडरिंग, और पूर्ण एंटी-डिटेक्शन क्लाउड ब्राउज़र मिलता है - यह सब बिना टर्मिनल छोड़े या एक HTTP क्लाइंट को हाथ से वायर अप किए। आप कार्य का वर्णन करते हैं; एजेंट उपकरण चुनता है।
यदि आप अन्य एजेंटों को वायर करने जा रहे हैं, तो वही Scrapeless MCP सर्वर उनमें भी चला जाता है: Google एंटीग्रैविटी और Pi एजेंट एकीकरण देखें, और पूर्ण उपकरण संदर्भ के लिए Scrapeless MCP सर्वर अवलोकन देखें। अपना API कुंजी SCRAPELESS_KEY में रखें, स्थानीय CLIs के लिए stdio परिवहन को प्राथमिकता दें और होस्टेड एजेंटों के लिए HTTP-स्ट्रिम करने योग्य, और एजेंट को उपकरण चुनने दें। पूर्ण संदर्भ docs.scrapeless.com पर।
अक्सर पूछे जाने वाले प्रश्न
क्या एजेंट के माध्यम से वेब स्क्रैपिंग कानूनी है?
सार्वजनिक रूप से उपलब्ध डेटा को स्क्रैप करना आमतौर पर अनुमति है, लेकिन आप इसे कैसे उपयोग करते हैं इसके लिए जिम्मेदार हैं। प्रत्येक साइट की सेवा की शर्तों की समीक्षा करें और robots.txt का सम्मान करें, और ध्यान रखें कि व्यक्तिगत डेटा और पहुंच के संबंध में नियम क्षेत्राधिकार द्वारा भिन्न होते हैं। जब भी संदेह हो, अपने विशेष उपयोग मामले के लिए कानूनी सलाह लें।
क्या आपको Scrapeless API कुंजी की जरूरत है, और कौन सा एनवायरनमेंट वेरिएबल इसे रखता है?
हाँ। Scrapeless MCP सर्वर आपके खाते की कुंजी के साथ प्रमाणित होता है, जिसे आप SCRAPELESS_KEY में सेट करते हैं। इसके बिना, सर्वर शुरू होता है लेकिन इसके उपकरण Scrapeless बैकेंड तक नहीं पहुंच सकते।
क्या आपको GitHub Copilot सदस्यता की आवश्यकता है?
हाँ। GitHub Copilot CLI अपनी बारी को Copilot के मॉडल पर चलाता है, जिसके लिए एक सक्रिय Copilot सदस्यता की आवश्यकता होती है जिसमें उपलब्ध मात्रा हो। MCP सर्वर और इसके उपकरण अलग हैं; सदस्यता एजेंट के मॉडल को कवर करती है, न कि Scrapeless कॉल को।
stdio बनाम HTTP स्ट्रीम करने योग्य - आपको प्रत्येक का उपयोग कब करना चाहिए?
जब सर्वर CLI के साथ स्थानीय रूप से चल रहा हो, तो stdio का उपयोग करें: एजेंट scrapeless-mcp-server को एक चाइल्ड प्रोसेस के रूप में लॉन्च करता है और इसके साथ मानक इनपुट/आउटपुट के माध्यम से बात करता है। यदि एजेंट होस्टेड या दूरस्थ है और स्थानीय प्रोसेस को स्पॉन नहीं कर सकता है, तो HTTP स्ट्रीम करने योग्य ट्रांसपोर्ट का उपयोग करें (https://api.scrapeless.com/mcp x-api-token हेडर के साथ)। स्थानीय Copilot CLI सेटअप के लिए, stdio सबसे सरल विकल्प है।
क्या एजेंट केवल खोज नहीं, बल्कि पूरी ब्राउजर फ्लो चला सकता है?
हाँ। 16 browser_* उपकरण एजेंट को एक सत्र खोलने, नेविगेट करने, क्लिक करने, टाइप करने, स्क्रॉल करने, तत्वों की प्रतीक्षा करने, स्नैपशॉट लेने, स्क्रीनशॉट लेने और बंद करने की अनुमति देते हैं - पूरी तरह से प्राकृतिक भाषा संकेतों द्वारा संचालित एक पूर्ण क्लाउड ब्राउजर फ्लो।
क्या proxyCountry हमेशा लागू होता है?
जरूरी नहीं। proxyCountry एक प्राथमिकता है जो आपके खाते पर कॉन्फ़िगर किए गए क्षेत्र पर निर्भर कर सकती है। यदि भू-लक्ष्य बनाना महत्वपूर्ण है, तो परिकल्पना करने के बजाय निकास क्षेत्र की पुष्टि करें कि प्रति-काल मान हमेशा विजयी होता है।
क्या आप इसे बिना एआई एजेंट के उपयोग कर सकते हैं?
हाँ। Scrapeless MCP सर्वर एक मानक MCP सर्वर है, इसलिए कोई भी MCP-संगत क्लाइंट इसे कॉल कर सकता है - या आप इसे सीधे JSON-RPC (initialize, फिर tools/list और tools/call) के माध्यम से चला सकते हैं। एजेंट एक सुविधा है, आवश्यक नहीं है।
क्या आप अपने AI-पावर्ड डेटा पाइपलाइन बनाने के लिए तैयार हैं?
हमारे समुदाय में शामिल हों, एक मुफ्त योजना का दावा करें और उन डेवलपर्स के साथ जुड़ें जो GitHub Copilot CLI + Scrapeless MCP एजेंट बना रहे हैं: Discord · Telegram।
फ्री स्क्रैपिंग ब्राउज़र रनटाइम के लिए Scrapeless पर साइन अप करें और ऊपर दी गई एकीकरण को SERPs, पेजों और क्षेत्रों के लिए अनुकूलित करें जिसकी आपकी टीम को आवश्यकता है। पूरा संदर्भ docs.scrapeless.com पर है।
स्क्रैपलेस में, हम केवल सार्वजनिक रूप से उपलब्ध डेटा का उपयोग करते हैं, जबकि लागू कानूनों, विनियमों और वेबसाइट गोपनीयता नीतियों का सख्ती से अनुपालन करते हैं। इस ब्लॉग में सामग्री केवल प्रदर्शन उद्देश्यों के लिए है और इसमें कोई अवैध या उल्लंघन करने वाली गतिविधियों को शामिल नहीं किया गया है। हम इस ब्लॉग या तृतीय-पक्ष लिंक से जानकारी के उपयोग के लिए सभी देयता को कोई गारंटी नहीं देते हैं और सभी देयता का खुलासा करते हैं। किसी भी स्क्रैपिंग गतिविधियों में संलग्न होने से पहले, अपने कानूनी सलाहकार से परामर्श करें और लक्ष्य वेबसाइट की सेवा की शर्तों की समीक्षा करें या आवश्यक अनुमतियाँ प्राप्त करें।



