वेब सर्च को क्वेन कोड में कैसे जोड़े: टर्मिनल एजेंटों के लिए स्क्रेपलेस MCP इंटीग्रेशन
Expert in Web Scraping Technologies
मुख्य निष्कर्ष:
- क्वेन कोड में कोई अंतर्निहित वेब खोज नहीं है - एमसीपी ही इसे वेब दिखाता है। अंतर्निहित
वेब_खोजउपकरण को एक प्रारंभिक संस्करण में हटा दिया गया था; आधिकारिक दस्तावेज स्पष्ट रूप से बताता है कि वेब खोज एक एमसीपी सर्वर से जोड़कर प्रदान की जाती है। उस कनेक्शन को स्क्रेपलेस पर इंगित करें और टर्मिनल एजेंट एक ही बार में लाइव गूगल खोज, पृष्ठ रेंडरिंग, और एक पूर्ण क्लाउड ब्राउज़र प्राप्त करता है। ~/.qwen/settings.jsonमें एक ब्लॉक इसका सारा काम जोड़ता है।mcpServersऑब्जेक्ट में एकलscrapelessप्रविष्टि जोड़ें और एजेंट को गूगल सर्प स्क्रैपर, ट्रेंड्स स्क्रैपर, HTML/Markdown/Screenshot सहायक, और 16 ब्राउज़र-स्वचालन उपकरण मिलते हैं - बिना किसी एसडीके कोड के, बिना किसी सेवा के।- एजेंट साधारण प्रॉम्प्ट से खोजता है, रेंडर करता है और ब्राउज़र चलाता है। प्राकृतिक भाषा में गूगल पर खोजने के लिए, जावास्क्रिप्ट-भारी पृष्ठ को साफ मार्कडाउन के रूप में पढ़ने के लिए, या कई कदमों के प्रवाह के माध्यम से क्लिक करने के लिए पूछें, और क्वेन कोड सही उपकरण कॉल तैयार करता है कदम-दर-कदम, बजाय इसे प्रशिक्षण-कटऑफ ज्ञान और स्थानीय फ़ाइलों पर सीमित होने के।
- गृहस्थ प्रॉक्सी और एंटी-डिटेक्शन क्लाउड-पारHandled होते हैं। प्रत्येक अनुरोध स्क्रेपलेस एंटी-डिटेक्शन क्लाउड ब्राउज़र के माध्यम से रूट होता है जिसमें 195+ देशों में घरेलू प्रॉक्सियाँ शामिल होती हैं, ताकि एजेंट व्यावसायिक साइटों पर रेंडर की गई, उपयोगी प्रतिक्रिया प्राप्त कर सके बिना आपकी मशीन पर किसी प्रॉक्सी या फिंगरप्रिंट सेटअप के।
- SERP, स्टेटलेस स्क्रैपिंग, और ब्राउज़र स्वचालन के लिए 21 उपकरण। स्क्रेपलेस एमसीपी सर्वर
google_search,google_trends,scrape_html/scrape_markdown/scrape_screenshot, के साथ-साथ 16browser_*उपकरणों का प्रदर्शन करता है - एक नाम स्थान जिससे एजेंट का प्लानर प्रत्येक बारी पर खींचता है। - स्टडिओ या HTTP-स्ट्रीम करने योग्य परिवहन।
npxके साथ स्थानीय रूप से सर्वर चालू करें, या एक ही कॉन्फ़िगरेशन को स्ट्रीम करने योग्य HTTP अंतिम बिंदु पर इंगित करें दूरस्थ विकास कंटेनरों और सीआई चलाने वालों के लिए। - शुरू करने के लिए मुफ्त। नए स्क्रेपलेस खातों में मुफ्त स्क्रैपिंग ब्राउज़र रUNTIME शामिल है - स्क्रेपलेस पर साइन अप करें।
परिचय: एक टर्मिनल कोडिंग एजेंट जो अंततः इंटरनेट का लाइव पढ़ सकता है
क्वेन कोड एक ओपन-सोर्स एआई एजेंट है जो आपके टर्मिनल में रहता है, जिसे क्वेन श्रृंखला के मॉडलों के लिए अनुकूलित किया गया है। यह बड़े कोडबेस को पढ़ता है, फ़ाइलों को संपादित करता है, आदेश चलाता है, और एक प्रोजेक्ट के थकाऊ हिस्सों को स्वचालित करता है - बिना शेल छोड़े। जो यह अपने दम पर नहीं कर सकता वह लाइव वेब को देखना है। इसका ज्ञान मॉडल के प्रशिक्षण के कटऑफ़ पर रुकता है और डिस्क पर फ़ाइलें।
क्वेन कोड में यह अंतर असामान्य रूप से स्पष्ट है। अंतर्निहित वेब_खोज उपकरण को एक प्रारंभिक संस्करण में हटा दिया गया था, और आधिकारिक दस्तावेज ठोस रूप से कहते हैं कि "वेब खोज बाहरी एमसीपी सर्वरों से जोड़ने पर प्रदान की जाती है" न कि किसी अंतर्निहित उपकरण के माध्यम से। दूसरे शब्दों में, क्वेन कोड में वास्तविक समय की वेब पहुंच एक बाद की सोच नहीं है जिसे आप जोड़ते हैं - यह इच्छित विस्तार बिंदु है। जब तक आप एक कनेक्ट नहीं करते, एजेंट वर्तमान सर्प को खींच नहीं सकता, प्रतियोगी के मूल्य निर्धारण पृष्ठ को नहीं पढ़ सकता, नवीनतम परिवर्तनपत्र की जांच नहीं कर सकता, या केवल जावास्क्रिप्ट ऐप को नहीं रेंडर कर सकता।
यह लेख उस अंतर को समाप्त करता है, स्क्रेपलेस एमसीपी सर्वर को क्वेन कोड में जोड़कर। ~/.qwen/settings.json में एक ब्लॉक एजेंट को गूगल खोज, जावास्क्रिप्ट रेंडरिंग, और एक पूर्ण एंटी-डिटेक्शन क्लाउड ब्राउज़र प्रदान करता है, जो सभी एक ही प्राकृतिक-भाषा प्रॉम्प्ट के माध्यम से पहुंच योग्य होते हैं जो पहले से ही कोड के लिए उपयोग होते हैं। अन्य एमसीपी क्लाइंट्स के माध्यम से समान स्क्रेपलेस सतह के लिए, गूगल एंटीग्रेविटी वाकथ्रूप और पी एजेंट एकीकरण देखें।
आप इसके साथ क्या कर सकते हैं
- तराजू SERP अनुसंधान टर्मिनल में। एजेंट से पूछें कि वह किसी क्वेरी के लिए
google_searchचलाए और शीर्ष परिणामों को JSON के रूप में लौटाए, ताकि अनुसंधान शेल में हो न कि एक अलग ब्राउज़र टैब में। - प्रतिस्पर्धी और मूल्य निर्धारण स्नैपशॉट। प्रॉम्प्ट में एक URL डालें और एजेंट से पृष्ठ को रेंडर करने दें और योजना के नाम, कीमतों, और विशेषताओं को एक संरचित रिकॉर्ड में निकालें जिसे आप अपने कोड के बगल में डाल सकते हैं।
- डॉक और चेंज पत्र की खोज जो कोड को फीड करती है। एजेंट को एक लाइब्रेरी का वर्तमान डॉक या रिलीज नोट्स साफ मार्कडाउन के रूप में लाने के लिए कहें और रेंडर किए गए पाठ के खिलाफ लिखें बजाय एक पुरानी एपीआई की याददाश्त के।
- मार्केट और ट्रेंड जांचें।
google_trendsका उपयोग करें एक विषय के लिए एक लक्षित क्षेत्र में रुचि संकेत खींचने के लिए, फिर फीचर कॉपी, सामग्री योजनाओं, या प्रयोग के विचारों को वर्तमान सबूतों के साथ बीज दें। - जावास्क्रिप्ट-पृष्ठ निकासी एक प्रकार के रिकॉर्ड में। एजेंट को एक सिंगल-पृष्ठ ऐप पर इंगित करें; क्लाउड ब्राउज़र इसे हाइड्रेट करता है और एजेंट परिणाम को आप जो स्क्रिप्ट बना रहे हैं उसके लिए एक टाइप किए गए ऑब्जेक्ट में पार्स करता है।
- कई चरणों वाले ब्राउज़र प्रवाह।
browser_goto,browser_click,browser_type, औरbrowser_scrollको एक साथ जोड़ें ताकि एजेंट पेजिनेशन में चल सके, पैनल का विस्तार कर सके, या निकालने से पहले एक विज़ार्ड में कदम रख सके। - समीक्षा के लिए स्क्रीनशॉट कैप्चर करना।
scrape_screenshotयाbrowser_screenshotका उपयोग करें ताकि एजेंट एक छवि के रूप में रेंडर किए गए पृष्ठ को कैच कर सके जिसे वह कार्यक्षेत्र में सहेज सके। - सर्च-फिर-पढ़ने वाले पाइपलाइन।
google_searchकोscrape_markdownके साथ संयोजित करें ताकि एजेंट शीर्ष परिणामों को खोज सके, प्रत्येक को पढ़े, और उन्हें एकल टर्मिनल मोड़ में संक्षेपित करे।
स्क्रेपलेस पर, हम केवल सार्वजनिक रूप से उपलब्ध डेटा तक पहुंच प्राप्त करते हैं, जबकि लागू कानूनों, विनियमों और वेबसाइट की गोपनीयता नीतियों के साथ पूरी तरह से अनुपालन करते हैं। इस पोस्ट का सामग्री केवल प्रदर्शनी उद्देश्यों के लिए है।
स्क्रेपलेस MCP सर्वर क्यों?
स्क्रेपलेस MCP सर्वर एक अनुकूलन योग्य, एंटी-डिटेक्शन ब्रिज है जो एक AI एजेंट और लाइव वेब के बीच है। विशेष रूप से Qwen कोड के लिए, यह लाता है:
- एंटी-डिटेक्शन क्लाउड ब्राउज़र जिसमें जावास्क्रिप्ट रेंडरिंग है। पृष्ठों को निष्कर्षण से पहले एक पूर्ण स्क्रेपलेस स्क्रेपिंग ब्राउज़र में हाइड्रेट किया जाता है, ताकि SPA, अनंत-स्क्रॉल फ़ीड, और लेजी-लोड किए गए पैनल
browser_goto+browser_get_htmlके लिए पहले श्रेणी के लक्ष्य बन जाएं। - 195+ देशों में आवासीय प्रॉक्सी। भौगोलिक रूप से बंधे प्रश्न स्थानीय उपयोगकर्ता जो लिस्टिंग देखेगा, वही लौटाते हैं, जिसमें प्रॉक्सी एगिंग पूरी तरह से स्क्रेपलेस पक्ष पर संभालता है।
- एक stdio कमांड के माध्यम से
npx, कोई SDK कोड नहीं। सर्वरnpx -y scrapeless-mcp-serverसे एक चाइल्ड प्रोसेस के रूप में लॉन्च होता है; करने के लिए कुछ भी नहीं है, होस्ट करने के लिए कुछ नहीं है, या आपके प्रोजेक्ट में आयात करने के लिए कुछ नहीं है। - SERP, Stateless Scraping, और पूर्ण ब्राउज़र स्वचालन को कवर करने वाले 21 उपकरण।
google_searchऔरgoogle_trendsSERP डेटा को कवर करते हैं,scrape_html/scrape_markdown/scrape_screenshotएक बार में पृष्ठ फेच को कवर करते हैं, और 16browser_*उपकरण स्थिति-आधारित नेविगेशन, क्लिक करने, टाइप करने, स्क्रॉल करने और स्क्रीनशॉट लेने को कवर करते हैं। - Qwen कोड के अपने
web_fetchका पूरक। Qwen कोड एक साधारणweb_fetchमूल पृष्ठ पुनर्प्राप्ति के लिए लाता है, लेकिन यह जावास्क्रिप्ट को रेंडर नहीं करता या एंटी-डिटेक्शन नहीं करता। स्क्रेपलेस उपकरण बिल्कुल उस खाई को भरते हैं — एजेंट जिसने कभी खोज नहीं की, इसके अलावा रेंडर, प्रॉक्सिड पृष्ठ पहुंच।
मुफ्त योजना इसे सेट करने और वास्तविक संकेत चलाने के लिए पर्याप्त है; जब आप इससे ऊपर उठते हैं तो प्राइसिंग पृष्ठ पर क्वोटा की तुलना करें। मुफ्त योजना पर अपना API कुंजी प्राप्त करें स्क्रेपलेस पर।
पूर्वापेक्षाएँ
- कार्यस्थान पर Node.js 22 या नया — Qwen कोड को Node 22+ की आवश्यकता होती है, और stdio MCP सर्वर
npxके साथ उत्पन्न होता है। - Qwen कोड स्थापित और एक मॉडल प्रदाता कॉन्फ़िगर किया गया। Qwen कोड LLM बैकएंड के खिलाफ प्रमाणित होता है; एजेंट लूप को किसी भी उपकरण कॉल चलाने से पहले एक कार्यशील मॉडल की आवश्यकता होती है।
- स्क्रेपलेस खाता और API कुंजी — app.scrapeless.com पर मुफ्त योजना पर साइन अप करें और सेटिंग्स → API कुंजी प्रबंधन से कुंजी कॉपी करें।
- मूल टर्मिनल परिचितता — पूरा सेटअप कुछ आदेशों और एक छोटे JSON फ़ाइल का समूह है।
इंस्टॉल करें
सेटअप पांच उप-चरण हैं; प्रत्येक स्वतंत्र रूप से सत्यापन योग्य है।
1. Qwen कोड स्थापित करें
npm से CLI को वैश्विक रूप से स्थापित करें, फिर संस्करण चेक करें:
bash
npm install -g @qwen-code/qwen-code
qwen --version
आप इसे वैश्विक इंस्टॉल के बिना भी npx -y @qwen-code/qwen-code@latest के माध्यम से चला सकते हैं।
2. एक मॉडल प्रदाता कनेक्ट करें
Qwen कोड एक LLM बैकएंड के साथ बातचीत करता है। यह एक OpenAI-संगत मोड का समर्थन करता है, इसलिए कोई भी OpenAI-संगत एंडपॉइंट काम करता है — प्रमाणीकरण प्रकार, API कुंजी, आधार URL, और मॉडल सेट करें:
bash
export OPENAI_API_KEY="your_provider_key_here"
export OPENAI_BASE_URL="https://your-openai-compatible-endpoint/v1"
qwen --auth-type openai -m "your-model-id"
इन्हीं मूल्यों को --openai-api-key और --openai-base-url ध्वजों के रूप में भी पास किया जा सकता है। किसी ऐसे मॉडल का चयन करें जो उपकरण कॉल को अच्छे से संभाले — Qwen कोड एजेंटिक टूल उपयोग के चारों ओर बनाया गया है, इसलिए एक वर्तमान Qwen-श्रेणी कोडर मॉडल स्वाभाविक रूप से उपयुक्त है।
3. स्क्रेपलेस MCP सर्वर जोड़ें (stdio)
Qwen कोड MCP सर्वरों को ~/.qwen/settings.json (उपयोगकर्ता स्कोप) या किसी प्रोजेक्ट रूट में .qwen/settings.json से पढ़ता है। mcpServers ऑब्जेक्ट में एक scrapeless ब्लॉक जोड़ें:
json
{
"mcpServers": {
"scrapeless": {
"command": "npx",
"args": ["-y", "scrapeless-mcp-server"],
"env": { "SCRAPELESS_KEY": "$SCRAPELESS_KEY" },
"timeout": 60000,
"trust": true
}
}
}
यहां दो विवरण महत्वपूर्ण हैं। पहले, स्क्रेपलेस MCP सर्वर अपने कुंजी को SCRAPELESS_KEY से पढ़ता है, न कि SCRAPELESS_API_KEY — स्क्रेपलेस CLI और SDK SCRAPELESS_API_KEY का उपयोग करते हैं, लेकिन MCP सर्वर एक दस्तावेजित अपवाद है। दूसरा, Qwen कोड $VAR और ${VAR} को env ऑब्जेक्ट के अंदर विस्तारित करता है, इसलिए आप अपने पर्यावरण में कुंजी रख सकते हैं (export SCRAPELESS_KEY=...) और इसे $SCRAPELESS_KEY के रूप में संदर्भित कर सकते हैं, न कि फ़ाइल में सीधे मान डालकर। सर्वर स्रोत github.com/scrapeless-ai/scrapeless-mcp-server पर स्थित है।
आप CLI से सर्वर जोड़ सकते हैं, बजाय JSON को हाथ से संपादित करने के:
bash
qwen mcp add --transport stdio --scope user --env SCRAPELESS_KEY=$SCRAPELESS_KEY --trust scrapeless npx -y scrapeless-mcp-server
4. या HTTP स्ट्रीम करने योग्य मोड का उपयोग करें
अगर होस्ट भरोसेमंद तरीके से npx — एक होस्टेड डेवलप कंटेनर, एक दूरस्थ कार्यक्षेत्र, या एक CI सैंडबॉक्स — चालू नहीं कर सकता है, तो Qwen Code को स्थानीय प्रक्रिया के बजाय Scrapeless HTTP एंडपॉइंट पर इशारा करें। HTTP ट्रांसपोर्ट के लिए, Qwen Code httpUrl कुंजी का उपयोग करता है जिसमें एक वैकल्पिक headers ऑब्जेक्ट होता है:
json
{
"mcpServers": {
"scrapeless": {
"httpUrl": "https://api.scrapeless.com/mcp",
"headers": { "x-api-token": "आपकी_SCRAPELESS_KEY" }
}
}
}
एक्सप्रेस के लिए, एक ही कुंजी मान दोनों मोड में काम करता है; HTTP स्ट्रीम करने योग्य इसे x-api-token हेडर के रूप में पास करता है न कि SCRAPELESS_KEY पर्यावरण चर के रूप में। डिफ़ॉल्ट रूप से स्टेडियो एक डेवलपर वर्कस्टेशन पर सही है; HTTP स्ट्रीम करने योग्य सही डिफ़ॉल्ट है जहां लंबी अवधि के बच्चे की प्रक्रिया को जीवित रखना कठिन है।
5. कनेक्शन को सत्यापित करें
कॉन्फ़िगर किए गए MCP सर्वरों की सूची बनाएं:
bash
qwen mcp list
scrapeless सर्वर को संयुक्त रिपोर्ट करना चाहिए, जिसका अर्थ है कि Qwen Code ने stdio प्रक्रिया लॉन्च की है और MCP हस्ताक्षर पूरा किया है। वहां से एजेंट सर्वर के 21 उपकरणों का उल्लेख कर सकता है — Google डेटा उपकरण (google_search, google_trends), एक-बार के पृष्ठ सहायक (scrape_html, scrape_markdown, scrape_screenshot), और क्लाउड-ब्राउज़र प्राइमिटिव्स (browser_create, browser_goto, browser_get_html, browser_get_text, browser_click, browser_type, browser_press_key, browser_scroll, browser_scroll_to, browser_screenshot, browser_snapshot, browser_wait, browser_wait_for, browser_go_back, browser_go_forward, browser_close)।
आप इसे वास्तव में कैसे उपयोग करते हैं: अपने Qwen Code एजेंट को प्रोत्साहित करें
MCP सर्वर को कनेक्ट करने के बाद, आप टर्मिनल में Qwen Code से बात करके लाइव वेब डेटा प्राप्त करते हैं — टूल कॉल को हाथ से लिखने के बजाय। एजेंट Scrapeless MCP सर्वर द्वारा एक्सपोज़ की गई टूल सूची को पढ़ता है और जैसे आवश्यक हो google_search, scrape_markdown, या browser_* टूल का चयन करता है, उन्हें प्राकृतिक भाषा प्रॉम्प्ट से टर्न बाय टर्न एकत्रित करता है। आपके पक्ष पर कोई टूल JSON बनाने की आवश्यकता नहीं है। Qwen Code इंटरैक्टिव रूप से एक सत्र में प्रॉम्प्ट चलाता है, या एक बार के रन और स्क्रिप्टिंग के लिए प्रॉम्प्ट को स्थितीय तर्क (या stdin पर पाइपिंग) के रूप में पास करता है।
आप पेस्ट कर सकते हैं प्रॉम्प्ट
| प्रॉम्प्ट | एजेंट क्या करता है |
|---|---|
"2026 के लिए vector database benchmarks के शीर्ष Google परिणाम खोजें और उन्हें JSON के रूप में वापस करें।" |
google_search के साथ q, hl, gl → टाइप किए गए परिणाम पंक्तियाँ। |
"अभी अमेरिका में developer tools के लिए कौन से खोज विषय बढ़ रहे हैं?" |
google_trends। |
"क्लीन मार्कडाउन के रूप में https://qwenlm.github.io/qwen-code-docs/en/users/overview/ पर Qwen Code डॉक पृष्ठ लाएं।" |
scrape_markdown। |
"खोलें https://pricing.example.com, यह एक JavaScript ऐप है — इसे रेंडर करें और योजना का नाम, मूल्य, और सुविधाएँ JSON के रूप में निकालें।" |
browser_create → browser_goto → browser_get_html → टाइप की गई निकासी। |
"के लिए मूल्य निर्धारण पृष्ठों की तुलना करें https://a.example.com/pricing और https://b.example.com/pricing और मुझे बताएं कि वे कहाँ भिन्न हैं।" |
browser_create → browser_goto (A) → browser_get_html → browser_goto (B) → browser_get_html → डिफ़। |
"पूरे पृष्ठ की स्क्रीनशॉट लें https://example.com/landing का।" |
scrape_screenshot। |
"https://example.com के रेंडर किए गए HTML को पकड़ें ताकि मैं मार्कअप पढ़ सकूं।" |
scrape_html। |
"खोलें https://example.com/jobs, लिस्टिंग के लोड होने की प्रतीक्षा करें, पृष्ठ का स्नैपशॉट लें, फिर हर नौकरी के शीर्षक और स्थान को JSON के रूप में निकालें।" |
browser_create → browser_goto → browser_wait_for → browser_snapshot → टाइप की गई निकासी → browser_close। |
कार्यान्वयन का उदाहरण
आप टाइप करते हैं (एक बार, प्रॉम्प्ट stdin पर पास किया गया):
bash
echo "scrapeless google_search टूल का उपयोग करें 'qwen code github' के लिए शीर्ष परिणाम खोजें और शीर्ष 3 को {title, link} के JSON एरे के रूप में वापस करें।" | qwen --approval-mode yolo --allowed-mcp-server-names scrapeless
एजेंट की योजना (साधारण अंग्रेजी में):
google_searchकोq: "qwen code github",hl: "en",gl: "us"के साथ कॉल करें।- परिणाम पंक्तियों का एक एरे प्राप्त करें और
position,title, औरlinkफ़ील्ड पढ़ें। positionके अनुसार क्रमित करें और पहले तीन पंक्तियों को रखें।- प्रत्येक पंक्ति को
{title, link}ऑब्जेक्ट में मैप करें। - JSON एरे को टर्मिनल पर वापस करें।
आपको क्या मिलता है (चित्रात्मक आकार — एजेंट इन जैसी पंक्तियों से काम करता है):
json
[
{ "title": "Qwen Code एक ओपन-सोर्स AI एजेंट है टर्मिनल के लिए, ...", "link": "https://qwen.ai/qwencode" },
{ "title": "Qwen Code अवलोकन", "link": "https://qwenlm.github.io/qwen-code-docs/en/users/overview/" },
{ "title": "qwen-code/qwen-code-core", "link": "https://www.npmjs.com/package/@qwen-code/qwen-code-core" }
]
// फ़ील्ड नाम google_search पंक्ति आकार से मेल खाते हैं; मान चित्रात्मक नमूने हैं।
--allowed-mcp-server-names scrapeless रन को Scrapeless उपकरणों तक सीमित करता है, और --approval-mode yolo एजेंट को इंटरएक्टिव प्रॉम्प्ट के बिना विश्वसनीय उपकरण को कार्यान्वित करने की अनुमति देता है - हेडलेस और स्क्रिप्टेड रन के लिए सुविधाजनक। स्टेटलेस डेटा उपकरण अपना पेलोड Response:\n\n के साथ प्रीफिक्स किए गए शरीर के रूप में लौटाते हैं; एजेंट JSON को पार्स करने से पहले उस प्रीफिक्स को हटा देता है, इसलिए आप इसे उत्तर में कभी नहीं देखते हैं।
प्रॉम्प्ट आकार देना
| यह कहें | प्रभाव |
|---|---|
| "…जर्मनी से" / "…जर्मन परिणाम" | proxyCountry के माध्यम से निकासी को मार्गदर्शित करता है और खोज पर gl=de सेट करता है। |
| "…मार्कडाउन के रूप में, नेव और बॉयलरप्लेट को छोड़ें" | साफ टेक्स्ट पेलोड के लिए scrape_markdown चुनता है, कच्चे HTML के बजाय। |
| "…पहले इसे रेंडर करें, यह एक सिंगल-पेज ऐप है" | browser_* पथ ( browser_create → browser_goto → browser_get_html ) को बल देकर निकालने को हाइड्रेटेड DOM पर चलाता है। |
| "…केवल शीर्ष 5" | लौटाए गए एरे को पहले पांच पंक्तियों तक सीमित करता है। |
| "…हर परिणाम के लिए स्निपेट शामिल करें" | आउटपुट पंक्तियों में snippet फ़ील्ड को बनाए रखता है। |
| "…जब आप समाप्त कर लें तो सत्र को बंद करें" | browser_create से sessionId के साथ अंतिम browser_close जोड़ता है। |
सब कुछ नीचे का एंटर-टे-हूड संदर्भ है - उपकरण की सतह, सटीक लौटने के आकार, और व्यवहार जो एजेंट आपके लिए संभालता है।
Scrapeless MCP उपकरण सतह
एक बार जब सर्वर कनेक्ट हो जाता है, तो Qwen Code 21 उपकरणों को SERP डेटा, स्टेटलेस स्क्रैपिंग, और पूर्ण एंटी-डिटेक्शन क्लाउड ब्राउज़र नियंत्रण में देखता है।
| उपकरण | यह क्या करता है |
|---|---|
google_search |
एक गूगल खोज (q, hl, gl) चलाता है और संरचित जैविक परिणाम पंक्तियों को लौटाता है। |
google_trends |
एक प्रश्न के लिए गूगल ट्रेंड्स रुचि डेटा लाता है। |
scrape_html |
एक URL को लाता है और इसके रेंडर किए गए HTML को लौटाता है। |
scrape_markdown |
एक URL को लाता है और पृष्ठ के लिए साफ मार्कडाउन लौटाता है। |
scrape_screenshot |
लक्षित URL का स्क्रीनशॉट लेता है। |
browser_create |
एंटी-डिटेक्शन क्लाउड ब्राउज़र पर एक सत्र खोलता है। |
browser_goto |
URL पर सत्र को नेविगेट करता है। |
browser_click |
लाइव पृष्ठ में एक तत्व पर क्लिक करता है। |
browser_type |
एक इनपुट या संपादन योग्य फ़ील्ड में टेक्स्ट टाइप करता है। |
browser_get_text / browser_get_html |
पृष्ठ के टेक्स्ट या HTML को पढ़ता है। |
browser_screenshot |
लाइव सत्र का स्क्रीनशॉट लेता है। |
browser_snapshot |
पृष्ठ का पहुंच/संरचना स्नैपशॉट लौटाता है। |
browser_wait / browser_wait_for |
एक निश्चित अंतराल के लिए, या किसी स्थिति/तत्व के लिए प्रतीक्षा करता है। |
browser_scroll / browser_scroll_to |
पृष्ठ को या किसी विशिष्ट तत्व तक स्क्रॉल करता है। |
browser_go_back / browser_go_forward |
सत्र के इतिहास के माध्यम से चलता है। |
browser_press_key |
पृष्ठ पर एक कीबोर्ड की भेजता है। |
browser_close |
क्लाउड ब्राउज़र सत्र समाप्त करता है। |
मुफ्त योजना पर अपना एपीआई कुंजी प्राप्त करें: Scrapeless
आपको क्या वापस मिलता है
एक google_search कॉल जैविक परिणाम पंक्तियों की एक JSON एरे लौटाती है। प्रत्येक पंक्ति समान कुंजी लेकर आती है, इसलिए एजेंट सीधे शीर्षक, लिंक और स्निपेट पर मैप कर सकता है:
json
// फ़ील्ड नाम google_search उपकरण आउटपुट को दर्शाते हैं; मान उदाहरणात्मक नमूने हैं।
[
{
"position": 1,
"title": "Python के साथ वेब स्क्रैपिंग: एक संपूर्ण गाइड",
"link": "https://example.com/python-web-scraping",
"snippet": "Python के साथ वेब को स्क्रैप करने और HTML को पार्स करने के लिए एक चरण-दर-चरण गाइड।",
"source": "example.com"
},
{
"position": 2,
"title": "डायनेमिक साइट्स को स्क्रैप करना",
"link": "https://example.org/dynamic-scraping",
"snippet": "डेटा निकालने से पहले JavaScript पृष्ठों को रेंडर करने का तरीका।",
"source": "example.org"
}
]
कुछ ईमानदार टिप्पणियां जब आप प्रॉम्प्ट चलाना शुरू करते हैं:
- स्टेटलेस टूल जैसे
google_searchऔरscrape_markdownएक शरीर कोResponse:\n\nप्रीफिक्स के साथ लौटाते हैं, इसके बाद JSON पेलोड होता है; एजेंट स्वचालित रूप से उस प्रीफिक्स को हटा देता है, इसलिए आप डेटा के साथ काम करते हैं,wrapper के साथ नहीं। browser_*टूल सामान्य टेक्स्ट लौटाते हैं जिसमें कोईResponse:\n\nप्रीफिक्स नहीं होता है।- टूल के तर्क कैमेलकेस होते हैं: सटीक नाम के अनुसार
sessionId,proxyCountry, और इसी तरह के फ़ील्ड पास करें। proxyCountryएक अनुरोध है, न कि कोई गारंटी - यह आपके खाते में कॉन्फ़िगर की गई क्षेत्र पर निर्भर हो सकता है, इसलिए जब भौगोलिक लक्षितकरण महत्वपूर्ण हो, तो निकासी क्षेत्र की पुष्टि करें।- टूल आउटपुट में मान सामग्री पर निर्भर होते हैं: परिणाम की संख्या, क्रम, और स्निपेट टेक्स्ट लाइव प्रश्न के साथ भिन्न होते हैं।
निष्कर्ष: टर्मिनल से खोजें, रेंडर करें और ब्राउज़ करें
पूरी एकीकरण एक MCP ब्लॉक और प्राकृतिक भाषा प्रॉम्प्ट में घटित होती है। ~/.qwen/settings.json में scrapeless प्रविष्टि और आपके कुंजी के साथ, Qwen Code लाइव Google खोज, JavaScript रेंडरिंग, और पूरा एंटी-डिटेक्शन क्लाउड ब्राउज़र प्राप्त करता है - ठीक वही वेब परत जो एजेंट अपने दम पर नहीं भेजता। आप कार्य का वर्णन करते हैं; एजेंट उपकरण चुनता है।
अगर आप अन्य एजेंटों को कनेक्ट कर रहे हैं, तो वही Scrapeless MCP सर्वर भी उनमें शामिल होता है: Google Antigravity और Pi Agent एकीकरण देखें, और Scrapeless MCP सर्वर अवलोकन पूर्ण उपकरण संदर्भ के लिए। अपने एपीआई कुंजी को SCRAPELESS_KEY में रखें, स्थानीय CLIs के लिए stdio परिवहन को प्राथमिकता दें और होस्टेड एजेंटों के लिए HTTP-streamable की सलाह दें, और एजेंट को उपकरण चुनने दें। पूर्ण संदर्भ docs.scrapeless.com पर है।
क्या आप अपनी एआई-संचालित डेटा पाइपलाइन बनाने के लिए तैयार हैं?
हमारी समुदाय में शामिल हों और एक मुफ्त योजना का दावा करें तथा उन डेवलपर्स से जुड़ें जो Qwen कोड + Scrapeless MCP एजेंट बना रहे हैं: Discord · Telegram।
Scrapeless पर साइन अप करें मुफ़्त स्क्रैपिंग ब्राउज़र रनटाइम के लिए और ऊपर दिए गए एकीकरण को SERPs, पेजों और क्षेत्रों के अनुसार अनुकूलित करें, जिनकी आपकी टीम को आवश्यकता है। पूर्ण संदर्भ docs.scrapeless.com पर है।
अक्सर पूछे जाने वाले प्रश्न
Qwen कोड को वेब खोज के लिए MCP सर्वर की आवश्यकता क्यों है?
क्योंकि इसमें कोई अंतर्निहित वेब खोज नहीं है। web_search कोर उपकरण को एक प्रारंभिक संस्करण में हटा दिया गया था, और आधिकारिक दस्तावेज वेब खोज को MCP सर्वरों के माध्यम से रूट करते हैं। Scrapeless को कनेक्ट करने से एजेंट को वह लापता खोज क्षमता मिलती है, साथ ही जबदस्त पृष्ठ पहुंच और एक पूर्ण क्लाउड ब्राउज़र।
यह Qwen कोड के अंतर्निहित web_fetch से कैसे भिन्न है?
web_fetch एक URL की सीधी पुनर्प्राप्ति करता है। यह JavaScript का प्रदर्शन नहीं करता है और न ही कोई एंटी-डिटेक्शन या प्रॉक्सी स्तर ले जाता है, इसलिए यह एकल-पृष्ठ अनुप्रयोगों और बॉट-संरक्षित साइटों पर संघर्ष करता है। Scrapeless उपकरण लापता खोज (google_search), साफ प्रदर्शित टेक्स्ट (scrape_markdown), और आवासीय प्रॉक्सियों पर एक राज्यपूर्ण एंटी-डिटेक्शन ब्राउज़र (browser_*) जोड़ते हैं।
कौन सा पर्यावरण चर Scrapeless कुंजी रखता है?
SCRAPELESS_KEY। यह प्रलेखित अपवाद है — Scrapeless CLI और SDK SCRAPELESS_API_KEY को पढ़ते हैं, लेकिन MCP सर्वर SCRAPELESS_KEY को पढ़ता है। Qwen कोड इसे आपके वातावरण से env ऑब्जेक्ट के भीतर $SCRAPELESS_KEY के माध्यम से बढ़ा सकता है।
Qwen कोड MCP कॉन्फ़िगरेशन कहाँ से पढ़ता है?
उपयोगकर्ता स्कोप के लिए ~/.qwen/settings.json से, या परियोजना रूट में .qwen/settings.json से परियोजना स्कोप के लिए। दोनों mcpServers ऑब्जेक्ट का उपयोग करते हैं। आप qwen mcp add के साथ एक सर्वर भी जोड़ सकते हैं और qwen mcp list के साथ कनेक्शनों का निरीक्षण कर सकते हैं।
stdio बनाम HTTP स्ट्रीम करने योग्य — आपको कब प्रत्येक का उपयोग करना चाहिए?
जब सर्वर CLI के साथ स्थानीय रूप से चलता है तो stdio का उपयोग करें: Qwen कोड scrapeless-mcp-server को एक बच्चे के रूप में लॉन्च करता है और इसके साथ मानक इनपुट/आउटपुट के माध्यम से बात करता है। HTTP स्ट्रीम करने योग्य (जो https://api.scrapeless.com/mcp पर httpUrl कुंजी को पॉइंट करता है और x-api-token हेडर के साथ) तब उपयोग करें जब एजेंट होस्टेड या दूरस्थ हो और स्थानीय प्रक्रिया को शुरू नहीं कर सकता।
क्या proxyCountry हमेशा लागू होता है?
ज़रूरी नहीं। proxyCountry एक प्राथमिकता है जो आपके खाते पर कॉन्फ़िगर की गई क्षेत्र पर निर्भर कर सकती है। यदि भू-लक्ष्यण महत्वपूर्ण है, तो प्रति-कॉल मान को हमेशा जीतने का अनुमान लगाए बिना, आउटबाउंड क्षेत्र की पुष्टि करें।
क्या एजेंट के माध्यम से वेब स्क्रैपिंग वैध है?
सार्वजनिक रूप से उपलब्ध डेटा को स्क्रैप करना सामान्यतः अनुमति है, लेकिन आप इसकी उपयोगिता के लिए जिम्मेदार हैं। प्रत्येक साइट की सेवा की शर्तों की समीक्षा करें और robots.txt का सम्मान करें, और याद रखें कि व्यक्तिगत डेटा और पहुंच के आस-पास के नियम न्याय क्षेत्र के आधार पर भिन्न होते हैं। जब संदेह में हों, तो अपने विशिष्ट उपयोग के मामले के लिए कानूनी सलाह प्राप्त करें।
क्या आप इसे बिना AI एजेंट के उपयोग कर सकते हैं?
हां। Scrapeless MCP सर्वर एक मानक MCP सर्वर है, इसलिए कोई भी MCP-संगत क्लाइंट इसे कॉल कर सकता है — या आप इसे JSON-RPC के माध्यम से सीधे चला सकते हैं (initialize, फिर tools/list और tools/call)। एजेंट एक सुविधा है, आवश्यकता नहीं।
स्क्रैपलेस में, हम केवल सार्वजनिक रूप से उपलब्ध डेटा का उपयोग करते हैं, जबकि लागू कानूनों, विनियमों और वेबसाइट गोपनीयता नीतियों का सख्ती से अनुपालन करते हैं। इस ब्लॉग में सामग्री केवल प्रदर्शन उद्देश्यों के लिए है और इसमें कोई अवैध या उल्लंघन करने वाली गतिविधियों को शामिल नहीं किया गया है। हम इस ब्लॉग या तृतीय-पक्ष लिंक से जानकारी के उपयोग के लिए सभी देयता को कोई गारंटी नहीं देते हैं और सभी देयता का खुलासा करते हैं। किसी भी स्क्रैपिंग गतिविधियों में संलग्न होने से पहले, अपने कानूनी सलाहकार से परामर्श करें और लक्ष्य वेबसाइट की सेवा की शर्तों की समीक्षा करें या आवश्यक अनुमतियाँ प्राप्त करें।



