वापस ब्लॉग पर

वेब सर्च को क्‍वेन कोड में कैसे जोड़े: टर्मिनल एजेंटों के लिए स्क्रेपलेस MCP इंटीग्रेशन

Ava Wilson
Ava Wilson

Expert in Web Scraping Technologies

25-May-2026

मुख्य निष्कर्ष:

  • क्वेन कोड में कोई अंतर्निहित वेब खोज नहीं है - एमसीपी ही इसे वेब दिखाता है। अंतर्निहित वेब_खोज उपकरण को एक प्रारंभिक संस्करण में हटा दिया गया था; आधिकारिक दस्तावेज स्पष्ट रूप से बताता है कि वेब खोज एक एमसीपी सर्वर से जोड़कर प्रदान की जाती है। उस कनेक्शन को स्क्रेपलेस पर इंगित करें और टर्मिनल एजेंट एक ही बार में लाइव गूगल खोज, पृष्ठ रेंडरिंग, और एक पूर्ण क्लाउड ब्राउज़र प्राप्त करता है।
  • ~/.qwen/settings.json में एक ब्लॉक इसका सारा काम जोड़ता है। mcpServers ऑब्जेक्ट में एकल scrapeless प्रविष्टि जोड़ें और एजेंट को गूगल सर्प स्क्रैपर, ट्रेंड्स स्क्रैपर, HTML/Markdown/Screenshot सहायक, और 16 ब्राउज़र-स्वचालन उपकरण मिलते हैं - बिना किसी एसडीके कोड के, बिना किसी सेवा के।
  • एजेंट साधारण प्रॉम्प्ट से खोजता है, रेंडर करता है और ब्राउज़र चलाता है। प्राकृतिक भाषा में गूगल पर खोजने के लिए, जावास्क्रिप्ट-भारी पृष्ठ को साफ मार्कडाउन के रूप में पढ़ने के लिए, या कई कदमों के प्रवाह के माध्यम से क्लिक करने के लिए पूछें, और क्वेन कोड सही उपकरण कॉल तैयार करता है कदम-दर-कदम, बजाय इसे प्रशिक्षण-कटऑफ ज्ञान और स्थानीय फ़ाइलों पर सीमित होने के।
  • गृहस्थ प्रॉक्सी और एंटी-डिटेक्शन क्लाउड-पारHandled होते हैं। प्रत्येक अनुरोध स्क्रेपलेस एंटी-डिटेक्शन क्लाउड ब्राउज़र के माध्यम से रूट होता है जिसमें 195+ देशों में घरेलू प्रॉक्सियाँ शामिल होती हैं, ताकि एजेंट व्यावसायिक साइटों पर रेंडर की गई, उपयोगी प्रतिक्रिया प्राप्त कर सके बिना आपकी मशीन पर किसी प्रॉक्सी या फिंगरप्रिंट सेटअप के।
  • SERP, स्टेटलेस स्क्रैपिंग, और ब्राउज़र स्वचालन के लिए 21 उपकरण। स्क्रेपलेस एमसीपी सर्वर google_search, google_trends, scrape_html/scrape_markdown/scrape_screenshot, के साथ-साथ 16 browser_* उपकरणों का प्रदर्शन करता है - एक नाम स्थान जिससे एजेंट का प्लानर प्रत्येक बारी पर खींचता है।
  • स्टडिओ या HTTP-स्ट्रीम करने योग्य परिवहन। npx के साथ स्थानीय रूप से सर्वर चालू करें, या एक ही कॉन्फ़िगरेशन को स्ट्रीम करने योग्य HTTP अंतिम बिंदु पर इंगित करें दूरस्थ विकास कंटेनरों और सीआई चलाने वालों के लिए।
  • शुरू करने के लिए मुफ्त। नए स्क्रेपलेस खातों में मुफ्त स्क्रैपिंग ब्राउज़र रUNTIME शामिल है - स्क्रेपलेस पर साइन अप करें।

परिचय: एक टर्मिनल कोडिंग एजेंट जो अंततः इंटरनेट का लाइव पढ़ सकता है

क्वेन कोड एक ओपन-सोर्स एआई एजेंट है जो आपके टर्मिनल में रहता है, जिसे क्वेन श्रृंखला के मॉडलों के लिए अनुकूलित किया गया है। यह बड़े कोडबेस को पढ़ता है, फ़ाइलों को संपादित करता है, आदेश चलाता है, और एक प्रोजेक्ट के थकाऊ हिस्सों को स्वचालित करता है - बिना शेल छोड़े। जो यह अपने दम पर नहीं कर सकता वह लाइव वेब को देखना है। इसका ज्ञान मॉडल के प्रशिक्षण के कटऑफ़ पर रुकता है और डिस्क पर फ़ाइलें।

क्वेन कोड में यह अंतर असामान्य रूप से स्पष्ट है। अंतर्निहित वेब_खोज उपकरण को एक प्रारंभिक संस्करण में हटा दिया गया था, और आधिकारिक दस्तावेज ठोस रूप से कहते हैं कि "वेब खोज बाहरी एमसीपी सर्वरों से जोड़ने पर प्रदान की जाती है" न कि किसी अंतर्निहित उपकरण के माध्यम से। दूसरे शब्दों में, क्वेन कोड में वास्तविक समय की वेब पहुंच एक बाद की सोच नहीं है जिसे आप जोड़ते हैं - यह इच्छित विस्तार बिंदु है। जब तक आप एक कनेक्ट नहीं करते, एजेंट वर्तमान सर्प को खींच नहीं सकता, प्रतियोगी के मूल्य निर्धारण पृष्ठ को नहीं पढ़ सकता, नवीनतम परिवर्तनपत्र की जांच नहीं कर सकता, या केवल जावास्क्रिप्ट ऐप को नहीं रेंडर कर सकता।

यह लेख उस अंतर को समाप्त करता है, स्क्रेपलेस एमसीपी सर्वर को क्वेन कोड में जोड़कर। ~/.qwen/settings.json में एक ब्लॉक एजेंट को गूगल खोज, जावास्क्रिप्ट रेंडरिंग, और एक पूर्ण एंटी-डिटेक्शन क्लाउड ब्राउज़र प्रदान करता है, जो सभी एक ही प्राकृतिक-भाषा प्रॉम्प्ट के माध्यम से पहुंच योग्य होते हैं जो पहले से ही कोड के लिए उपयोग होते हैं। अन्य एमसीपी क्लाइंट्स के माध्यम से समान स्क्रेपलेस सतह के लिए, गूगल एंटीग्रेविटी वाकथ्रूप और पी एजेंट एकीकरण देखें।


आप इसके साथ क्या कर सकते हैं

  • तराजू SERP अनुसंधान टर्मिनल में। एजेंट से पूछें कि वह किसी क्वेरी के लिए google_search चलाए और शीर्ष परिणामों को JSON के रूप में लौटाए, ताकि अनुसंधान शेल में हो न कि एक अलग ब्राउज़र टैब में।
  • प्रतिस्पर्धी और मूल्य निर्धारण स्नैपशॉट। प्रॉम्प्ट में एक URL डालें और एजेंट से पृष्ठ को रेंडर करने दें और योजना के नाम, कीमतों, और विशेषताओं को एक संरचित रिकॉर्ड में निकालें जिसे आप अपने कोड के बगल में डाल सकते हैं।
  • डॉक और चेंज पत्र की खोज जो कोड को फीड करती है। एजेंट को एक लाइब्रेरी का वर्तमान डॉक या रिलीज नोट्स साफ मार्कडाउन के रूप में लाने के लिए कहें और रेंडर किए गए पाठ के खिलाफ लिखें बजाय एक पुरानी एपीआई की याददाश्त के।
  • मार्केट और ट्रेंड जांचें। google_trends का उपयोग करें एक विषय के लिए एक लक्षित क्षेत्र में रुचि संकेत खींचने के लिए, फिर फीचर कॉपी, सामग्री योजनाओं, या प्रयोग के विचारों को वर्तमान सबूतों के साथ बीज दें।
  • जावास्क्रिप्ट-पृष्ठ निकासी एक प्रकार के रिकॉर्ड में। एजेंट को एक सिंगल-पृष्ठ ऐप पर इंगित करें; क्लाउड ब्राउज़र इसे हाइड्रेट करता है और एजेंट परिणाम को आप जो स्क्रिप्ट बना रहे हैं उसके लिए एक टाइप किए गए ऑब्जेक्ट में पार्स करता है।
  • कई चरणों वाले ब्राउज़र प्रवाह। browser_goto, browser_click, browser_type, और browser_scroll को एक साथ जोड़ें ताकि एजेंट पेजिनेशन में चल सके, पैनल का विस्तार कर सके, या निकालने से पहले एक विज़ार्ड में कदम रख सके।
  • समीक्षा के लिए स्क्रीनशॉट कैप्चर करना। scrape_screenshot या browser_screenshot का उपयोग करें ताकि एजेंट एक छवि के रूप में रेंडर किए गए पृष्ठ को कैच कर सके जिसे वह कार्यक्षेत्र में सहेज सके।
  • सर्च-फिर-पढ़ने वाले पाइपलाइन। google_search को scrape_markdown के साथ संयोजित करें ताकि एजेंट शीर्ष परिणामों को खोज सके, प्रत्येक को पढ़े, और उन्हें एकल टर्मिनल मोड़ में संक्षेपित करे।

स्क्रेपलेस पर, हम केवल सार्वजनिक रूप से उपलब्ध डेटा तक पहुंच प्राप्त करते हैं, जबकि लागू कानूनों, विनियमों और वेबसाइट की गोपनीयता नीतियों के साथ पूरी तरह से अनुपालन करते हैं। इस पोस्ट का सामग्री केवल प्रदर्शनी उद्देश्यों के लिए है।


स्क्रेपलेस MCP सर्वर क्यों?

स्क्रेपलेस MCP सर्वर एक अनुकूलन योग्य, एंटी-डिटेक्शन ब्रिज है जो एक AI एजेंट और लाइव वेब के बीच है। विशेष रूप से Qwen कोड के लिए, यह लाता है:

  • एंटी-डिटेक्शन क्लाउड ब्राउज़र जिसमें जावास्क्रिप्ट रेंडरिंग है। पृष्ठों को निष्कर्षण से पहले एक पूर्ण स्क्रेपलेस स्क्रेपिंग ब्राउज़र में हाइड्रेट किया जाता है, ताकि SPA, अनंत-स्क्रॉल फ़ीड, और लेजी-लोड किए गए पैनल browser_goto + browser_get_html के लिए पहले श्रेणी के लक्ष्य बन जाएं।
  • 195+ देशों में आवासीय प्रॉक्सी। भौगोलिक रूप से बंधे प्रश्न स्थानीय उपयोगकर्ता जो लिस्टिंग देखेगा, वही लौटाते हैं, जिसमें प्रॉक्सी एगिंग पूरी तरह से स्क्रेपलेस पक्ष पर संभालता है।
  • एक stdio कमांड के माध्यम से npx, कोई SDK कोड नहीं। सर्वर npx -y scrapeless-mcp-server से एक चाइल्ड प्रोसेस के रूप में लॉन्च होता है; करने के लिए कुछ भी नहीं है, होस्ट करने के लिए कुछ नहीं है, या आपके प्रोजेक्ट में आयात करने के लिए कुछ नहीं है।
  • SERP, Stateless Scraping, और पूर्ण ब्राउज़र स्वचालन को कवर करने वाले 21 उपकरण। google_search और google_trends SERP डेटा को कवर करते हैं, scrape_html/scrape_markdown/scrape_screenshot एक बार में पृष्ठ फेच को कवर करते हैं, और 16 browser_* उपकरण स्थिति-आधारित नेविगेशन, क्लिक करने, टाइप करने, स्क्रॉल करने और स्क्रीनशॉट लेने को कवर करते हैं।
  • Qwen कोड के अपने web_fetch का पूरक। Qwen कोड एक साधारण web_fetch मूल पृष्ठ पुनर्प्राप्ति के लिए लाता है, लेकिन यह जावास्क्रिप्ट को रेंडर नहीं करता या एंटी-डिटेक्शन नहीं करता। स्क्रेपलेस उपकरण बिल्कुल उस खाई को भरते हैं — एजेंट जिसने कभी खोज नहीं की, इसके अलावा रेंडर, प्रॉक्सिड पृष्ठ पहुंच।

मुफ्त योजना इसे सेट करने और वास्तविक संकेत चलाने के लिए पर्याप्त है; जब आप इससे ऊपर उठते हैं तो प्राइसिंग पृष्ठ पर क्वोटा की तुलना करें। मुफ्त योजना पर अपना API कुंजी प्राप्त करें स्क्रेपलेस पर।


पूर्वापेक्षाएँ

  • कार्यस्थान पर Node.js 22 या नया — Qwen कोड को Node 22+ की आवश्यकता होती है, और stdio MCP सर्वर npx के साथ उत्पन्न होता है।
  • Qwen कोड स्थापित और एक मॉडल प्रदाता कॉन्फ़िगर किया गया। Qwen कोड LLM बैकएंड के खिलाफ प्रमाणित होता है; एजेंट लूप को किसी भी उपकरण कॉल चलाने से पहले एक कार्यशील मॉडल की आवश्यकता होती है।
  • स्क्रेपलेस खाता और API कुंजी — app.scrapeless.com पर मुफ्त योजना पर साइन अप करें और सेटिंग्स → API कुंजी प्रबंधन से कुंजी कॉपी करें।
  • मूल टर्मिनल परिचितता — पूरा सेटअप कुछ आदेशों और एक छोटे JSON फ़ाइल का समूह है।

इंस्टॉल करें

सेटअप पांच उप-चरण हैं; प्रत्येक स्वतंत्र रूप से सत्यापन योग्य है।

1. Qwen कोड स्थापित करें

npm से CLI को वैश्विक रूप से स्थापित करें, फिर संस्करण चेक करें:

bash Copy
npm install -g @qwen-code/qwen-code
qwen --version

आप इसे वैश्विक इंस्टॉल के बिना भी npx -y @qwen-code/qwen-code@latest के माध्यम से चला सकते हैं।

2. एक मॉडल प्रदाता कनेक्ट करें

Qwen कोड एक LLM बैकएंड के साथ बातचीत करता है। यह एक OpenAI-संगत मोड का समर्थन करता है, इसलिए कोई भी OpenAI-संगत एंडपॉइंट काम करता है — प्रमाणीकरण प्रकार, API कुंजी, आधार URL, और मॉडल सेट करें:

bash Copy
export OPENAI_API_KEY="your_provider_key_here"
export OPENAI_BASE_URL="https://your-openai-compatible-endpoint/v1"
qwen --auth-type openai -m "your-model-id"

इन्हीं मूल्यों को --openai-api-key और --openai-base-url ध्वजों के रूप में भी पास किया जा सकता है। किसी ऐसे मॉडल का चयन करें जो उपकरण कॉल को अच्छे से संभाले — Qwen कोड एजेंटिक टूल उपयोग के चारों ओर बनाया गया है, इसलिए एक वर्तमान Qwen-श्रेणी कोडर मॉडल स्वाभाविक रूप से उपयुक्त है।

3. स्क्रेपलेस MCP सर्वर जोड़ें (stdio)

Qwen कोड MCP सर्वरों को ~/.qwen/settings.json (उपयोगकर्ता स्कोप) या किसी प्रोजेक्ट रूट में .qwen/settings.json से पढ़ता है। mcpServers ऑब्जेक्ट में एक scrapeless ब्लॉक जोड़ें:

json Copy
{
  "mcpServers": {
    "scrapeless": {
      "command": "npx",
      "args": ["-y", "scrapeless-mcp-server"],
      "env": { "SCRAPELESS_KEY": "$SCRAPELESS_KEY" },
      "timeout": 60000,
      "trust": true
    }
  }
}

यहां दो विवरण महत्वपूर्ण हैं। पहले, स्क्रेपलेस MCP सर्वर अपने कुंजी को SCRAPELESS_KEY से पढ़ता है, न कि SCRAPELESS_API_KEY — स्क्रेपलेस CLI और SDK SCRAPELESS_API_KEY का उपयोग करते हैं, लेकिन MCP सर्वर एक दस्तावेजित अपवाद है। दूसरा, Qwen कोड $VAR और ${VAR} को env ऑब्जेक्ट के अंदर विस्तारित करता है, इसलिए आप अपने पर्यावरण में कुंजी रख सकते हैं (export SCRAPELESS_KEY=...) और इसे $SCRAPELESS_KEY के रूप में संदर्भित कर सकते हैं, न कि फ़ाइल में सीधे मान डालकर। सर्वर स्रोत github.com/scrapeless-ai/scrapeless-mcp-server पर स्थित है।

आप CLI से सर्वर जोड़ सकते हैं, बजाय JSON को हाथ से संपादित करने के:

bash Copy
qwen mcp add --transport stdio --scope user --env SCRAPELESS_KEY=$SCRAPELESS_KEY --trust scrapeless npx -y scrapeless-mcp-server

4. या HTTP स्ट्रीम करने योग्य मोड का उपयोग करें

अगर होस्ट भरोसेमंद तरीके से npx — एक होस्टेड डेवलप कंटेनर, एक दूरस्थ कार्यक्षेत्र, या एक CI सैंडबॉक्स — चालू नहीं कर सकता है, तो Qwen Code को स्थानीय प्रक्रिया के बजाय Scrapeless HTTP एंडपॉइंट पर इशारा करें। HTTP ट्रांसपोर्ट के लिए, Qwen Code httpUrl कुंजी का उपयोग करता है जिसमें एक वैकल्पिक headers ऑब्जेक्ट होता है:

json Copy
{
  "mcpServers": {
    "scrapeless": {
      "httpUrl": "https://api.scrapeless.com/mcp",
      "headers": { "x-api-token": "आपकी_SCRAPELESS_KEY" }
    }
  }
}

एक्सप्रेस के लिए, एक ही कुंजी मान दोनों मोड में काम करता है; HTTP स्ट्रीम करने योग्य इसे x-api-token हेडर के रूप में पास करता है न कि SCRAPELESS_KEY पर्यावरण चर के रूप में। डिफ़ॉल्ट रूप से स्टेडियो एक डेवलपर वर्कस्टेशन पर सही है; HTTP स्ट्रीम करने योग्य सही डिफ़ॉल्ट है जहां लंबी अवधि के बच्चे की प्रक्रिया को जीवित रखना कठिन है।

5. कनेक्शन को सत्यापित करें

कॉन्फ़िगर किए गए MCP सर्वरों की सूची बनाएं:

bash Copy
qwen mcp list

scrapeless सर्वर को संयुक्त रिपोर्ट करना चाहिए, जिसका अर्थ है कि Qwen Code ने stdio प्रक्रिया लॉन्च की है और MCP हस्ताक्षर पूरा किया है। वहां से एजेंट सर्वर के 21 उपकरणों का उल्लेख कर सकता है — Google डेटा उपकरण (google_search, google_trends), एक-बार के पृष्ठ सहायक (scrape_html, scrape_markdown, scrape_screenshot), और क्लाउड-ब्राउज़र प्राइमिटिव्स (browser_create, browser_goto, browser_get_html, browser_get_text, browser_click, browser_type, browser_press_key, browser_scroll, browser_scroll_to, browser_screenshot, browser_snapshot, browser_wait, browser_wait_for, browser_go_back, browser_go_forward, browser_close)।


आप इसे वास्तव में कैसे उपयोग करते हैं: अपने Qwen Code एजेंट को प्रोत्साहित करें

MCP सर्वर को कनेक्ट करने के बाद, आप टर्मिनल में Qwen Code से बात करके लाइव वेब डेटा प्राप्त करते हैं — टूल कॉल को हाथ से लिखने के बजाय। एजेंट Scrapeless MCP सर्वर द्वारा एक्सपोज़ की गई टूल सूची को पढ़ता है और जैसे आवश्यक हो google_search, scrape_markdown, या browser_* टूल का चयन करता है, उन्हें प्राकृतिक भाषा प्रॉम्प्ट से टर्न बाय टर्न एकत्रित करता है। आपके पक्ष पर कोई टूल JSON बनाने की आवश्यकता नहीं है। Qwen Code इंटरैक्टिव रूप से एक सत्र में प्रॉम्प्ट चलाता है, या एक बार के रन और स्क्रिप्टिंग के लिए प्रॉम्प्ट को स्थितीय तर्क (या stdin पर पाइपिंग) के रूप में पास करता है।

आप पेस्ट कर सकते हैं प्रॉम्प्ट

प्रॉम्प्ट एजेंट क्या करता है
"2026 के लिए vector database benchmarks के शीर्ष Google परिणाम खोजें और उन्हें JSON के रूप में वापस करें।" google_search के साथ q, hl, gl → टाइप किए गए परिणाम पंक्तियाँ।
"अभी अमेरिका में developer tools के लिए कौन से खोज विषय बढ़ रहे हैं?" google_trends।
"क्लीन मार्कडाउन के रूप में https://qwenlm.github.io/qwen-code-docs/en/users/overview/ पर Qwen Code डॉक पृष्ठ लाएं।" scrape_markdown।
"खोलें https://pricing.example.com, यह एक JavaScript ऐप है — इसे रेंडर करें और योजना का नाम, मूल्य, और सुविधाएँ JSON के रूप में निकालें।" browser_create → browser_goto → browser_get_html → टाइप की गई निकासी।
"के लिए मूल्य निर्धारण पृष्ठों की तुलना करें https://a.example.com/pricing और https://b.example.com/pricing और मुझे बताएं कि वे कहाँ भिन्न हैं।" browser_create → browser_goto (A) → browser_get_html → browser_goto (B) → browser_get_html → डिफ़।
"पूरे पृष्ठ की स्क्रीनशॉट लें https://example.com/landing का।" scrape_screenshot।
"https://example.com के रेंडर किए गए HTML को पकड़ें ताकि मैं मार्कअप पढ़ सकूं।" scrape_html।
"खोलें https://example.com/jobs, लिस्टिंग के लोड होने की प्रतीक्षा करें, पृष्ठ का स्नैपशॉट लें, फिर हर नौकरी के शीर्षक और स्थान को JSON के रूप में निकालें।" browser_create → browser_goto → browser_wait_for → browser_snapshot → टाइप की गई निकासी → browser_close।

कार्यान्वयन का उदाहरण

आप टाइप करते हैं (एक बार, प्रॉम्प्ट stdin पर पास किया गया):

bash Copy
echo "scrapeless google_search टूल का उपयोग करें 'qwen code github' के लिए शीर्ष परिणाम खोजें और शीर्ष 3 को {title, link} के JSON एरे के रूप में वापस करें।" | qwen --approval-mode yolo --allowed-mcp-server-names scrapeless

एजेंट की योजना (साधारण अंग्रेजी में):

  1. google_search को q: "qwen code github", hl: "en", gl: "us" के साथ कॉल करें।
  2. परिणाम पंक्तियों का एक एरे प्राप्त करें और position, title, और link फ़ील्ड पढ़ें।
  3. position के अनुसार क्रमित करें और पहले तीन पंक्तियों को रखें।
  4. प्रत्येक पंक्ति को {title, link} ऑब्जेक्ट में मैप करें।
  5. JSON एरे को टर्मिनल पर वापस करें।

आपको क्या मिलता है (चित्रात्मक आकार — एजेंट इन जैसी पंक्तियों से काम करता है):

json Copy
[
  { "title": "Qwen Code एक ओपन-सोर्स AI एजेंट है टर्मिनल के लिए, ...", "link": "https://qwen.ai/qwencode" },
  { "title": "Qwen Code अवलोकन", "link": "https://qwenlm.github.io/qwen-code-docs/en/users/overview/" },
  { "title": "qwen-code/qwen-code-core", "link": "https://www.npmjs.com/package/@qwen-code/qwen-code-core" }
]
// फ़ील्ड नाम google_search पंक्ति आकार से मेल खाते हैं; मान चित्रात्मक नमूने हैं।

--allowed-mcp-server-names scrapeless रन को Scrapeless उपकरणों तक सीमित करता है, और --approval-mode yolo एजेंट को इंटरएक्टिव प्रॉम्प्ट के बिना विश्वसनीय उपकरण को कार्यान्वित करने की अनुमति देता है - हेडलेस और स्क्रिप्टेड रन के लिए सुविधाजनक। स्टेटलेस डेटा उपकरण अपना पेलोड Response:\n\n के साथ प्रीफिक्स किए गए शरीर के रूप में लौटाते हैं; एजेंट JSON को पार्स करने से पहले उस प्रीफिक्स को हटा देता है, इसलिए आप इसे उत्तर में कभी नहीं देखते हैं।

प्रॉम्प्ट आकार देना

यह कहें प्रभाव
"…जर्मनी से" / "…जर्मन परिणाम" proxyCountry के माध्यम से निकासी को मार्गदर्शित करता है और खोज पर gl=de सेट करता है।
"…मार्कडाउन के रूप में, नेव और बॉयलरप्लेट को छोड़ें" साफ टेक्स्ट पेलोड के लिए scrape_markdown चुनता है, कच्चे HTML के बजाय।
"…पहले इसे रेंडर करें, यह एक सिंगल-पेज ऐप है" browser_* पथ ( browser_create → browser_goto → browser_get_html ) को बल देकर निकालने को हाइड्रेटेड DOM पर चलाता है।
"…केवल शीर्ष 5" लौटाए गए एरे को पहले पांच पंक्तियों तक सीमित करता है।
"…हर परिणाम के लिए स्निपेट शामिल करें" आउटपुट पंक्तियों में snippet फ़ील्ड को बनाए रखता है।
"…जब आप समाप्त कर लें तो सत्र को बंद करें" browser_create से sessionId के साथ अंतिम browser_close जोड़ता है।

सब कुछ नीचे का एंटर-टे-हूड संदर्भ है - उपकरण की सतह, सटीक लौटने के आकार, और व्यवहार जो एजेंट आपके लिए संभालता है।


Scrapeless MCP उपकरण सतह

एक बार जब सर्वर कनेक्ट हो जाता है, तो Qwen Code 21 उपकरणों को SERP डेटा, स्टेटलेस स्क्रैपिंग, और पूर्ण एंटी-डिटेक्शन क्लाउड ब्राउज़र नियंत्रण में देखता है।

उपकरण यह क्या करता है
google_search एक गूगल खोज (q, hl, gl) चलाता है और संरचित जैविक परिणाम पंक्तियों को लौटाता है।
google_trends एक प्रश्न के लिए गूगल ट्रेंड्स रुचि डेटा लाता है।
scrape_html एक URL को लाता है और इसके रेंडर किए गए HTML को लौटाता है।
scrape_markdown एक URL को लाता है और पृष्ठ के लिए साफ मार्कडाउन लौटाता है।
scrape_screenshot लक्षित URL का स्क्रीनशॉट लेता है।
browser_create एंटी-डिटेक्शन क्लाउड ब्राउज़र पर एक सत्र खोलता है।
browser_goto URL पर सत्र को नेविगेट करता है।
browser_click लाइव पृष्ठ में एक तत्व पर क्लिक करता है।
browser_type एक इनपुट या संपादन योग्य फ़ील्ड में टेक्स्ट टाइप करता है।
browser_get_text / browser_get_html पृष्ठ के टेक्स्ट या HTML को पढ़ता है।
browser_screenshot लाइव सत्र का स्क्रीनशॉट लेता है।
browser_snapshot पृष्ठ का पहुंच/संरचना स्नैपशॉट लौटाता है।
browser_wait / browser_wait_for एक निश्चित अंतराल के लिए, या किसी स्थिति/तत्व के लिए प्रतीक्षा करता है।
browser_scroll / browser_scroll_to पृष्ठ को या किसी विशिष्ट तत्व तक स्क्रॉल करता है।
browser_go_back / browser_go_forward सत्र के इतिहास के माध्यम से चलता है।
browser_press_key पृष्ठ पर एक कीबोर्ड की भेजता है।
browser_close क्लाउड ब्राउज़र सत्र समाप्त करता है।

मुफ्त योजना पर अपना एपीआई कुंजी प्राप्त करें: Scrapeless


आपको क्या वापस मिलता है

एक google_search कॉल जैविक परिणाम पंक्तियों की एक JSON एरे लौटाती है। प्रत्येक पंक्ति समान कुंजी लेकर आती है, इसलिए एजेंट सीधे शीर्षक, लिंक और स्निपेट पर मैप कर सकता है:

json Copy
// फ़ील्ड नाम google_search उपकरण आउटपुट को दर्शाते हैं; मान उदाहरणात्मक नमूने हैं।
[
  {
    "position": 1,
    "title": "Python के साथ वेब स्क्रैपिंग: एक संपूर्ण गाइड",
    "link": "https://example.com/python-web-scraping",
    "snippet": "Python के साथ वेब को स्क्रैप करने और HTML को पार्स करने के लिए एक चरण-दर-चरण गाइड।",
    "source": "example.com"
  },
  {
    "position": 2,
    "title": "डायनेमिक साइट्स को स्क्रैप करना",
    "link": "https://example.org/dynamic-scraping",
    "snippet": "डेटा निकालने से पहले JavaScript पृष्ठों को रेंडर करने का तरीका।",
    "source": "example.org"
  }
]

कुछ ईमानदार टिप्पणियां जब आप प्रॉम्प्ट चलाना शुरू करते हैं:

  • स्टेटलेस टूल जैसे google_search और scrape_markdown एक शरीर को Response:\n\n प्रीफिक्स के साथ लौटाते हैं, इसके बाद JSON पेलोड होता है; एजेंट स्वचालित रूप से उस प्रीफिक्स को हटा देता है, इसलिए आप डेटा के साथ काम करते हैं,wrapper के साथ नहीं।
  • browser_* टूल सामान्य टेक्स्ट लौटाते हैं जिसमें कोई Response:\n\n प्रीफिक्स नहीं होता है।
  • टूल के तर्क कैमेलकेस होते हैं: सटीक नाम के अनुसार sessionId, proxyCountry, और इसी तरह के फ़ील्ड पास करें।
  • proxyCountry एक अनुरोध है, न कि कोई गारंटी - यह आपके खाते में कॉन्फ़िगर की गई क्षेत्र पर निर्भर हो सकता है, इसलिए जब भौगोलिक लक्षितकरण महत्वपूर्ण हो, तो निकासी क्षेत्र की पुष्टि करें।
  • टूल आउटपुट में मान सामग्री पर निर्भर होते हैं: परिणाम की संख्या, क्रम, और स्निपेट टेक्स्ट लाइव प्रश्न के साथ भिन्न होते हैं।

निष्कर्ष: टर्मिनल से खोजें, रेंडर करें और ब्राउज़ करें

पूरी एकीकरण एक MCP ब्लॉक और प्राकृतिक भाषा प्रॉम्प्ट में घटित होती है। ~/.qwen/settings.json में scrapeless प्रविष्टि और आपके कुंजी के साथ, Qwen Code लाइव Google खोज, JavaScript रेंडरिंग, और पूरा एंटी-डिटेक्शन क्लाउड ब्राउज़र प्राप्त करता है - ठीक वही वेब परत जो एजेंट अपने दम पर नहीं भेजता। आप कार्य का वर्णन करते हैं; एजेंट उपकरण चुनता है।
अगर आप अन्य एजेंटों को कनेक्ट कर रहे हैं, तो वही Scrapeless MCP सर्वर भी उनमें शामिल होता है: Google Antigravity और Pi Agent एकीकरण देखें, और Scrapeless MCP सर्वर अवलोकन पूर्ण उपकरण संदर्भ के लिए। अपने एपीआई कुंजी को SCRAPELESS_KEY में रखें, स्थानीय CLIs के लिए stdio परिवहन को प्राथमिकता दें और होस्टेड एजेंटों के लिए HTTP-streamable की सलाह दें, और एजेंट को उपकरण चुनने दें। पूर्ण संदर्भ docs.scrapeless.com पर है।


क्या आप अपनी एआई-संचालित डेटा पाइपलाइन बनाने के लिए तैयार हैं?

हमारी समुदाय में शामिल हों और एक मुफ्त योजना का दावा करें तथा उन डेवलपर्स से जुड़ें जो Qwen कोड + Scrapeless MCP एजेंट बना रहे हैं: Discord · Telegram।

Scrapeless पर साइन अप करें मुफ़्त स्क्रैपिंग ब्राउज़र रनटाइम के लिए और ऊपर दिए गए एकीकरण को SERPs, पेजों और क्षेत्रों के अनुसार अनुकूलित करें, जिनकी आपकी टीम को आवश्यकता है। पूर्ण संदर्भ docs.scrapeless.com पर है।


अक्सर पूछे जाने वाले प्रश्न

Qwen कोड को वेब खोज के लिए MCP सर्वर की आवश्यकता क्यों है?

क्योंकि इसमें कोई अंतर्निहित वेब खोज नहीं है। web_search कोर उपकरण को एक प्रारंभिक संस्करण में हटा दिया गया था, और आधिकारिक दस्तावेज वेब खोज को MCP सर्वरों के माध्यम से रूट करते हैं। Scrapeless को कनेक्ट करने से एजेंट को वह लापता खोज क्षमता मिलती है, साथ ही जबदस्त पृष्ठ पहुंच और एक पूर्ण क्लाउड ब्राउज़र।

यह Qwen कोड के अंतर्निहित web_fetch से कैसे भिन्न है?

web_fetch एक URL की सीधी पुनर्प्राप्ति करता है। यह JavaScript का प्रदर्शन नहीं करता है और न ही कोई एंटी-डिटेक्शन या प्रॉक्सी स्तर ले जाता है, इसलिए यह एकल-पृष्ठ अनुप्रयोगों और बॉट-संरक्षित साइटों पर संघर्ष करता है। Scrapeless उपकरण लापता खोज (google_search), साफ प्रदर्शित टेक्स्ट (scrape_markdown), और आवासीय प्रॉक्सियों पर एक राज्यपूर्ण एंटी-डिटेक्शन ब्राउज़र (browser_*) जोड़ते हैं।

कौन सा पर्यावरण चर Scrapeless कुंजी रखता है?

SCRAPELESS_KEY। यह प्रलेखित अपवाद है — Scrapeless CLI और SDK SCRAPELESS_API_KEY को पढ़ते हैं, लेकिन MCP सर्वर SCRAPELESS_KEY को पढ़ता है। Qwen कोड इसे आपके वातावरण से env ऑब्जेक्ट के भीतर $SCRAPELESS_KEY के माध्यम से बढ़ा सकता है।

Qwen कोड MCP कॉन्फ़िगरेशन कहाँ से पढ़ता है?

उपयोगकर्ता स्कोप के लिए ~/.qwen/settings.json से, या परियोजना रूट में .qwen/settings.json से परियोजना स्कोप के लिए। दोनों mcpServers ऑब्जेक्ट का उपयोग करते हैं। आप qwen mcp add के साथ एक सर्वर भी जोड़ सकते हैं और qwen mcp list के साथ कनेक्शनों का निरीक्षण कर सकते हैं।

stdio बनाम HTTP स्ट्रीम करने योग्य — आपको कब प्रत्येक का उपयोग करना चाहिए?

जब सर्वर CLI के साथ स्थानीय रूप से चलता है तो stdio का उपयोग करें: Qwen कोड scrapeless-mcp-server को एक बच्चे के रूप में लॉन्च करता है और इसके साथ मानक इनपुट/आउटपुट के माध्यम से बात करता है। HTTP स्ट्रीम करने योग्य (जो https://api.scrapeless.com/mcp पर httpUrl कुंजी को पॉइंट करता है और x-api-token हेडर के साथ) तब उपयोग करें जब एजेंट होस्टेड या दूरस्थ हो और स्थानीय प्रक्रिया को शुरू नहीं कर सकता।

क्या proxyCountry हमेशा लागू होता है?

ज़रूरी नहीं। proxyCountry एक प्राथमिकता है जो आपके खाते पर कॉन्फ़िगर की गई क्षेत्र पर निर्भर कर सकती है। यदि भू-लक्ष्यण महत्वपूर्ण है, तो प्रति-कॉल मान को हमेशा जीतने का अनुमान लगाए बिना, आउटबाउंड क्षेत्र की पुष्टि करें।

क्या एजेंट के माध्यम से वेब स्क्रैपिंग वैध है?

सार्वजनिक रूप से उपलब्ध डेटा को स्क्रैप करना सामान्यतः अनुमति है, लेकिन आप इसकी उपयोगिता के लिए जिम्मेदार हैं। प्रत्येक साइट की सेवा की शर्तों की समीक्षा करें और robots.txt का सम्मान करें, और याद रखें कि व्यक्तिगत डेटा और पहुंच के आस-पास के नियम न्याय क्षेत्र के आधार पर भिन्न होते हैं। जब संदेह में हों, तो अपने विशिष्ट उपयोग के मामले के लिए कानूनी सलाह प्राप्त करें।

क्या आप इसे बिना AI एजेंट के उपयोग कर सकते हैं?

हां। Scrapeless MCP सर्वर एक मानक MCP सर्वर है, इसलिए कोई भी MCP-संगत क्लाइंट इसे कॉल कर सकता है — या आप इसे JSON-RPC के माध्यम से सीधे चला सकते हैं (initialize, फिर tools/list और tools/call)। एजेंट एक सुविधा है, आवश्यकता नहीं।

स्क्रैपलेस में, हम केवल सार्वजनिक रूप से उपलब्ध डेटा का उपयोग करते हैं, जबकि लागू कानूनों, विनियमों और वेबसाइट गोपनीयता नीतियों का सख्ती से अनुपालन करते हैं। इस ब्लॉग में सामग्री केवल प्रदर्शन उद्देश्यों के लिए है और इसमें कोई अवैध या उल्लंघन करने वाली गतिविधियों को शामिल नहीं किया गया है। हम इस ब्लॉग या तृतीय-पक्ष लिंक से जानकारी के उपयोग के लिए सभी देयता को कोई गारंटी नहीं देते हैं और सभी देयता का खुलासा करते हैं। किसी भी स्क्रैपिंग गतिविधियों में संलग्न होने से पहले, अपने कानूनी सलाहकार से परामर्श करें और लक्ष्य वेबसाइट की सेवा की शर्तों की समीक्षा करें या आवश्यक अनुमतियाँ प्राप्त करें।

सबसे लोकप्रिय लेख

सूची