वापस ब्लॉग पर

सक्रैपलेस को क्लॉड से कनेक्ट करने का तरीका: MCP कनेक्टर सेटअप

Daniel Kim
Daniel Kim

Lead Scraping Automation Engineer

21-Sep-2026

TL;DR:

  • Claude में Scrapeless जोड़ने के लिए एक कॉन्फ़िगरेशन प्रविष्टि है: https://api.scrapeless.com/mcp पर आपका कुंजी के साथ एक रिमोट HTTP MCP सर्वर।
  • हैंडशेक scrapeless-mcp-server v0.2.0 को प्रोटोकॉल 2025-06-18 पर लौटाता है, और tools/list 25 उपकरणोंscrape_markdown, browser_* सेट, crawl_*, google_search, google_trends, और ai_scraper को लौटाता है।
  • स्कोप तय करता है कि यह कनेक्ट होता है या नहीं। उपयोगकर्ता स्कोप पर एक ही प्रविष्टि ✔ Connected रिपोर्ट करती है; एक परियोजना .mcp.json में यह ⏸ Pending approval रिपोर्ट करती है और जब तक आप इसे इंटरैक्टिव रूप से अनुमोदित नहीं करते तब तक कनेक्टेड नहीं रहती।
  • Scrapeless x-api-token पर प्रमाणीकृत करता है, Authorization: Bearer पर नहीं। एक बियरर हेडर को कनेक्ट समय पर विफलता होती है: Claude ✘ Failed to connect को HTTP 401 के साथ रिपोर्ट करता है।
  • कुंजी को --header के साथ पास करने से यह आपके शेल इतिहास और प्रक्रिया सूची में डाल देती है; सीधे कॉन्फ़िग फ़ाइल लिखना ऐसा नहीं करता।
  • एक Connected स्थिति केवल यह साबित करती है कि हेडर मौजूद है — Scrapeless हैंडशेक में किसी भी कुंजी मान को स्वीकार करता है और फिर भी सभी 25 उपकरणों की सूची बनाता है। एक वास्तविक उपकरण कॉल के साथ कुंजी को साबित करें जो पृष्ठ सामग्री लौटाता है।
  • Scrapeless मुफ्त योजना पर एक कुंजी प्राप्त करें और लगभग एक मिनट में कनेक्ट करें।

Claude किसी वेब पृष्ठ के बारे में विस्तार से तर्क कर सकता है और एक को लाने में असमर्थ है। एक MCP सर्वर यह बदलता है: मॉडल को ऐसे उपकरण मिलते हैं जिन्हें यह बातचीत के मध्य में बुला सकता है, इसलिए "देखें कि यह पृष्ठ अब क्या कहता है" एक अनुरोध नहीं रहता है जिसका उत्तर आप चिपकाकर देते हैं।

Claude को Scrapeless MCP सर्वर से रिमोट HTTP पर कनेक्ट करना एक कॉन्फ़िगरेशन प्रविष्टि लेता है। उन हिस्सों पर ध्यान देना महत्वपूर्ण है जिनके व्यवहार अलग होते हैं और एक कनेक्शन जो हरा रिपोर्ट करता है और वास्तव में काम करता है उसके बीच का अंतर।

What You Get Once It Is Connected

सर्वर 25 उपकरणों को उजागर करता है, जो लाइव संख्याबद्ध होते हैं न कि एक दस्तवेज़ से कॉपी किए गए:

Group Tools
Page content scrape_markdown, scrape_html, scrape_screenshot
Cloud browser browser_create, browser_goto, browser_click, browser_type, browser_get_text, browser_get_html, browser_snapshot, browser_screenshot, browser_scroll, browser_scroll_to, browser_wait, browser_wait_for, browser_press_key, browser_go_back, browser_go_forward, browser_close
Crawling crawl_start, crawl_result, crawl_cancel
Search google_search, google_trends
AI assistant answers ai_scraper

दो समूह विभिन्न कार्यों के लिए महत्वपूर्ण हैं। scrape_markdown एक कॉल में "यह पृष्ठ क्या कहता है" का उत्तर देता है। browser_* सेट एक सत्र है जिसे आप चरण दर चरण चलाते हैं, किसी भी क्लिक या फॉर्म के पीछे कुछ भी।

इनमें से प्रत्येक कॉल एक JSON-RPC अनुरोध के रूप में यात्रा करता है — MCP एक परिवहन और एक स्कीमा है JSON-RPC 2.0 स्पेसिफिकेशन पर, यही कारण है कि एक initialize / tools/list / tools/call अनुक्रम ही प्रोटोकॉल सतह के लिए होता है।

Prerequisites

  • Claude कोड स्थापित, या अन्य MCP क्लाइंट जो रिमोट HTTP सर्वरों का समर्थन करते हैं।
  • डैशबोर्ड से Scrapeless API कुंजी।
  • सर्वर के लिए कुछ स्थापित करने की आवश्यकता नहीं है। यह होस्टेड है, इसलिए कोई पैकेज, कोई रनटाइम नहीं, और कोई स्थानीय प्रक्रिया नहीं है।

यह अंतिम बिंदु दो परिवहन के बीच का अंतर है। एक stdio सर्वर एक स्थानीय कमांड है जो क्लाइंट लॉन्च करता है, जिसका अर्थ है कि इंस्टॉल करने और अपडेट रखने के लिए एक पैकेज है। एक रिमोट HTTP सर्वर एक URL है, और मॉडल संदर्भ प्रोटोकॉल स्पेसिफिकेशन दोनों को परिभाषित करता है; स्ट्रीमबल HTTP परिवहन वह है जिसे किसी स्थानीय प्रक्रिया की आवश्यकता नहीं होती है।

Step 1: Add the Server

The Claude Code MCP reference आदेश को एक पंक्ति के रूप में दस्तावेजित करता है:

bash Copy
claude mcp add --transport http scrapeless https://api.scrapeless.com/mcp \
  --header "x-api-token: YOUR_SCRAPELESS_API_KEY"

यह काम करता है, और इसका एक लागत है जिसे जानना आवश्यक है: --header के बाद सब कुछ आपके शेल इतिहास में आ जाता है और प्रक्रिया सूची में दिखता है जब आदेश चलता है। सीधे कॉन्फ़िग फ़ाइल लिखना दोनों से बचता है।

उपयोगकर्ता स्कोप के लिए, प्रविष्टि को ~/.claude.json में जोड़ें:

json Copy
{
  "mcpServers": {
    "scrapeless": {
      "type": "http",
      "url": "https://api.scrapeless.com/mcp",
      "headers": { "x-api-token": "YOUR_SCRAPELESS_API_KEY" }
    }
  }
}

हेडर नाम-note करें। Scrapeless x-api-token पर प्रमाणीकृत करता है, और अधिकांश MCP सेटअप गाइड Authorization: Bearer दिखाते हैं क्योंकि यही HTTP प्रमाणीकरण ढांचे के लिए बियरर क्रेडेंशियल्स परिभाषित करता है। इस आकार को यहां कॉपी करना हैंडशेक पूरा होने से पहले विफल रहता है: claude mcp list ✘ Failed to connect — Server rejected the configured Authorization header (HTTP 401) को रिपोर्ट करता है, जिसमें विवरण Unauthorized: Missing x-api-token header होता है।

Step 2: Understand Which Scope You Used

Claude MCP कॉन्फ़िग को एक से अधिक स्थानों से पढ़ता है, और दोनों अलग तरीके से व्यवहार करते हैं जो एक भ्रमित करने वाली पहली रन उत्पन्न करते हैं।

उपयोगकर्ता स्कोप पर, सर्वर तुरंत लाइव है:

text Copy
scrapeless:
  Scope: User config (available in all your projects)
  Status: ✔ Connected
  Type: http
  URL: https://api.scrapeless.com/mcp

एक परियोजना .mcp.json में समान प्रविष्टि कनेक्ट नहीं करती है:

text Copy
scrapeless:
  Scope: Project config (shared via .mcp.json)
  Status: ⏸ Pending approval (run `claude` to approve)
  Type: http
  URL: https://api.scrapeless.com/mcp

एक प्रोजेक्ट-स्कोप्ड फाइल उन सभी के साथ साझा की जाती है जो रिपोजिटरी को चेक आउट करते हैं, इसलिए यह एक इंटरैक्टिव स्वीकृति के पीछे गेटेड है इससे पहले कि क्लाईंट इसके साथ बात करे। यही सही डिफ़ॉल्ट है — एक कॉन्फ़िग फाइल एक रिपोजिटरी में आपके क्लाइंट को किसी भी चीज़ पर इंगित कर सकती है — लेकिन इसका मतलब है कि एक प्रोजेक्ट एंट्री टूटी हुई दिखती है जब तक कोई सत्र नहीं खोलता और इसे मंज़ूरी नहीं देता।

एक कुंजी के लिए उपयोगकर्ता स्कोप का उपयोग करें जो आपका हो। जब पूरी टीम को सर्वर मिलना चाहिए, तो प्रोजेक्ट स्कोप का उपयोग करें, और उम्मीद करें कि प्रत्येक व्यक्ति एक बार इसे मंज़ूर करे।

चरण 3: इसकी वास्तव में काम करने की पुष्टि करें

✔ Connected का अर्थ है कि हैंडशेक सफल हुआ। इसका अर्थ यह नहीं है कि एक कॉल होगी।

टूल लिस्टिंग का उत्तर खुद MCP सर्वर द्वारा दिया जाता है और कभी भी अपस्ट्रीम API तक नहीं पहुँचता, इसलिए एक सर्वर एक पूर्ण, स्वस्थ टूलसेट का विज्ञापन कर सकता है जबकि हर असली कॉल एक साख पर विफल होता है। यह काल्पनिक नहीं है: इस समान एपीआई एंडपॉइंट को एक पुरानी संग्रहीत टोकन के साथ एक पूर्ण टूलसेट सूचीबद्ध करने के लिए एक गेटवे का सामना करना पड़ा और पहले असली कॉल पर एक अवैध-टोकन त्रुटि लौटाई, जबकि अच्छे कुंजी के साथ उसी एंडपॉइंट ने HTTP 200 लौटाया।

तो एक कॉल के साथ सत्यापित करें, न कि एक बैज के साथ। क्लॉड सत्र के अंदर, /mcp जुड़े सर्वरों और उनके टूलों की सूची देता है; किसी पृष्ठ के लिए पूछने से अंत से अंत तक पथ का अभ्यास होता है:

text Copy
Use scrapeless to fetch https://books.toscrape.com/catalogue/category/books/mystery_3/index.html
as markdown and list the first five book titles with their prices.

एंडपॉइंट के खिलाफ सीधे कैप्चर किया गया मूलभूत कॉल और इसका परिणाम:

text Copy
initialize   HTTP 200   server=scrapeless-mcp-server v0.2.0
tools/list   HTTP 200   25 tools
tools/call scrape_markdown  HTTP 200  8940 chars of page content

परिणाम में पृष्ठ सामग्री वह पुष्टि है जो रखने लायक है। गलत कुंजी के साथ वही कॉल अभी भी HTTP 200 देता है और कोई isError ध्वज नहीं है; परिणाम पाठ Failed to fetch data से शुरू होता है।

क्या वापस आता है

scrape_markdown कंटेंट ब्लॉक में पृष्ठ को Markdown के रूप में लौटाता है, जो आकार एक मॉडल वास्तव में उपयोग कर सकता है:

text Copy
Response:  "-   [Home](https://books.toscrape.com/index.html)
-   [Books](https://books.toscrape.com/catalogue/category/books_1/index.html)
...

Markdown का उपयोग HTML के बजाय जानबूझकर है। MCP टूल्स के माध्यम से, वही पृष्ठ scrape_markdown से 8,940 वर्ण हैं जबकि scrape_html से 53,800 हैं, इसलिए HTML के लिए पूछने से संदर्भ पर लगभग छह गुना खर्च होता है जो मॉडल को इसकी आवश्यकता नहीं है। जब आप इसे स्वयं पार्स करने वाले हैं तो scrape_html के लिए पहुँचें, और जब मॉडल उपभोक्ता हो तो scrape_markdown के लिए।

क्या आप अभी एक कनेक्टर सेटअप के जरिए काम कर रहे हैं? Scrapeless मुफ्त योजना में हैंडशेक और पहले कुछ टूल कॉल्स करने के लिए पर्याप्त कॉल्स शामिल हैं।

सामने एक राउटर Claude क्या देखता है

यदि आपका क्लाईंट एक गेटवे की ओर इशारा करता है जो एक URL के पीछे कई MCP सर्वरों को रूट करता है न कि सीधे एंडपॉइंट पर, तो टूल सूची का आकार बदल जाता है। स्मार्ट-रूटिंग गेटवे पर इशारा किए जाने पर, वही क्लाईंट 3 टूल ढूँढता है — राउटर के अपने खोज-बैंक और वितरण मेटा-टूल। https://api.scrapeless.com/mcp की ओर इशारा करने पर, उसने सभी 25 खोजे।

कोई भी गलत नहीं है। एक राउटर एक साख और कई प्रदाताओं के बीच एक ऑडिट ट्रेल बनाए रखता है, इसके लागत पर कि मॉडल टूल नामों को एक परिसमापन दूर देखता है। सीधे कनेक्ट करने से मॉडल को असली टूल सतह मिलती है। सेटअप के अनुसार चुनें, और खोजे गए गणना की जाँच करें ताकि आप जान सकें कि आपने कौन सा प्राप्त किया।

इसे अच्छी तरह से प्रेरित करना

दो आदतें एक जुड़े हुए सर्वर और एक उपयोगी के बीच का अंतर बनाती हैं।

जब काम स्पष्ट हो तो उपकरण का नाम लें। "इस URL पर scrape_markdown का उपयोग करें" मॉडल को यह तय करने से बचाता है कि कैसे लाना है। मल्टी-स्टेप कार्य के लिए — लॉग इन करें, फ़िल्टर करें, परिणाम पढ़ें — इसके बजाय अनुक्रम का वर्णन करें, क्योंकि browser_* टूल एक सत्र साझा करते हैं और क्रम महत्वपूर्ण है।

आपको जो आकार चाहिए उसके लिए पूछें। 8,940 वर्णों के Markdown का मॉडल संक्षेप में आएगा जब तक आप इसे शीर्षक और कीमतों के एक तालिका लौटाने के लिए नहीं कहते। टूल एक दस्तावेज़ लौटाता है; उपयोगी आउटपुट वह है जो आपने मॉडल से इसे बनाने के लिए कहा।

व्यापक MCP चित्र के लिए, हमारा MCP एकीकरण गाइड प्रोटोकॉल और क्लाईंट परिदृश्य को कवर करता है, और सक्रैपिंग API पृष्ठ उन अभिनेता परिवार का वर्णन करता है जिनके सामने ये उपकरण हैं। दस्तावेज़ प्रति-ऐक्टर संदर्भ लाते हैं, और मूल्य निर्धारण यह सूचीबद्ध करता है कि एक कॉल की लागत क्या है।

निष्कर्ष

पूरा कनेक्टर एक URL, एक हेडर नाम, और एक स्कोप निर्णय है। https://api.scrapeless.com/mcp के साथ x-api-token उपयोगकर्ता स्कोप पर ✔ Connected की रिपोर्ट करता है और क्लॉड को 25 टूल देता है; प्रोजेक्ट फ़ाइल में वही एंट्री एक स्वीकृति की प्रतीक्षा करती है जो टूटे हुए सेटअप के रूप में गलतफहमी करना आसान है।
दो बातें हैं जो सेटअप से आगे ले जाने लायक हैं। हेडर x-api-token है, Bearer नहीं — Bearer आकार को कनेक्ट समय पर 401 के साथ अस्वीकार किया जाता है, इसलिए claude mcp list इसे सीधे विफल होता हुआ दिखाता है। और एक हरा स्टेटस एक हैंडशेक है: एक tools/call जो वास्तविक पृष्ठ सामग्री लौटाता है, इसके पीछे क्रेडेंशियल अच्छा होने का एकमात्र प्रमाण है।

क्या Claude को बुलाने के लिए तैयार हैं? Scrapeless मुफ्त योजना के साथ शुरुआत करें और सर्वर जोड़ें।

FAQ

Q: मैं Claude में Scrapeless MCP सर्वर को कैसे जोड़ूँ?

एक दूरस्थ HTTP प्रविष्टि https://api.scrapeless.com/mcp की ओर लक्षित करके अपने की के साथ एक x-api-token हेडर पर जोड़ें। या तो claude mcp add --transport http scrapeless https://api.scrapeless.com/mcp --header "x-api-token: ..." चलाएं, या अपने कॉन्फ़िग फ़ाइल में वही type/url/headers ऑब्जेक्ट लिखें — जिससे की शेल इतिहास से बाहर रहती है।

Q: मेरा MCP सर्वर लंबित स्वीकृति के रूप में क्यों दिखाता है?

क्योंकि यह आपके उपयोगकर्ता कॉन्फ़िग में नहीं बल्कि एक प्रोजेक्ट .mcp.json में परिभाषित है। एक प्रोजेक्ट फ़ाइल संग्रह के साथ यात्रा करती है, इसलिए क्लाइंट को इससे कनेक्ट करने से पहले इंटरएक्टिव स्वीकृति की आवश्यकता होती है। उपयोगकर्ता दायरे में वही प्रविष्टि तुरंत कनेक्ट होती है। एक सत्र खोलें और इसे स्वीकृत करें, या यदि की केवल आपकी है तो प्रविष्टि को उपयोगकर्ता दायरे में स्थानांतरित करें।

Q: क्या मुझे Authorization: Bearer या x-api-token का उपयोग करना चाहिए?

x-api-token। Scrapeless विशेष रूप से उस हेडर को पढ़ता है — इसके बिना एक अनुरोध 401 Unauthorized: Missing x-api-token header लौटाता है। Bearer-केवल प्रविष्टि को कनेक्ट समय पर उसी तरीके से अस्वीकार किया जाता है, इसलिए Claude ✘ Failed to connect दिखाता है न कि ✔ Connected

Q: मुझे कैसे पता चलेगा कि कनेक्शन वास्तव में काम कर रहा है?

एक उपकरण कॉल बनाएं। स्थिति आउटपुट आपको बताती है कि हैंडशेक सफल रहा, और उपकरण सूचियाँ MCP सर्वर द्वारा बिना उपरोक्त API से संपर्क किए परोसी जाती हैं, इसलिए दोनों एक अस्वीकृत क्रेडेंशियल के सामने स्वस्थ दिख सकते हैं। एक tools/call जो वास्तविक पृष्ठ सामग्री लौटाता है प्रमाण है; एक गलत की एक परिणाम उत्पन्न करता है जो Failed to fetch data से शुरू होता है, फिर भी बिना isError ध्वज के।

Q: stdio और HTTP परिवहन के बीच क्या अंतर है?

एक stdio सर्वर एक स्थानीय प्रक्रिया है जिसे क्लाइंट लॉन्च करता है, इसलिए इसे स्थापित और अद्यतित रखने की आवश्यकता होती है। Scrapeless MCP सर्वर होस्टेड है, इसलिए HTTP परिवहन को केवल एक URL और एक हेडर की आवश्यकता होती है — कोई स्थापना नहीं, कोई स्थानीय रनटाइम नहीं, और आपकी मशीन पर ट्रैक करने के लिए कोई संस्करण नहीं।

Q: मुझे कितने उपकरणों की उम्मीद करनी चाहिए?

सिधा अंत बिंदु से 25। यदि आप 3 देखते हैं, तो आपका क्लाइंट एक रूटिंग गेटवे की ओर लक्षित है न कि अंत बिंदु की, और उन तीन में से वे राउटर के अपने डिस्पैच उपकरण हैं। यदि आप एक सूची देखते हैं जिसमें मानचित्र, नौकरियाँ, होटल या उड़ानें नामित हैं, तो यह एक पुराना उपकरण सेट है — ताजा tools/list के खिलाफ गिनती की जांच करें।

Q: क्या यह Claude डेस्कटॉप के साथ-साथ Claude कोड में भी काम करता है?

दोनों MCP का समर्थन करते हैं, लेकिन वे विभिन्न कॉन्फ़िग फ़ाइलें पढ़ते हैं, और डेस्कटॉप का सेटअप आमतौर पर एक स्थानीय stdio आदेश के साथ URL के बजाय दिखाया जाता है। ऊपर दी गई दूरस्थ HTTP प्रविष्टि Claude कोड आकार है; डेस्कटॉप वाकथ्रू के लिए, Scrapeless MCP सर्वर को Claude पर चलाने के बारे में हमारी पिछली पोस्ट देखें, और ध्यान दें कि इसके उपकरणों की सूची वर्तमान 25 से पहले की है।

Q: क्या मैं सीमित कर सकता हूँ कि मॉडल कौन से उपकरणों को कॉल कर सकता है?

हाँ — यह एक क्लाइंट-साइड अनुमति की चिंता है न कि एक सर्वर सेटिंग। Claude कोड उपकरणों के लिए अनुमति और अस्वीकृति नियम प्रदर्शित करता है, इसलिए एक सेटअप जो केवल पृष्ठ सामग्री की आवश्यकता होती है वह scrape_markdown की अनुमति दे सकता है और ब्राउज़र सत्र उपकरणों को अनुपलब्ध छोड़ सकता है। इसे उस परिष्करण तक संकुचित करें जिसकी आवश्यकता है।

स्क्रैपलेस में, हम केवल सार्वजनिक रूप से उपलब्ध डेटा का उपयोग करते हैं, जबकि लागू कानूनों, विनियमों और वेबसाइट गोपनीयता नीतियों का सख्ती से अनुपालन करते हैं। इस ब्लॉग में सामग्री केवल प्रदर्शन उद्देश्यों के लिए है और इसमें कोई अवैध या उल्लंघन करने वाली गतिविधियों को शामिल नहीं किया गया है। हम इस ब्लॉग या तृतीय-पक्ष लिंक से जानकारी के उपयोग के लिए सभी देयता को कोई गारंटी नहीं देते हैं और सभी देयता का खुलासा करते हैं। किसी भी स्क्रैपिंग गतिविधियों में संलग्न होने से पहले, अपने कानूनी सलाहकार से परामर्श करें और लक्ष्य वेबसाइट की सेवा की शर्तों की समीक्षा करें या आवश्यक अनुमतियाँ प्राप्त करें।

सबसे लोकप्रिय लेख

सूची