सक्रैपलेस को क्लॉड से कनेक्ट करने का तरीका: MCP कनेक्टर सेटअप
Lead Scraping Automation Engineer
TL;DR:
- Claude में Scrapeless जोड़ने के लिए एक कॉन्फ़िगरेशन प्रविष्टि है:
https://api.scrapeless.com/mcpपर आपका कुंजी के साथ एक रिमोट HTTP MCP सर्वर। - हैंडशेक
scrapeless-mcp-serverv0.2.0 को प्रोटोकॉल2025-06-18पर लौटाता है, औरtools/list25 उपकरणों —scrape_markdown,browser_*सेट,crawl_*,google_search,google_trends, औरai_scraperको लौटाता है। - स्कोप तय करता है कि यह कनेक्ट होता है या नहीं। उपयोगकर्ता स्कोप पर एक ही प्रविष्टि
✔ Connectedरिपोर्ट करती है; एक परियोजना.mcp.jsonमें यह⏸ Pending approvalरिपोर्ट करती है और जब तक आप इसे इंटरैक्टिव रूप से अनुमोदित नहीं करते तब तक कनेक्टेड नहीं रहती। - Scrapeless
x-api-tokenपर प्रमाणीकृत करता है,Authorization: Bearerपर नहीं। एक बियरर हेडर को कनेक्ट समय पर विफलता होती है: Claude✘ Failed to connectकोHTTP 401के साथ रिपोर्ट करता है। - कुंजी को
--headerके साथ पास करने से यह आपके शेल इतिहास और प्रक्रिया सूची में डाल देती है; सीधे कॉन्फ़िग फ़ाइल लिखना ऐसा नहीं करता। - एक
Connectedस्थिति केवल यह साबित करती है कि हेडर मौजूद है — Scrapeless हैंडशेक में किसी भी कुंजी मान को स्वीकार करता है और फिर भी सभी 25 उपकरणों की सूची बनाता है। एक वास्तविक उपकरण कॉल के साथ कुंजी को साबित करें जो पृष्ठ सामग्री लौटाता है। - Scrapeless मुफ्त योजना पर एक कुंजी प्राप्त करें और लगभग एक मिनट में कनेक्ट करें।
Claude किसी वेब पृष्ठ के बारे में विस्तार से तर्क कर सकता है और एक को लाने में असमर्थ है। एक MCP सर्वर यह बदलता है: मॉडल को ऐसे उपकरण मिलते हैं जिन्हें यह बातचीत के मध्य में बुला सकता है, इसलिए "देखें कि यह पृष्ठ अब क्या कहता है" एक अनुरोध नहीं रहता है जिसका उत्तर आप चिपकाकर देते हैं।
Claude को Scrapeless MCP सर्वर से रिमोट HTTP पर कनेक्ट करना एक कॉन्फ़िगरेशन प्रविष्टि लेता है। उन हिस्सों पर ध्यान देना महत्वपूर्ण है जिनके व्यवहार अलग होते हैं और एक कनेक्शन जो हरा रिपोर्ट करता है और वास्तव में काम करता है उसके बीच का अंतर।
What You Get Once It Is Connected
सर्वर 25 उपकरणों को उजागर करता है, जो लाइव संख्याबद्ध होते हैं न कि एक दस्तवेज़ से कॉपी किए गए:
| Group | Tools |
|---|---|
| Page content | scrape_markdown, scrape_html, scrape_screenshot |
| Cloud browser | browser_create, browser_goto, browser_click, browser_type, browser_get_text, browser_get_html, browser_snapshot, browser_screenshot, browser_scroll, browser_scroll_to, browser_wait, browser_wait_for, browser_press_key, browser_go_back, browser_go_forward, browser_close |
| Crawling | crawl_start, crawl_result, crawl_cancel |
| Search | google_search, google_trends |
| AI assistant answers | ai_scraper |
दो समूह विभिन्न कार्यों के लिए महत्वपूर्ण हैं। scrape_markdown एक कॉल में "यह पृष्ठ क्या कहता है" का उत्तर देता है। browser_* सेट एक सत्र है जिसे आप चरण दर चरण चलाते हैं, किसी भी क्लिक या फॉर्म के पीछे कुछ भी।
इनमें से प्रत्येक कॉल एक JSON-RPC अनुरोध के रूप में यात्रा करता है — MCP एक परिवहन और एक स्कीमा है JSON-RPC 2.0 स्पेसिफिकेशन पर, यही कारण है कि एक initialize / tools/list / tools/call अनुक्रम ही प्रोटोकॉल सतह के लिए होता है।
Prerequisites
- Claude कोड स्थापित, या अन्य MCP क्लाइंट जो रिमोट HTTP सर्वरों का समर्थन करते हैं।
- डैशबोर्ड से Scrapeless API कुंजी।
- सर्वर के लिए कुछ स्थापित करने की आवश्यकता नहीं है। यह होस्टेड है, इसलिए कोई पैकेज, कोई रनटाइम नहीं, और कोई स्थानीय प्रक्रिया नहीं है।
यह अंतिम बिंदु दो परिवहन के बीच का अंतर है। एक stdio सर्वर एक स्थानीय कमांड है जो क्लाइंट लॉन्च करता है, जिसका अर्थ है कि इंस्टॉल करने और अपडेट रखने के लिए एक पैकेज है। एक रिमोट HTTP सर्वर एक URL है, और मॉडल संदर्भ प्रोटोकॉल स्पेसिफिकेशन दोनों को परिभाषित करता है; स्ट्रीमबल HTTP परिवहन वह है जिसे किसी स्थानीय प्रक्रिया की आवश्यकता नहीं होती है।
Step 1: Add the Server
The Claude Code MCP reference आदेश को एक पंक्ति के रूप में दस्तावेजित करता है:
bash
claude mcp add --transport http scrapeless https://api.scrapeless.com/mcp \
--header "x-api-token: YOUR_SCRAPELESS_API_KEY"
यह काम करता है, और इसका एक लागत है जिसे जानना आवश्यक है: --header के बाद सब कुछ आपके शेल इतिहास में आ जाता है और प्रक्रिया सूची में दिखता है जब आदेश चलता है। सीधे कॉन्फ़िग फ़ाइल लिखना दोनों से बचता है।
उपयोगकर्ता स्कोप के लिए, प्रविष्टि को ~/.claude.json में जोड़ें:
json
{
"mcpServers": {
"scrapeless": {
"type": "http",
"url": "https://api.scrapeless.com/mcp",
"headers": { "x-api-token": "YOUR_SCRAPELESS_API_KEY" }
}
}
}
हेडर नाम-note करें। Scrapeless x-api-token पर प्रमाणीकृत करता है, और अधिकांश MCP सेटअप गाइड Authorization: Bearer दिखाते हैं क्योंकि यही HTTP प्रमाणीकरण ढांचे के लिए बियरर क्रेडेंशियल्स परिभाषित करता है। इस आकार को यहां कॉपी करना हैंडशेक पूरा होने से पहले विफल रहता है: claude mcp list ✘ Failed to connect — Server rejected the configured Authorization header (HTTP 401) को रिपोर्ट करता है, जिसमें विवरण Unauthorized: Missing x-api-token header होता है।
Step 2: Understand Which Scope You Used
Claude MCP कॉन्फ़िग को एक से अधिक स्थानों से पढ़ता है, और दोनों अलग तरीके से व्यवहार करते हैं जो एक भ्रमित करने वाली पहली रन उत्पन्न करते हैं।
उपयोगकर्ता स्कोप पर, सर्वर तुरंत लाइव है:
text
scrapeless:
Scope: User config (available in all your projects)
Status: ✔ Connected
Type: http
URL: https://api.scrapeless.com/mcp
एक परियोजना .mcp.json में समान प्रविष्टि कनेक्ट नहीं करती है:
text
scrapeless:
Scope: Project config (shared via .mcp.json)
Status: ⏸ Pending approval (run `claude` to approve)
Type: http
URL: https://api.scrapeless.com/mcp
एक प्रोजेक्ट-स्कोप्ड फाइल उन सभी के साथ साझा की जाती है जो रिपोजिटरी को चेक आउट करते हैं, इसलिए यह एक इंटरैक्टिव स्वीकृति के पीछे गेटेड है इससे पहले कि क्लाईंट इसके साथ बात करे। यही सही डिफ़ॉल्ट है — एक कॉन्फ़िग फाइल एक रिपोजिटरी में आपके क्लाइंट को किसी भी चीज़ पर इंगित कर सकती है — लेकिन इसका मतलब है कि एक प्रोजेक्ट एंट्री टूटी हुई दिखती है जब तक कोई सत्र नहीं खोलता और इसे मंज़ूरी नहीं देता।
एक कुंजी के लिए उपयोगकर्ता स्कोप का उपयोग करें जो आपका हो। जब पूरी टीम को सर्वर मिलना चाहिए, तो प्रोजेक्ट स्कोप का उपयोग करें, और उम्मीद करें कि प्रत्येक व्यक्ति एक बार इसे मंज़ूर करे।
चरण 3: इसकी वास्तव में काम करने की पुष्टि करें
✔ Connected का अर्थ है कि हैंडशेक सफल हुआ। इसका अर्थ यह नहीं है कि एक कॉल होगी।
टूल लिस्टिंग का उत्तर खुद MCP सर्वर द्वारा दिया जाता है और कभी भी अपस्ट्रीम API तक नहीं पहुँचता, इसलिए एक सर्वर एक पूर्ण, स्वस्थ टूलसेट का विज्ञापन कर सकता है जबकि हर असली कॉल एक साख पर विफल होता है। यह काल्पनिक नहीं है: इस समान एपीआई एंडपॉइंट को एक पुरानी संग्रहीत टोकन के साथ एक पूर्ण टूलसेट सूचीबद्ध करने के लिए एक गेटवे का सामना करना पड़ा और पहले असली कॉल पर एक अवैध-टोकन त्रुटि लौटाई, जबकि अच्छे कुंजी के साथ उसी एंडपॉइंट ने HTTP 200 लौटाया।
तो एक कॉल के साथ सत्यापित करें, न कि एक बैज के साथ। क्लॉड सत्र के अंदर, /mcp जुड़े सर्वरों और उनके टूलों की सूची देता है; किसी पृष्ठ के लिए पूछने से अंत से अंत तक पथ का अभ्यास होता है:
text
Use scrapeless to fetch https://books.toscrape.com/catalogue/category/books/mystery_3/index.html
as markdown and list the first five book titles with their prices.
एंडपॉइंट के खिलाफ सीधे कैप्चर किया गया मूलभूत कॉल और इसका परिणाम:
text
initialize HTTP 200 server=scrapeless-mcp-server v0.2.0
tools/list HTTP 200 25 tools
tools/call scrape_markdown HTTP 200 8940 chars of page content
परिणाम में पृष्ठ सामग्री वह पुष्टि है जो रखने लायक है। गलत कुंजी के साथ वही कॉल अभी भी HTTP 200 देता है और कोई isError ध्वज नहीं है; परिणाम पाठ Failed to fetch data से शुरू होता है।
क्या वापस आता है
scrape_markdown कंटेंट ब्लॉक में पृष्ठ को Markdown के रूप में लौटाता है, जो आकार एक मॉडल वास्तव में उपयोग कर सकता है:
text
Response: "- [Home](https://books.toscrape.com/index.html)
- [Books](https://books.toscrape.com/catalogue/category/books_1/index.html)
...
Markdown का उपयोग HTML के बजाय जानबूझकर है। MCP टूल्स के माध्यम से, वही पृष्ठ scrape_markdown से 8,940 वर्ण हैं जबकि scrape_html से 53,800 हैं, इसलिए HTML के लिए पूछने से संदर्भ पर लगभग छह गुना खर्च होता है जो मॉडल को इसकी आवश्यकता नहीं है। जब आप इसे स्वयं पार्स करने वाले हैं तो scrape_html के लिए पहुँचें, और जब मॉडल उपभोक्ता हो तो scrape_markdown के लिए।
क्या आप अभी एक कनेक्टर सेटअप के जरिए काम कर रहे हैं? Scrapeless मुफ्त योजना में हैंडशेक और पहले कुछ टूल कॉल्स करने के लिए पर्याप्त कॉल्स शामिल हैं।
सामने एक राउटर Claude क्या देखता है
यदि आपका क्लाईंट एक गेटवे की ओर इशारा करता है जो एक URL के पीछे कई MCP सर्वरों को रूट करता है न कि सीधे एंडपॉइंट पर, तो टूल सूची का आकार बदल जाता है। स्मार्ट-रूटिंग गेटवे पर इशारा किए जाने पर, वही क्लाईंट 3 टूल ढूँढता है — राउटर के अपने खोज-बैंक और वितरण मेटा-टूल। https://api.scrapeless.com/mcp की ओर इशारा करने पर, उसने सभी 25 खोजे।
कोई भी गलत नहीं है। एक राउटर एक साख और कई प्रदाताओं के बीच एक ऑडिट ट्रेल बनाए रखता है, इसके लागत पर कि मॉडल टूल नामों को एक परिसमापन दूर देखता है। सीधे कनेक्ट करने से मॉडल को असली टूल सतह मिलती है। सेटअप के अनुसार चुनें, और खोजे गए गणना की जाँच करें ताकि आप जान सकें कि आपने कौन सा प्राप्त किया।
इसे अच्छी तरह से प्रेरित करना
दो आदतें एक जुड़े हुए सर्वर और एक उपयोगी के बीच का अंतर बनाती हैं।
जब काम स्पष्ट हो तो उपकरण का नाम लें। "इस URL पर scrape_markdown का उपयोग करें" मॉडल को यह तय करने से बचाता है कि कैसे लाना है। मल्टी-स्टेप कार्य के लिए — लॉग इन करें, फ़िल्टर करें, परिणाम पढ़ें — इसके बजाय अनुक्रम का वर्णन करें, क्योंकि browser_* टूल एक सत्र साझा करते हैं और क्रम महत्वपूर्ण है।
आपको जो आकार चाहिए उसके लिए पूछें। 8,940 वर्णों के Markdown का मॉडल संक्षेप में आएगा जब तक आप इसे शीर्षक और कीमतों के एक तालिका लौटाने के लिए नहीं कहते। टूल एक दस्तावेज़ लौटाता है; उपयोगी आउटपुट वह है जो आपने मॉडल से इसे बनाने के लिए कहा।
व्यापक MCP चित्र के लिए, हमारा MCP एकीकरण गाइड प्रोटोकॉल और क्लाईंट परिदृश्य को कवर करता है, और सक्रैपिंग API पृष्ठ उन अभिनेता परिवार का वर्णन करता है जिनके सामने ये उपकरण हैं। दस्तावेज़ प्रति-ऐक्टर संदर्भ लाते हैं, और मूल्य निर्धारण यह सूचीबद्ध करता है कि एक कॉल की लागत क्या है।
निष्कर्ष
पूरा कनेक्टर एक URL, एक हेडर नाम, और एक स्कोप निर्णय है। https://api.scrapeless.com/mcp के साथ x-api-token उपयोगकर्ता स्कोप पर ✔ Connected की रिपोर्ट करता है और क्लॉड को 25 टूल देता है; प्रोजेक्ट फ़ाइल में वही एंट्री एक स्वीकृति की प्रतीक्षा करती है जो टूटे हुए सेटअप के रूप में गलतफहमी करना आसान है।
दो बातें हैं जो सेटअप से आगे ले जाने लायक हैं। हेडर x-api-token है, Bearer नहीं — Bearer आकार को कनेक्ट समय पर 401 के साथ अस्वीकार किया जाता है, इसलिए claude mcp list इसे सीधे विफल होता हुआ दिखाता है। और एक हरा स्टेटस एक हैंडशेक है: एक tools/call जो वास्तविक पृष्ठ सामग्री लौटाता है, इसके पीछे क्रेडेंशियल अच्छा होने का एकमात्र प्रमाण है।
क्या Claude को बुलाने के लिए तैयार हैं? Scrapeless मुफ्त योजना के साथ शुरुआत करें और सर्वर जोड़ें।
FAQ
Q: मैं Claude में Scrapeless MCP सर्वर को कैसे जोड़ूँ?
एक दूरस्थ HTTP प्रविष्टि https://api.scrapeless.com/mcp की ओर लक्षित करके अपने की के साथ एक x-api-token हेडर पर जोड़ें। या तो claude mcp add --transport http scrapeless https://api.scrapeless.com/mcp --header "x-api-token: ..." चलाएं, या अपने कॉन्फ़िग फ़ाइल में वही type/url/headers ऑब्जेक्ट लिखें — जिससे की शेल इतिहास से बाहर रहती है।
Q: मेरा MCP सर्वर लंबित स्वीकृति के रूप में क्यों दिखाता है?
क्योंकि यह आपके उपयोगकर्ता कॉन्फ़िग में नहीं बल्कि एक प्रोजेक्ट .mcp.json में परिभाषित है। एक प्रोजेक्ट फ़ाइल संग्रह के साथ यात्रा करती है, इसलिए क्लाइंट को इससे कनेक्ट करने से पहले इंटरएक्टिव स्वीकृति की आवश्यकता होती है। उपयोगकर्ता दायरे में वही प्रविष्टि तुरंत कनेक्ट होती है। एक सत्र खोलें और इसे स्वीकृत करें, या यदि की केवल आपकी है तो प्रविष्टि को उपयोगकर्ता दायरे में स्थानांतरित करें।
Q: क्या मुझे Authorization: Bearer या x-api-token का उपयोग करना चाहिए?
x-api-token। Scrapeless विशेष रूप से उस हेडर को पढ़ता है — इसके बिना एक अनुरोध 401 Unauthorized: Missing x-api-token header लौटाता है। Bearer-केवल प्रविष्टि को कनेक्ट समय पर उसी तरीके से अस्वीकार किया जाता है, इसलिए Claude ✘ Failed to connect दिखाता है न कि ✔ Connected।
Q: मुझे कैसे पता चलेगा कि कनेक्शन वास्तव में काम कर रहा है?
एक उपकरण कॉल बनाएं। स्थिति आउटपुट आपको बताती है कि हैंडशेक सफल रहा, और उपकरण सूचियाँ MCP सर्वर द्वारा बिना उपरोक्त API से संपर्क किए परोसी जाती हैं, इसलिए दोनों एक अस्वीकृत क्रेडेंशियल के सामने स्वस्थ दिख सकते हैं। एक tools/call जो वास्तविक पृष्ठ सामग्री लौटाता है प्रमाण है; एक गलत की एक परिणाम उत्पन्न करता है जो Failed to fetch data से शुरू होता है, फिर भी बिना isError ध्वज के।
Q: stdio और HTTP परिवहन के बीच क्या अंतर है?
एक stdio सर्वर एक स्थानीय प्रक्रिया है जिसे क्लाइंट लॉन्च करता है, इसलिए इसे स्थापित और अद्यतित रखने की आवश्यकता होती है। Scrapeless MCP सर्वर होस्टेड है, इसलिए HTTP परिवहन को केवल एक URL और एक हेडर की आवश्यकता होती है — कोई स्थापना नहीं, कोई स्थानीय रनटाइम नहीं, और आपकी मशीन पर ट्रैक करने के लिए कोई संस्करण नहीं।
Q: मुझे कितने उपकरणों की उम्मीद करनी चाहिए?
सिधा अंत बिंदु से 25। यदि आप 3 देखते हैं, तो आपका क्लाइंट एक रूटिंग गेटवे की ओर लक्षित है न कि अंत बिंदु की, और उन तीन में से वे राउटर के अपने डिस्पैच उपकरण हैं। यदि आप एक सूची देखते हैं जिसमें मानचित्र, नौकरियाँ, होटल या उड़ानें नामित हैं, तो यह एक पुराना उपकरण सेट है — ताजा tools/list के खिलाफ गिनती की जांच करें।
Q: क्या यह Claude डेस्कटॉप के साथ-साथ Claude कोड में भी काम करता है?
दोनों MCP का समर्थन करते हैं, लेकिन वे विभिन्न कॉन्फ़िग फ़ाइलें पढ़ते हैं, और डेस्कटॉप का सेटअप आमतौर पर एक स्थानीय stdio आदेश के साथ URL के बजाय दिखाया जाता है। ऊपर दी गई दूरस्थ HTTP प्रविष्टि Claude कोड आकार है; डेस्कटॉप वाकथ्रू के लिए, Scrapeless MCP सर्वर को Claude पर चलाने के बारे में हमारी पिछली पोस्ट देखें, और ध्यान दें कि इसके उपकरणों की सूची वर्तमान 25 से पहले की है।
Q: क्या मैं सीमित कर सकता हूँ कि मॉडल कौन से उपकरणों को कॉल कर सकता है?
हाँ — यह एक क्लाइंट-साइड अनुमति की चिंता है न कि एक सर्वर सेटिंग। Claude कोड उपकरणों के लिए अनुमति और अस्वीकृति नियम प्रदर्शित करता है, इसलिए एक सेटअप जो केवल पृष्ठ सामग्री की आवश्यकता होती है वह scrape_markdown की अनुमति दे सकता है और ब्राउज़र सत्र उपकरणों को अनुपलब्ध छोड़ सकता है। इसे उस परिष्करण तक संकुचित करें जिसकी आवश्यकता है।
स्क्रैपलेस में, हम केवल सार्वजनिक रूप से उपलब्ध डेटा का उपयोग करते हैं, जबकि लागू कानूनों, विनियमों और वेबसाइट गोपनीयता नीतियों का सख्ती से अनुपालन करते हैं। इस ब्लॉग में सामग्री केवल प्रदर्शन उद्देश्यों के लिए है और इसमें कोई अवैध या उल्लंघन करने वाली गतिविधियों को शामिल नहीं किया गया है। हम इस ब्लॉग या तृतीय-पक्ष लिंक से जानकारी के उपयोग के लिए सभी देयता को कोई गारंटी नहीं देते हैं और सभी देयता का खुलासा करते हैं। किसी भी स्क्रैपिंग गतिविधियों में संलग्न होने से पहले, अपने कानूनी सलाहकार से परामर्श करें और लक्ष्य वेबसाइट की सेवा की शर्तों की समीक्षा करें या आवश्यक अनुमतियाँ प्राप्त करें।



