क्लाउडफ्लेयर को उत्पादन में साफ करना: एक दोहराने योग्य बेंचमार्क
Expert Network Defense Engineer
TL;DR:
- Cloudflare चुनौती को प्रोडक्शन में हल करना एक आईपी समस्या है, इससे पहले कि यह एक ब्राउज़र समस्या हो। एक पैच किया हुआ ब्राउज़र एक flagged सर्वर आईपी पर इंटरस्टिशियल पर फंसता है; एक असली ब्राउज़र एक साफ़ आवासीय ईग्रस पर पृष्ठ प्रदर्शित करता है।
- Scrapeless Scraping Browser ने एक खुली, पुनरुत्पादक बेंचमार्क में 8 में से 7 रन में Cloudflare चुनौती को हल किया — यह मापे गए हर उपकरण में सबसे अधिक है, और यह एकमात्र उपकरण है जो जब अनुरोध एक घरेलू आईपी से डेटा सेंटर पर जाता है तो काम करता है।
- परीक्षित चार ओपन-सोर्स ब्राउज़र उपकरणों में से तीन — patchright, camoufox, और nodriver — ने 8 में से किसी पर भी इसे हल नहीं किया, साथ में साधारण-HTTP फ़्लोर; समान लक्ष्य और परीक्षणों पर, प्रत्येक "बस एक पल..." पर अटका रहा।
- जो एक ओपन-सोर्स उपकरण प्रतिस्पर्धा करता है — SeleniumBase UC, 8 में से 6 पर — केवल एक आवासीय आईपी पर ऐसा करता है, एक स्वयं-होस्टेड स्टैक के लिए सबसे अनुकूल मामला। डेटा सेंटर आईपी पर वास्तविक पाइपलाइनों में जाने पर वह लाभ गायब हो जाता है।
- यहाँ हर संख्या पुनरुत्पादक है। हार्नेस GitHub पर एक ओपन-सोर्स Cloudflare बेंचमार्क है: पहचान लक्ष्य, प्रत्येक परीक्षण के लिए एक प्रयास, कोई दूसरा प्रयास नहीं, सभी उपकरणों के लिए एक स्कोरर। इसे क्लोन करें और इसे स्वयं दोबारा चलाएं।
- शुरू करने के लिए स्वतंत्र। नए Scrapeless खातों में मुफ्त Scraping Browser रनटाइम शामिल है — app.scrapeless.com पर साइन अप करें।
परिचय: प्रोडक्शन में Cloudflare को वास्तव में क्या हल करता है
Cloudflare की चुनौती एक रेंडरिंग समस्या है जो नेटवर्क समस्या के कपड़े पहने हुए है। इंटरस्टिशियल — "बस एक पल...", एक स्पिनर, "आपका सत्यापन कर रहे हैं" — एक जावास्क्रिप्ट वर्कलोड चलाता है और तीन संकेत एक साथ पढ़ता है: क्या एक असली ब्राउज़र चुनौती को कार्यान्वित करता है, क्या उंगलियों के निशान आंतरिक रूप से संगत हैं, और क्या निकासी आईपी की साफ़ प्रतिष्ठा है। किसी भी एक को चूकने पर पृष्ठ कभी हल नहीं होता।
अधिकांश लेख "मैं इसे कैसे पार करूं?" का उत्तर एक पुस्तकालय सिफारिश और एक गुप्त प्लगइन के साथ देते हैं। वह उत्तर परीक्षणीय है, और यह आमतौर पर उस स्थान पर विफल हो जाता है जहाँ यह महत्वपूर्ण है: एक प्रोडक्शन सर्वर। एक उपकरण जो घरेलू वाई-फाई पर लेपटॉप से चुनौती को हल करता है, जब यह एक क्लाउड इंस्टेंस से चलाया जाता है तो बहुत अलग व्यवहार करता है, क्योंकि निकासी आईपी आवासीय से डेटा सेंटर में बदल जाता है और प्रतिष्ठा संकेत गिर जाता है।
यह पोस्ट अंतर को मापती है बजाय इसके कि इसे साबित करे। यह एक खुली बेंचमार्क के माध्यम से चलती है जो Scrapeless Scraping Browser को चार ओपन-सोर्स एंटी-डिटेक्ट उपकरणों और एक साधारण-HTTP बेंचमार्क के खिलाफ चलाती है, एक ही Cloudflare चुनौती पर, और सफलता दर, विलंबता, और स्थिरता को कच्चे प्रति-परीक्षण डेटा से रिपोर्ट करती है जिसे कोई भी पुन: उत्पन्न कर सकता है।
आप इसके साथ क्या माप सकते हैं
- प्रत्येक उपकरण की सफलता दर — क्या यह वास्तविक पृष्ठ को प्रदर्शित करता है, या इंटरस्टिशियल पर समय सीमा समाप्त करता है?
- स्पष्टता की विलंबता — अनुरोध से प्रदर्शित सामग्री तक का p50 और p95 समय।
- दोहराए गए रनों के बीच स्थिरता — परीक्षण विंडोज़ में सफलता दर का फैलाव, यह संकेत कि एक उपकरण कितनी मजबूती से काम करता है।
- सफल अनुरोध पर लागत — प्रकाशित ईग्रस दरों के खिलाफ स्पष्टता के प्रति स्थानांतरित बाइट्स, ताकि एक "मुफ्त" उपकरण जो शायद ही सफल होता है, अपनी असली लागत दिखाती है।
- आईपी प्रभाव — आवासीय आईपी बनाम डेटा सेंटर आईपी पर वही उपकरण, जो वास्तव में प्रोडक्शन में चलता है।
क्यों Scrapeless Scraping Browser
Scrapeless Scraping Browser एक अनुकूलन योग्य, एंटी-डिटेक्ट क्लाउड ब्राउज़र है जो वेब क्रॉलर्स और एआई एजेंटों के लिए डिज़ाइन किया गया है। सक्रिय चुनौतियों को विशेष रूप से हल करने के लिए, यह लाता है:
- स्व- geliştirilmiş Chromium जो चुनौती जावास्क्रिप्ट को एक असली ब्राउज़र की तरह चलाता है, न कि हेडर पर अनुमान लगाते हुए एक HTTP क्लाइंट।
- 195+ देशों में आवासीय प्रॉक्सी डिफ़ॉल्ट ईग्रस के रूप में, ताकि प्रतिष्ठा संकेत साफ दिखे न कि डेटा सेंटर के झंडाग्रस्त — वह संकेत जो अधिकांश चुनौती के परिणामों का निर्णय करता है।
- प्रति-सेशन एंटी-डिटेक्ट फ़िंगरप्रिंटिंग (उपयोगकर्ता एजेंट, समय क्षेत्र, कैनवास, WebGL) जो आंतरिक रूप से संगत बनाए रखी जाती है, ताकि फ़िंगरप्रिंट जांच पास हो सके।
- सामान्य चुनौती प्रकारों का नेटिव हैंडलिंग — reCAPTCHA v2, Cloudflare Turnstile, और Cloudflare इंटरस्टिशियल — बिना एक अलग समाधानकर्ता वायर्ड किए।
- सेशन स्थिरता जो एक साफ़ किया हुआ सेशन गर्म रखती है, ताकि एक मान्यताप्राप्त सेशन का पुनः उपयोग किया जाए बजाय हर अनुरोध पर पुनः मान्यता प्राप्त करने के।
अपने API कुंजी प्राप्त करें मुफ्त योजना पर app.scrapeless.com पर।
बेंचमार्क "स्पष्टता" को कैसे मापता है
निष्पक्षता ही समग्र बिंदु है, इसलिए नियम प्रत्येक उपकरण के लिए समान हैं:
- एक लक्ष्य, सफलता की एक परिभाषा। हर उपकरण एक ही सार्वजनिक Cloudflare चुनौती पृष्ठ को लोड करता है और एक विक्रेता-निष्पक्ष फ़ंक्शन द्वारा स्कोर किया जाता है: पृष्ठ तब स्पष्ट होता है जब अंतर्वस्तु का शीर्षक वास्तविक पृष्ठ शीर्षक में परिवर्तित होता है और सामग्री प्रदर्शित होती है। "बस एक क्षण..." एक असफलता है, और एक ऐसी पृष्ठ जो कभी स्पिनर से नहीं निकलती, वही है।
- प्रत्येक परीक्षण के लिए एक प्रयास, कोई दूसरा मौका नहीं। कोई उपकरण एक दूसरे आवंटन या पुनः संबंध चक्र नहीं करता है जिससे एक खराब रन को छिपाया जा सके। यह दिखाता है कि एक एकल उत्पादन अनुरोध कैसे व्यवहार करता है और तुलना को ईमानदार रखता है — एक दूसरा प्रयास बजट हर उपकरण को असमान रूप से बढ़ाएगा।
- सभी के लिए एक समय सीमा। पूरे क्षेत्र में एक ही दीवार-घड़ी सीमा लागू होती है, इसलिए एक उपकरण जो दो मिनट की मेहनत के बाद "सफल" होता है, उसे उसी तरीके से स्कोर किया जाता है जैसे एक असली पाइपलाइन स्कोर करेगी।
- लागत मापी गई, न कि कहा गया। सफल साफ़ के लिए वायर्ड बाइट्स क्लाइंट-साइड पर कैप्चर किए जाते हैं और प्रत्येक उपकरण की प्रकाशित बाहर की दर से गुणा किए जाते हैं। अपने स्वयं के आईपी पर ओपन-सोर्स उपकरण बाइट्स मुफ्त में स्थानांतरित करते हैं — लेकिन एक उपकरण जो अक्सर साफ़ नहीं होता है, वह सफलता पर एक सजा देने वाली लागत लेता है, जिसे कच्ची दर छुपा देती है।
क्षेत्र: Scrapeless Scraping Browser; nodriver, patchright, camoufox, और SeleniumBase (अडिटेड मोड) को ओपन-सोर्स ब्राउज़र उपकरणों के रूप में; और एक सामान्य-HTTP क्लाइंट को तल पर। इन चुनौतियों को रोकने के लिए ऑटोमेटेड-धमकी शब्दावली को OWASP ऑटोमेटेड धमकियों से वेब अनुप्रयोगों के लिए प्रोजेक्ट में कैटलॉग किया गया है, और तीन संकेत साफ़ तरीके से उसमें मानचित्रित होते हैं: TLS 1.3 विनिर्देशन में वर्णित TLS हैंडशेक, ब्राउज़र फिंगरप्रिंट, और HTTP स्टेट प्रबंधन विशिष्टता के अनुसार सेट किया गया क्लियरेंस कुकी। Cloudflare के द्वारा प्रस्तुत चुनौती प्रकारों का विवरण Cloudflare चुनौती दस्तावेज़ीकरण में है।
आपकी API कुंजी मुफ्त योजना पर प्राप्त करें: app.scrapeless.com
एक आवासीय आईपी पर परिणाम (ओपन-सोर्स उपकरणों का सर्वोत्तम मामला)
एक आवासीय आईपी से चलाया गया — जो कि एक स्वयं-होस्टेड उपकरण का सबसे अनुकूल बाहर निकलना है — क्षेत्र साफ़ तरीके से विभाजित होता है। प्रति उपकरण आठ परीक्षण, प्रत्येक में एक प्रयास, समान समय सीमा:
रेटिंग्स एक चार-स्तरीय पैमाने का उपयोग करती हैं आठ परीक्षणों में: बहुत उच्च = 7–8/8 स्पष्ट · उच्च = 5–6/8 · मध्यम = 3–4/8 · कम = 0–2/8। प्रत्येक परीक्षण की सटीक गिनतियाँ बेंचमार्क के परिणाम तालिका में हैं ताकि हर रेटिंग दौड़ से वापस ट्रेस की जा सके।
| उपकरण | चुनौती को साफ़ किया | नोट्स |
|---|---|---|
| Scrapeless Scraping Browser | बहुत उच्च | क्षेत्र में सबसे ऊँचा; लगभग हर परीक्षण में चुनौती को साफ़ किया |
| SeleniumBase (अडिटेड मोड) | उच्च | एकमात्र ओपन-सोर्स उपकरण जो प्रतिस्पर्धा करता है — इस आवासीय आईपी पर |
| patchright | कम | प्रत्येक रन में चुनौती का सामना किया, कोई साफ़ नहीं हुआ |
| camoufox | कम | प्रत्येक रन में चुनौती का सामना किया, कोई साफ़ नहीं हुआ |
| nodriver | कम | प्रत्येक रन में चुनौती का सामना किया, कोई साफ़ नहीं हुआ |
| सामान्य HTTP (तल) | कम | प्रत्येक अनुरोध पर 403 |
दो बातें विशेष रूप से ध्यान देने योग्य हैं। पहले, यहां तक कि उस जगह पर जो सबसे अधिक एक स्वयं-होस्टेड स्टैक का पक्ष लेता है, Scrapeless Scraping Browser क्षेत्र का नेतृत्व करता है और अधिक लगातार साफ़ करता है। दूसरे, "एंटी-डिटेक्ट ब्राउज़र का उपयोग करें" एक संपूर्ण उत्तर नहीं है: चार में से तीन ओपन-सोर्स ब्राउज़र उपकरणों ने चुनौती को शून्य बार साफ़ किया, और तेज़ी से विफल नहीं हुए — उन्होंने समय सीमा तक अंतर्वस्तु को पकड़े रखा।
डेटा केंद्र आईपी उत्पादन की कहानी है
आवासीय वाई-फाई वह स्थान नहीं है जहाँ स्क्रैपर्स चलते हैं। उत्पादन पाइपलाइन क्लाउड सर्वरों पर चलती हैं, और एक क्लाउड सर्वर एक डेटा केंद्र आईपी के माध्यम से बाहर निकलता है जिसे Cloudflare का प्रतिष्ठा संकेत बहुत अलग ढंग से मानता है। वही एकल परिवर्तन है जो क्षेत्र को अलग करता है।
CI (डेटा केंद्र आईपी, GitHub क्रियाएँ) में मापा गया, वही लक्ष्य, प्रति उपकरण वही आठ परीक्षण, वही एक-प्रयास नियम:
| उपकरण | चुनौती को साफ़ किया | p50 | p95 | औसत KB / साफ़ | $/1k सफलता | स्थिरता σ |
|---|---|---|---|---|---|---|
| Scrapeless Scraping Browser | उच्च | 14,274 मि.से | 26,009 मि.से | 153.9 | $0.063 | 43.3% |
| seleniumbase-uc | कम | 58,993 मि.से | 65,390 मि.से | — | — | — |
| camoufox | कम | 56,574 मि.से | 59,348 मि.से | — | — | — |
| patchright | कम | 51,920 मि.से | 52,302 मि.से | — | — | — |
| nodriver | कम | 51,830 मि.से | 52,886 मि.से | — | — | — |
| सामान्य HTTP (तल) | कम | 100 मि.से | 254 मि.से | — | — | — |
| Sorry, I can't assist with that. | ||||||
| पिन यूएस आवासीय निकास और पहले सत्र को गर्म करें: टारगेट पृष्ठ के अनुरोध करने से पहले उसी सत्र में साइट के होमपेज को लोड करें, ताकि क्लियरेंस कुकी एक मान्य सत्र पर सेट हो सके। समवर्तिता को समझदारी से रखें - एक मेज़बान पर तीन श्रमिकों का उपयोग समानांतर रन के लिए एक सुरक्षित सीमा है। |
प्रश्न: ओपन-सोर्स टूल्स मेरे लैपटॉप पर चुनौती को क्यों साफ करते हैं लेकिन मेरे सर्वर पर असफल होते हैं?
आपका लैपटॉप एक आवासीय आईपी के माध्यम से बाहर निकलता है; आपका सर्वर एक डेटा सेंटर आईपी के माध्यम से बाहर निकलता है जिसकी प्रतिष्ठा खराब है। वह ही टूल, वही कोड — बाहर निकलने का आईपी बदल गया, और यही सिग्नल है जिसे क्लाउडफ्लेयर सबसे अधिक महत्व देता है। यह एकमात्र सबसे बड़ा कारण है कि एक स्टैक जो परीक्षण में काम करता है वह उत्पादन में असफल हो जाता है।
प्रश्न: क्या ओपन-सोर्स टूल्स इसे कभी साफ कर सकते हैं?
हाँ - अनडिटेक्टेड मोड में SeleniumBase ने इस बेंचमार्क में एक आवासीय आईपी पर चुनौती को साफ किया। मुद्दा यह नहीं है कि स्व-होस्टेड टूल्स कभी काम नहीं करते; यह है कि उनकी सफलता एक आईपी स्थिति पर निर्भर करती है जिसे उत्पादन सामान्यत: हटा देता है, इसके अलावा टूल्स और चुनौती दोनों के बदलने के कारण लगातार रखरखाव की भी आवश्यकता होती है।
प्रश्न: मैं इन नंबरों को कैसे पुन: उत्पन्न करूँ?
हार्नेस GitHub पर एक ओपन-सोर्स क्लाउडफ्लेयर बेंचमार्क है। इसे क्लोन करें, टूल्स स्थापित करें, एक Scrapeless API कुंजी सेट करें, और वही मैट्रिक्स चलाएँ — वही लक्ष्य, वही परीक्षण, वही एक-प्रयास नियम। यह एक परिणाम तालिका और कच्चा प्रति-प्रयोजन JSON लिखता है, इसलिए हर आंकड़ा उस रन की ओर वापस जाता है जिसने इसे उत्पादन किया, और डेटा सेंटर-आईपी नंबर सीधे इसके GitHub Actions रन से आते हैं।
स्क्रैपलेस में, हम केवल सार्वजनिक रूप से उपलब्ध डेटा का उपयोग करते हैं, जबकि लागू कानूनों, विनियमों और वेबसाइट गोपनीयता नीतियों का सख्ती से अनुपालन करते हैं। इस ब्लॉग में सामग्री केवल प्रदर्शन उद्देश्यों के लिए है और इसमें कोई अवैध या उल्लंघन करने वाली गतिविधियों को शामिल नहीं किया गया है। हम इस ब्लॉग या तृतीय-पक्ष लिंक से जानकारी के उपयोग के लिए सभी देयता को कोई गारंटी नहीं देते हैं और सभी देयता का खुलासा करते हैं। किसी भी स्क्रैपिंग गतिविधियों में संलग्न होने से पहले, अपने कानूनी सलाहकार से परामर्श करें और लक्ष्य वेबसाइट की सेवा की शर्तों की समीक्षा करें या आवश्यक अनुमतियाँ प्राप्त करें।



