🎯 Trình duyệt đám mây tùy chỉnh, chống phát hiện được hỗ trợ bởi Chromium tự phát triển, thiết kế dành cho trình thu thập dữ liệu webtác nhân AI. 👉Dùng thử ngay
Quay lại blog

Xóa Cloudflare trong Sản xuất: Một Tiêu chuẩn Có thể Tái tạo

Michael Lee
Michael Lee

Expert Network Defense Engineer

08-Jul-2026

Tóm tắt:

  • Giải quyết một thách thức Cloudflare trong môi trường sản xuất là vấn đề địa chỉ IP trước khi là vấn đề của trình duyệt. Một trình duyệt đã được vá trên một địa chỉ IP máy chủ bị đánh dấu bị đứng lại ở màn hình đệm; một trình duyệt thực sự trên địa chỉ IP dân cư sạch sẽ hiển thị trang.
  • Trình duyệt Scrapeless Scraping đã qua được thách thức Cloudflare trong 7 trên 8 lần chạy trong một thang đo công khai, tái sản xuất — cao nhất trong số tất cả các công cụ được đo, và là công cụ duy nhất có hiệu quả khi yêu cầu rời khỏi một địa chỉ IP gia đình đến một địa chỉ IP trung tâm dữ liệu.
  • Ba trong bốn công cụ trình duyệt mã nguồn mở được thử nghiệm — patchright, camoufox và nodriver — không vượt qua được trong 8 lần chạy, ở mức độ HTTP cơ bản; trên cùng một mục tiêu và các thử nghiệm, mỗi công cụ đều dừng lại ở "Chúng tôi sẽ quay lại ngay...".
  • Công cụ mã nguồn mở duy nhất cạnh tranh — SeleniumBase UC với 6 trên 8 — chỉ làm được như vậy trên một địa chỉ IP dân cư, là trường hợp thuận lợi nhất cho một bộ công cụ tự lưu trữ. Chuyển sang các địa chỉ IP trung tâm dữ liệu nơi các quy trình thực tế chạy và lợi thế đó sẽ biến mất.
  • Mọi con số ở đây đều có thể tái tạo. Hệ thống là một thang đo Cloudflare mã nguồn mở trên GitHub: các mục tiêu giống nhau, một lần thử mỗi lần thử, không có lần thử thứ hai, một người chấm điểm cho tất cả các công cụ. Sao chép nó và tự mình chạy lại.
  • Miễn phí bắt đầu. Tài khoản Scrapeless mới bao gồm thời gian chạy trình duyệt Scraping miễn phí — đăng ký tại app.scrapeless.com.

Giới thiệu: những gì thực sự giải quyết Cloudflare trong môi trường sản xuất

Thách thức của Cloudflare là một vấn đề hiển thị mang hình dáng của một vấn đề mạng. Màn hình đệm — "Chúng tôi sẽ quay lại ngay...", một vòng xoay, "Đang xác minh bạn là con người" — chạy một tải công việc JavaScript và đọc ba tín hiệu cùng lúc: liệu một trình duyệt thực sự có thực hiện thách thức, liệu dấu vân tay có nhất quán bên trong, và liệu địa chỉ IP thoát có một uy tín sạch. Bỏ qua bất kỳ một tín hiệu nào và trang sẽ không bao giờ được hiển thị.

Hầu hết các bài viết trả lời câu hỏi "làm thế nào để vượt qua điều này?" bằng cách giới thiệu một thư viện và một plugin ẩn. Câu trả lời đó có thể kiểm tra và thường thất bại ở chỗ quan trọng: một máy chủ sản xuất. Một công cụ vượt qua thách thức từ một máy tính xách tay trên Wi-Fi gia đình hoạt động rất khác khi chạy từ một phiên bản đám mây, bởi vì địa chỉ IP thoát chuyển từ dân cư sang trung tâm dữ liệu và tín hiệu uy tín sụp đổ.

Bài viết này đo lường sự khác biệt thay vì khẳng định nó. Nó đi qua một phép đo công khai chạy trình duyệt Scrapeless Scraping Browser so với bốn công cụ chống phát hiện mã nguồn mở và một mức độ HTTP cơ bản, trên cùng một thách thức Cloudflare, và báo cáo tỷ lệ thành công, độ trễ và độ ổn định từ dữ liệu thô theo từng thử nghiệm mà bất kỳ ai cũng có thể tái tạo.

Những gì bạn có thể đo lường với nó

  • Tỷ lệ thành công theo công cụ — liệu nó có hiển thị trang thực hay bị hết thời gian ở màn hình đệm?
  • Độ trễ của việc vượt qua — p50 và p95 của thời gian từ yêu cầu đến nội dung được hiển thị.
  • Độ ổn định qua các lần chạy lặp lại — sự phân bổ của tỷ lệ thành công qua các khoảng thời gian thử nghiệm, tín hiệu cho việc liệu một công cụ có giữ vững được không.
  • Chi phí cho mỗi yêu cầu thành công — số byte di chuyển cho mỗi lần vượt qua so với mức giá egress được công bố, vì vậy một công cụ "miễn phí" mà hiếm khi thành công thể hiện chi phí thực của nó.
  • Hiệu ứng IP — cùng các công cụ trên một địa chỉ IP dân cư so với một địa chỉ IP trung tâm dữ liệu, nơi thực tế mà sản xuất chạy.

Tại sao Scrapeless Scraping Browser

Scrapeless Scraping Browser là một trình duyệt đám mây theo kiểu tùy chỉnh, chống phát hiện được thiết kế cho các trình thu thập web và các tác nhân AI. Đặc biệt cho việc vượt qua các thách thức hoạt động, nó mang lại:

  • Chromium tự phát triển thực hiện JavaScript thách thức như một trình duyệt thực, không phải là một khách hàng HTTP đoán các tiêu đề.
  • Proxy dân cư ở hơn 195 quốc gia như cách thoát mặc định, vì vậy tín hiệu uy tín đọc sạch thay vì bị đánh dấu là trung tâm dữ liệu — tín hiệu quyết định phần lớn kết quả của các thách thức.
  • Dấu vân tay chống phát hiện theo phiên (đại lý người dùng, múi giờ, canvas, WebGL) được giữ nhất quán bên trong, vì vậy kiểm tra dấu vân tay vượt qua.
  • Xử lý tự nhiên các loại thách thức phổ biến — reCAPTCHA v2, Cloudflare Turnstile và màn hình đệm Cloudflare — mà không cần một bộ giải riêng biệt được kết nối.
  • Giữ phiên để giữ một phiên đã được làm sạch ấm, vì vậy một phiên được xác thực được sử dụng lại thay vì được xác thực lại trên mỗi yêu cầu.

Nhận khóa API của bạn trên gói miễn phí tại app.scrapeless.com.

Cách mà phép đo đánh giá một "sự vượt qua"

Sự công bằng là mục tiêu chính, vì vậy các quy tắc là giống nhau cho mỗi công cụ:

  • Một mục tiêu, một định nghĩa về thành công. Mỗi công cụ tải cùng một trang thách thức Cloudflare công khai và được chấm điểm bằng một hàm trung lập với nhà cung cấp: trang được giải quyết chỉ khi tiêu đề phụ chuyển sang tiêu đề và nội dung thật sự của trang. "Chỉ một chút thôi..." là một thất bại, và một trang không bao giờ rời khỏi vòng xoay cũng vậy.
  • Một lần thử cho mỗi cuộc thử nghiệm, không có cơ hội thứ hai. Không công cụ nào nhận được một phân bổ thứ hai hoặc một vòng kết nối lại để che giấu một lần chạy kém. Điều này phản ánh cách mà một yêu cầu sản xuất đơn lẻ hoạt động và giữ cho việc so sánh trung thực - một ngân sách cho lần thử thứ hai sẽ làm đẹp cho mỗi công cụ một cách không công bằng.
  • Một thời gian chờ cho mọi người. Một giới hạn thời gian nhất định áp dụng cho toàn bộ, vì vậy một công cụ "thành công" sau hai phút hoạt động sẽ được chấm điểm giống như một đường ống thực sự.
  • Chi phí được đo, không phải khẳng định. Số byte truyền qua mỗi lần giải quyết thành công được ghi lại ở phía khách hàng và nhân với tỷ lệ thoát công khai đã công bố của mỗi công cụ. Các công cụ mã nguồn mở trên IP riêng của chúng di chuyển byte miễn phí - nhưng một công cụ hiếm khi giải quyết có chi phí cho mỗi thành công nặng nề, điều mà tỷ lệ thô ẩn giấu.

Lĩnh vực: Trình duyệt Scrapeless Scraping; nodriver, patchright, camoufox, và SeleniumBase (chế độ không phát hiện) là các công cụ trình duyệt mã nguồn mở; và một khách hàng HTTP thông thường là mức sàn. Từ vựng về mối đe dọa tự động mà những thách thức này được xây dựng để ngăn chặn được liệt kê trong dự án Mối đe dọa Tự động của OWASP đối với Ứng dụng Web, và ba tín hiệu tương ứng một cách rõ ràng với nó: quá trình bắt tay TLS được mô tả trong đặc tả TLS 1.3, dấu vân tay trình duyệt, và cookie giải quyết được thiết lập theo đặc tả Quản lý Trạng thái HTTP. Mô tả của Cloudflare về các loại thách thức mà nó phục vụ nằm trong tài liệu thách thức của Cloudflare.

Nhận khóa API của bạn trên gói miễn phí: app.scrapeless.com

Kết quả trên một IP dân cư (trường hợp tốt nhất của các công cụ mã nguồn mở)

Chạy từ một IP dân cư - đầu ra thuận lợi nhất mà một công cụ tự lưu trữ có thể có - lĩnh vực phân chia một cách rõ ràng. Tám cuộc thử nghiệm cho mỗi công cụ, một lần cố gắng mỗi, thời gian chờ giống nhau:

Đánh giá sử dụng thang bốn cấp độ trong tám cuộc thử nghiệm: Rất Cao = 7–8/8 vượt qua · Cao = 5–6/8 · Trung Bình = 3–4/8 · Thấp = 0–2/8. Các số liệu chính xác cho mỗi cuộc thử nghiệm có trong bảng kết quả của benchmark để mỗi đánh giá quay trở lại với lần chạy.

Công cụ Đã vượt qua thách thức Ghi chú
Trình duyệt Scrapeless Scraping Rất Cao cao nhất trong lĩnh vực; đã vượt qua thách thức trong hầu hết các cuộc thử nghiệm
SeleniumBase (chế độ không phát hiện) Cao công cụ mã nguồn mở duy nhất cạnh tranh - trên IP dân cư này
patchright Thấp đã đối mặt với thách thức trong mọi lần chạy, không vượt qua lần nào
camoufox Thấp đã đối mặt với thách thức trong mọi lần chạy, không vượt qua lần nào
nodriver Thấp đã đối face với thách thức trong mọi lần chạy, không vượt qua lần nào
HTTP thông thường (sàn) Thấp 403 trong mọi yêu cầu

Hai điều nổi bật. Đầu tiên, ngay cả trên lãnh thổ ủng hộ một kiến trúc tự lưu trữ nhất, Trình duyệt Scrapeless Scraping dẫn đầu lĩnh vực và giải quyết một cách nhất quán hơn. Thứ hai, "sử dụng trình duyệt chống phát hiện" không phải là một câu trả lời hoàn chỉnh: ba trong bốn công cụ trình duyệt mã nguồn mở đã không giải quyết được thách thức một lần nào, và không thất bại nhanh chóng - chúng đã giữ tiêu đề phụ cho đến khi hết thời gian.

Địa chỉ IP trung tâm dữ liệu là câu chuyện sản xuất

Wi-Fi dân cư không phải là nơi mà các công cụ cạo chạy. Các đường ống sản xuất hoạt động trên các máy chủ đám mây, và một máy chủ đám mây thoát qua một địa chỉ IP trung tâm dữ liệu mà tín hiệu uy tín của Cloudflare xử lý rất khác nhau. Thay đổi duy nhất đó là điều phân tách lĩnh vực.

Được đo trong CI (địa chỉ IP trung tâm dữ liệu, GitHub Actions), cùng một mục tiêu, cùng tám cuộc thử nghiệm cho mỗi công cụ, cùng quy tắc một lần thử:

Công cụ Đã vượt qua thách thức p50 p95 Mean KB / clear $/1k thành công Ổn định σ
Trình duyệt Scrapeless Scraping Cao 14,274 ms 26,009 ms 153.9 $0.063 43.3%
seleniumbase-uc Thấp 58,993 ms 65,390 ms
camoufox Thấp 56,574 ms 59,348 ms
patchright Thấp 51,920 ms 52,302 ms
nodriver Thấp 51,830 ms 52,886 ms
HTTP thông thường (sàn) Thấp 100 ms 254 ms
Kết quả của việc chạy trình duyệt tự lưu trữ với chế độ không bị phát hiện trên một IP trung tâm dữ liệu không có gì để dựa vào ở đây — nó đã không vượt qua thử thách dù một lần nào, và các cột p50/p95 cho thấy lý do: mọi công cụ trình duyệt mã nguồn mở đều mất khoảng 52–65 giây cho mỗi lần thử để xử lý màn hình trung gian trước khi hết thời gian, sau đó không trả về gì cả. Sàn plain-HTTP "thất bại nhanh" ở mức 100 ms p50 vì nó hoàn toàn không thực hiện thử thách — nó chỉ nhận 403 và thoát. Các cột chi phí và byte là trống cho các công cụ 0% vì không có trường hợp thành công nào để chia byte hoặc đồng tiền vào; một công cụ "miễn phí" mà không có phép vượt qua thì có chi phí chưa xác định cho mỗi thành công, chứ không phải là rẻ.

Trên một IP trung tâm dữ liệu, các công cụ tự lưu trữ đánh mất lợi thế duy nhất mà chúng có — một điểm ra dân cư sạch — vì chúng không có điểm ra sạch riêng nào để dựa vào. Trình duyệt Scrapeless Scraping không bị ảnh hưởng ở loại này: nó vẫn vượt qua thử thách vì các yêu cầu của nó đi qua các proxy dân cư bất kể quy trình chuẩn mực hoạt động ở đâu, đạt điểm 6 trên 8 (Cao) với p50 14.3 giây và chi phí đo lường $0.063 cho mỗi nghìn lần vượt qua thành công. Kết quả là phiên bản của kiểm tra này khớp với sản xuất — chỉ có công cụ mang theo điểm ra dân cư riêng của nó mới tiếp tục vượt qua thử thách, và nó làm như vậy trong khi phần còn lại của lĩnh vực quay trở lại 0%.

Đó là trường hợp đáng tin cậy cho một trình duyệt đám mây được quản lý. Không phải là các công cụ mã nguồn mở không bao giờ có thể vượt qua Cloudflare — một trong số chúng có thể, trên IP phù hợp. Điều đó là độ tin cậy trong môi trường mà bạn thực sự triển khai là thuộc tính mà tồn tại, và thuộc tính đó đến từ điểm ra và tính nhất quán, không phải từ một bản vá âm thầm.

Cách đọc điều này cho chính ngăn xếp của bạn

  • Nếu bạn chạy trên laptop hoặc proxy dân cư đã có sẵn, và khối lượng thấp, một trình duyệt tự lưu trữ không bị phát hiện có thể hoạt động — chấp nhận việc bảo trì và độ biến thiên qua các lần chạy.
  • Nếu bạn triển khai trên máy chủ đám mây, cần tính nhất quán, hoặc chạy ở bất kỳ mức độ đồng thời nào thực sự, vấn đề về uy tín điểm ra là bức tường, và một trình duyệt đám mây mang theo điểm ra dân cư riêng là con đường khả thi. So sánh giá cả với thời gian kỹ thuật mà một ngăn xếp tự lưu trữ tốn để duy trì.
  • Dù sao đi nữa, hãy đo lường trên mục tiêu của bạn. Trang thử thách sử dụng ở đây là một mục tiêu thực hành công khai; trang của bạn có thể nằm sau một cấu hình nghiêm ngặt hơn. Bộ có thể được xây dựng để chỉ vào bất cứ điều gì bạn cần thử nghiệm.

Đối với cơ chế vận hành trình duyệt đám mây — tạo phiên, quốc gia proxy, và đọc DOM đã được kết xuất — tài liệu Scraping Browser bao gồm toàn bộ quy trình, và cách tiếp cận chống bot được giải thích thêm trong hướng dẫn chị em về bỏ qua bảo vệ Cloudflare và Turnstile.

Kết luận: độ tin cậy là một thuộc tính điểm ra

Vượt qua Cloudflare trong sản xuất giảm xuống ba tín hiệu — một trình duyệt thực, một dấu vết nhất quán, và một IP ra sạch — và cái thứ ba là nơi mà các ngăn xếp tự lưu trữ lặng lẽ gặp sự cố. Trên một IP dân cư, lĩnh vực trông có vẻ cạnh tranh; trên IP trung tâm dữ liệu mà các đường ống thực sự sử dụng, thì không. Trình duyệt Scrapeless Scraping vượt qua thử thách thường xuyên nhất và nhất quán nhất, và nó là công cụ duy nhất được đo lường mà thành công không phụ thuộc vào việc quy trình xảy ra ở đâu. Các con số không phải là một tuyên bố về độ tin cậy — chúng là một bộ để vận hành. Ghim điểm ra dân cư của Mỹ, giữ phiên ấm bằng cách tải trang một lần trước trang mục tiêu, giữ độ đồng thời ở mức vừa phải cho mỗi máy chủ, và để tỷ lệ thành công đo lường giải quyết tranh cãi.


Sẵn sàng để vượt qua Cloudflare trong sản xuất?

Tham gia cộng đồng của chúng tôi để nhận kế hoạch miễn phí và kết nối với các nhà phát triển xây dựng đường ống chống bot: Discord · Telegram.

Đăng ký tại app.scrapeless.com để có runtime Scraping Browser miễn phí và chỉ vào các trang được bảo vệ bởi Cloudflare mà đường ống của bạn cần.

Câu hỏi thường gặp

Q: Tôi có cần một proxy để vượt qua thử thách không?
Có — điểm ra sạch là tín hiệu quyết định hầu hết các kết quả. Trình duyệt Scrapeless Scraping sử dụng các proxy dân cư Mỹ theo mặc định; một công cụ tự lưu trữ cần điểm ra dân cư riêng của mình, và trên một IP trung tâm dữ liệu mà không có, thử thách hiếm khi vượt qua.

Q: Trang hiển thị "Chỉ một chút..." hoặc Truy cập bị từ chối. Làm thế nào để tôi có được một kết xuất sạch?
Ghim IP nhà ở của Mỹ để ra ngoài và ấm lên phiên trước: tải trang chủ của trang web trong cùng một phiên trước khi yêu cầu trang mục tiêu, để cookie clearance được thiết lập trên một phiên được xác nhận. Giữ cho độ đồng thời vừa phải — ba worker trên mỗi máy chủ là một giới hạn an toàn cho các lần chạy song song.

Q: Tại sao các công cụ mã nguồn mở làm sạch thử thách trên laptop của tôi nhưng thất bại trên máy chủ của tôi?
Laptop của bạn thoát qua một IP nhà ở; máy chủ của bạn thoát qua một IP trung tâm dữ liệu với danh tiếng kém hơn. Cùng một công cụ, cùng một mã — IP thoát đã thay đổi, và đó là tín hiệu mà Cloudflare đánh giá nặng nề nhất. Đây là lý do lớn nhất mà một stack hoạt động trong thử nghiệm lại thất bại trong sản xuất.

Q: Các công cụ mã nguồn mở có thể nào vượt qua thử thách không?
Có — SeleniumBase ở chế độ không bị phát hiện đã vượt qua thử thách trên một IP nhà ở trong benchmark này. Điểm không phải là các công cụ tự lưu trữ không bao giờ hoạt động; mà là thành công của chúng phụ thuộc vào một điều kiện IP mà sản xuất thường loại bỏ, cùng với việc bảo trì liên tục khi cả công cụ và thử thách đều thay đổi.

Q: Làm thế nào để tôi tái tạo những con số này?
Bộ công cụ là một benchmark Cloudflare mã nguồn mở trên GitHub. Nhân bản nó, cài đặt các công cụ, thiết lập khóa API Scrapeless, và chạy cùng một ma trận — cùng mục tiêu, cùng thử nghiệm, cùng quy tắc một lần thử. Nó viết một bảng kết quả cộng với JSON thô theo từng thử nghiệm, vì vậy mọi con số đều có thể truy trace về lần chạy đã sản xuất ra nó, và các con số từ IP trung tâm dữ liệu đến thẳng từ lần chạy GitHub Actions của nó.

Tại Scrapless, chúng tôi chỉ truy cập dữ liệu có sẵn công khai trong khi tuân thủ nghiêm ngặt các luật, quy định và chính sách bảo mật trang web hiện hành. Nội dung trong blog này chỉ nhằm mục đích trình diễn và không liên quan đến bất kỳ hoạt động bất hợp pháp hoặc vi phạm nào. Chúng tôi không đảm bảo và từ chối mọi trách nhiệm đối với việc sử dụng thông tin từ blog này hoặc các liên kết của bên thứ ba. Trước khi tham gia vào bất kỳ hoạt động cạo nào, hãy tham khảo ý kiến ​​cố vấn pháp lý của bạn và xem xét các điều khoản dịch vụ của trang web mục tiêu hoặc có được các quyền cần thiết.

Bài viết phổ biến nhất

Danh mục