🎯 一款可定制、具备反检测功能的云浏览器,由自主研发的 Chromium驱动,专为网页爬虫AI 代理设计。👉立即试用
返回博客

在生产中清理Cloudflare:一个可重复的基准测试

Michael Lee
Michael Lee

Expert Network Defense Engineer

08-Jul-2026

TL;DR:

  • 在生产环境中,通过Cloudflare挑战的清除是一个IP问题,而不是浏览器问题。 在被标记的服务器IP上补丁浏览器停留在中间页面;而在干净的住宅出口上,真实浏览器能够渲染页面。
  • Scrapeless Scraping Browser在一个开放的、可重复的基准测试中清除了7次中的8次Cloudflare挑战 —— 超过所有测量工具的最高记录,并且是在请求从家庭IP切换到数据中心IP时唯一保持有效的工具。
  • 四个测试的开源浏览器工具中有三个——patchright、camoufox和nodriver——在8次测试中均没有清除通过,而且在普通HTTP条件下;在相同的目标和试验中,每个工具都停滞在“请稍等...”。
  • 唯一能与之竞争的开源工具——SeleniumBase UC在8次中清除了6次——只是在住宅IP下能够做到,这是自托管堆栈最有利的情况。一旦切换到实际管道运行的数据中心IP,这种优势就消失了。
  • 这里的每一个数字都是可重复的。 该基准是在GitHub上的开源Cloudflare基准上进行的:相同的目标,每次试验一次,不进行第二次尝试,所有工具使用一个评分标准。克隆它并自己重新运行。
  • 免费开始。 新的Scrapeless账户包括免费的Scraping Browser运行时 — 在app.scrapeless.com注册。

介绍:实际如何清除生产中的Cloudflare

Cloudflare的挑战是一个呈现问题,披上了网络问题的外衣。中间页面——“请稍等……”,一个旋转图标,“正在验证您是人类”——运行JavaScript工作负载并同时读取三个信号:是否有真实浏览器执行挑战,指纹是否内部一致,以及出口IP是否具有良好的声誉。错过其中任何一个信息,页面都无法解析。

大多数报道回答“我该如何通过?”时提供库推荐和隐蔽插件。这个答案是可测试的,通常在关键地方失败:生产服务器。从家用Wi-Fi的笔记本清除挑战的工具在云实例上运行时表现非常不同,因为出口IP从住宅转换为数据中心,声誉信号崩溃。

这篇文章测量差异而不是断言它。它通过一个开放基准展示了Scrapeless Scraping Browser与四个开源反检测工具和一个普通HTTP基准在相同的Cloudflare挑战下的表现,并报告成功率、延迟和稳定性的数据,可以被任何人重新生成。

您可以用它测量什么

  • 每个工具的成功率——它是否能够渲染真实页面,还是在中间页面上超时?
  • 清除的延迟——从请求到渲染内容的p50和p95时间。
  • 重复运行的稳定性——在试验窗口中成功率的分布,能否证明工具的有效性。
  • 每个成功请求的成本——每次清除移动的字节数与公布的出口费率相比,因此“免费”工具即使成功率较低也能显示其真实成本。
  • IP效应——在住宅IP与数据中心IP上的相同工具,这正是生产实际运行的地方。

为什么选择Scrapeless Scraping Browser

Scrapeless Scraping Browser是一个可定制的反检测云浏览器,专为网页爬虫和AI代理设计。特别是在清除活跃挑战方面,它带来了:

  • 自我开发的Chromium,可以像真实浏览器一样执行挑战JavaScript,而不是猜测HTTP头的HTTP客户端。
  • 195多个国家的住宅代理作为默认出口,因此声誉信号读取干净,而不是被标记为数据中心的IP——这个信号决定了大多数挑战的结果。
  • 每个会话的反检测指纹(用户代理、时区、画布、WebGL)保持内部一致,因此指纹检查通过。
  • 本地处理常见挑战类型——reCAPTCHA v2、Cloudflare Turnstile和Cloudflare中间页面——而无需连接到单独的求解器。
  • 会话持久性,保持已清除会话活跃,因此经过验证的会话可以重用,而无需在每次请求时重新验证。

app.scrapeless.com的免费计划中获取您的API密钥。

基准如何测量“清除”

公平性是重点,因此所有工具的规则都是相同的:

  • 一个目标,一个成功的定义。 每个工具加载相同的公共 Cloudflare 挑战页面,并由一个与供应商无关的函数进行评分:页面仅在插页标题切换到真实页面标题并且内容呈现时被清除。“稍等一下……”是失败,而一个从未离开旋转器的页面也是如此。
  • 每次试验一次尝试,没有第二次机会。 没有工具获得第二次分配或重新连接循环来掩盖糟糕的运行。这反映了单个生产请求的行为,并保持比较的公正——第二次尝试预算会不平等地抬高每个工具的评价。
  • 一个超时适用于所有人。 相同的时钟上限适用于所有工具,因此在经过两分钟的磨蹭后“成功”的工具将根据真实管道的评分相同评分。
  • 成本是测量的,而不是主张的。 每次成功清除所需的字节由客户端捕获,并乘以每个工具发布的出口速率。自行托管的开源工具在自己的 IP 上传输字节是免费的——但一个很少清除的工具每次成功的成本是惩罚性的,而原始速率却隐瞒了这一点。

该领域:Scrapeless Scraping Browser;nodriverpatchrightcamoufoxSeleniumBase(未检测模式)作为开源浏览器工具;以及作为底线的普通 HTTP 客户端。这些挑战旨在阻止的自动化威胁词汇在OWASP 自动化威胁到 Web 应用程序项目中进行了分类,三个信号与之干净地对应:在TLS 1.3 规范中描述的 TLS 握手、浏览器指纹和根据HTTP 状态管理规范设置的清除 cookie。Cloudflare 对其提供的挑战类型的描述可以在Cloudflare 挑战文档中找到。

在免费计划中获取您的 API 密钥:app.scrapeless.com

住宅 IP 上的结果(开源工具的最佳情况)

从住宅 IP 运行——自托管工具可以拥有的最有利出口——该领域清晰分割。每个工具进行八次试验,每次尝试一次,超时时间相同:

评级使用四级评分标准进行八次试验:非常高 = 7–8/8 清除 · = 5–6/8 · = 3–4/8 · = 0–2/8。每次试验的确切计数在基准测试结果表中,因此每个评级都能追溯到运行。

工具 清除挑战 备注
Scrapeless Scraping Browser 非常高 该领域最高;几乎在每次试验中都成功清除挑战
SeleniumBase(未检测模式) 唯一在此住宅 IP 上与之竞争的开源工具
patchright 每次运行都面临挑战,未能清除
camoufox 每次运行都面临挑战,未能清除
nodriver 每次运行都面临挑战,未能清除
普通 HTTP(底线) 每次请求都返回 403

有两点突出。首先,即使在最有利于自托管堆栈的场地,Scrapeless Scraping Browser 也领先于其他工具,并且更具一致性地清除。其次,“使用反检测浏览器”并不是一个完整的答案:四个开源浏览器工具中有三个清除挑战的次数为零,而且没有快速失败——他们在超时时间之前保持了插页。

数据中心 IP 是生产故事

住宅 Wi-Fi 不是抓取者运行的地方。生产管道在云服务器上运行,而云服务器通过数据中心 IP 出口,Cloudflare 的信誉信号对此的处理截然不同。这个单一的变化就是区分场地的关键。

在 CI(数据中心 IP,GitHub Actions)中测量,目标相同,每个工具相同的八次试验,相同的一次尝试规则:

工具 清除挑战 p50 p95 每次清除的平均 KB 每千次成功的成本 稳定性 σ
Scrapeless Scraping Browser 14274 毫秒 26009 毫秒 153.9 $0.063 43.3%
seleniumbase-uc 58993 毫秒 65390 毫秒
camoufox 56574 毫秒 59348 毫秒
patchright 51920 毫秒 52302 毫秒
nodriver 51830 毫秒 52886 毫秒
普通 HTTP(底线) 100 毫秒 254 毫秒
住宅6-of-8的SeleniumBase(未检测模式)在这里毫无立足之地——在数据中心IP上,它清除了挑战零次,p50/p95列显示了原因:每个开源浏览器工具在超时触发之前大约花费52-65秒在中介页面上进行尝试,然后返回空值。普通HTTP底层在100毫秒的p50值下“快速失败”,因为它根本不运行挑战——它接受403并退出。对于0%工具,成本和字节列为空,因为没有成功的清除可用于分配字节或美元;一个没有清除的“免费”工具每次成功的成本是未定义的,而不是便宜的。

在数据中心IP上,自托管工具失去了他们唯一的优势——一个干净的住宅出口——因为他们没有自己的干净出境可供依赖。Scrapeless Scraping Browser的情况没有受到影响:它仍然可以清除挑战,因为它的请求通过住宅代理出口,无论基准过程在哪里运行,最终以6的8个(高)合格,p50值为14.3秒,每千次成功清除的成本为0.063美元。这个测试的结果与生产匹配——只有携带自己的住宅出口的工具能继续清除挑战,而其他工具则返回0%。

这就是托管云浏览器的诚实案例。并不是说开源工具永远无法清除Cloudflare——其中一个在正确的IP上可以做到。真正能存活下来的特性是“在你实际部署的环境中的可靠性”,而这个特性来自出口和一致性,而不是隐形补丁。

如何为你的堆栈解读此内容

  • 如果你已经在笔记本电脑或住宅代理上运行,并且流量较少, 自托管的未检测浏览器可以工作——接受维护和运行之间的变化。
  • 如果你在云服务器上部署,需保持一致性,或以任何真实并发运行, 出口声誉问题就是屏障,一个自带住宅出口的云浏览器是可靠的路径。将价格与自托管堆栈的工程维护成本进行比较。
  • 无论如何,在你的目标上进行测量。 这里使用的挑战页面是一个公共实践目标;你的网站可能位于更严格的配置后面。这个装置旨在指向你需要测试的任何内容。

关于如何驱动云浏览器的机械过程——会话创建、代理国家以及读取渲染的DOM——Scraping Browser文档涵盖了整个流程,而反机器人方法在兄弟指南中进一步解读,关于清除Cloudflare保护和Turnstile

结论:可靠性是一个出口属性

在生产中清除Cloudflare简化为三个信号——一个真实的浏览器、一致的指纹和一个干净的出口IP——而第三个信号是自托管堆栈悄然破裂的地方。在住宅IP上,现场看起来竞争激烈;在实际管道使用的数据中心IP上,却不是。Scrapeless Scraping Browser以最频繁和最一致的方式清除了挑战,且这是唯一一个测量结果不依赖于运行过程位置的工具。这些数字并不是信任的声明——而是一个可运行的装置。锁定美国住宅出口,在目标页面之前加载网站保持会话热,保持每个主机的适度并发,并让测量的成功率来为争论定论。


准备好在生产中清除Cloudflare了吗?

加入我们的社区以申请一个免费计划,并与正在构建反机器人抵抗管道的开发者联系:Discord · Telegram

app.scrapeless.com注册以获得免费的Scraping Browser运行时间,并将基准指向您管道需要的Cloudflare保护页面。

常见问题

问:我需要代理来清除挑战吗?
是的——干净的出口是决定大多数结果的信号。Scrapeless Scraping Browser默认使用美国住宅代理;自托管工具需要自己的住宅出口,而在没有出口的数据中心IP上,挑战很少被清除。

问:页面显示“稍等片刻……”或拒绝访问。我该如何获得干净的渲染?
将美国住宅出口固定并先加热会话:在请求目标页面之前,在同一会话中加载网站首页,以便在经过验证的会话上设置清除 cookie。保持并发适度——每个主机三个工作程序是并行运行的安全上限。

问:为什么开源工具可以在我的笔记本电脑上清除挑战,但在我的服务器上失败?
您的笔记本电脑通过住宅 IP 退出;您的服务器通过声誉更差的数据中心 IP 退出。相同的工具,相同的代码——但退出 IP 发生了变化,而这正是 Cloudflare 最看重的信号。这是测试成功而生产失败的最大原因。

问:开源工具能否清除挑战?
可以——SeleniumBase 在隐秘模式下在此基准测试中通过了住宅 IP 的挑战。关键并不是自托管工具永远不起作用;而是它们的成功依赖于生产通常移除的 IP 条件,以及随着工具和挑战的变化而需要的持续维护。

问:我该如何重现这些数字?
该工具是 GitHub 上的开源 Cloudflare 基准测试。克隆它,安装工具,设置 Scrapeless API 密钥,并运行相同的矩阵——相同的目标,相同的试验,相同的一次尝试规则。它会写入结果表和每次试验的原始 JSON,因此每个数据都可以追溯到产生它的运行,数据中心 IP 的数字直接来自其 GitHub Actions 运行。

在Scrapeless,我们仅访问公开可用的数据,并严格遵循适用的法律、法规和网站隐私政策。本博客中的内容仅供演示之用,不涉及任何非法或侵权活动。我们对使用本博客或第三方链接中的信息不做任何保证,并免除所有责任。在进行任何抓取活动之前,请咨询您的法律顾问,并审查目标网站的服务条款或获取必要的许可。

最受欢迎的文章

目录