本番環境でのCloudflareのクリアリング: 再現可能なベンチマーク
Expert Network Defense Engineer
TL;DR:
- Cloudflareのチャレンジを本番環境でクリアするのは、ブラウザの問題よりもIPの問題です。 フラグ付きサーバーIP上のパッチを当てたブラウザはインタースティシャルでストールしますが、クリーンな住宅用エグレスの本物のブラウザはページをレンダリングします。
- Scrapeless Scraping Browserはオープンで再現可能なベンチマークで8回中7回Cloudflareのチャレンジをクリアしました - 測定されたすべてのツールの中で最高の結果であり、自宅のIPからデータセンターのIPにリクエストを移動させた時にのみ効果を発揮します。
- テストした4つのオープンソースブラウザツールのうち3つ(patchright、camoufox、nodriver)は、8回中1回もクリアできませんでした - 標準のHTTPフロアと同様に、同じターゲットと試行で「もう少々お待ちください…」のままでした。
- 唯一競争相手となったオープンソースツールはSeleniumBase UCで6回中6回クリアしましたが、それは住宅用IPの最も有利なケースです。 データセンターIPに移動すると、その利点は消えます。
- ここでのすべての数値は再現可能です。 ハーネスはGitHub上のオープンソースCloudflareベンチマークです:同一のターゲット、試行ごとに1回の試み、再試行なし、すべてのツールに対する1つのスコアラー。クローンして自分で再実行してください。
- 無料で始められます。 新しいScrapelessアカウントには無料のScraping Browserランタイムが含まれています — app.scrapeless.comでサインアップします。
はじめに:本番環境でCloudflareをクリアするために実際に必要なこと
Cloudflareのチャレンジは、ネットワークの問題の衣を着たレンダリングの問題です。「もう少々お待ちください…」、「スピナー」、「あなたが人間であることを確認しています」というインタースティシャルは、JavaScriptの負荷を実行し、一度に3つの信号を読み取ります:本物のブラウザがチャレンジを実行しているか、一貫したフィンガープリンティングであるか、エグレスIPにクリーンなレピュテーションがあるか。いずれかが欠けると、ページは決して解決されません。
ほとんどの報告は「どうやってこれを通過するのか?」に図書館の推奨と隠密プラグインで答えます。その答えはテスト可能であり、通常、最も重要な場所である本番サーバーでは失敗します。家庭用Wi-Fi上のノートパソコンからチャレンジをクリアするツールは、クラウドインスタンスから実行されると非常に異なる動作をします。なぜなら、エグレスIPが住宅用からデータセンターへと切り替わり、レピュテーション信号が崩壊するからです。
この投稿では、主張するのではなく、その違いを測定します。同じCloudflareのチャレンジに対して、Scrapeless Scraping Browserを4つのオープンソースのアンチディテクトツールと標準HTTPのベースラインで実行するオープンベンチマークを通じて測定し、成功率、レイテンシ、安定性を報告します。
それで何を測定できるか
- ツールごとの成功率 — 本当のページがレンダリングされるか、インタースティシャルでタイムアウトするか?
- クリアのレイテンシ — リクエストからレンダリングされたコンテンツまでの時間のp50とp95。
- 繰り返し実行の安定性 — 試行ウィンドウ全体での成功率の広がり、そのツールが持続するかどうかの信号。
- 成功したリクエストごとのコスト — 公表されたエグレス料金に対するクリアごとのバイト移動、したがってまれに成功する「無料」ツールはその真のコストを示します。
- IPの影響 — 住宅用IPとデータセンターIPでの同じツール、実際の生産環境がどこで動作するか。
なぜScrapeless Scraping Browserか
Scrapeless Scraping Browserは、ウェブクローラーやAIエージェント向けに設計されたカスタマイズ可能なアンチ検出クラウドブラウザです。特にアクティブなチャレンジをクリアするために、次の機能を持っています:
- 自社開発のChromiumで、本物のブラウザのようにチャレンジのJavaScriptを実行し、ヘッダーを推測するHTTPクライアントではありません。
- 195カ国以上の住宅用プロキシをデフォルトのエグレスとして使用するため、レピュテーション信号がデータセンターでフラグが立てられるのではなくクリーンに読み取られます — これはほとんどのチャレンジ結果を決定する信号です。
- セッションごとのアンチ検出フィンガープリンティング(ユーザーエージェント、タイムゾーン、キャンバス、WebGL)が内部的に一貫性を保ち、フィンガープリンティングチェックが通過します。
- 一般的なチャレンジタイプのネイティブ処理 — reCAPTCHA v2、Cloudflare Turnstile、およびCloudflareインタースティシャル — 別のソルバーを配線することなく行います。
- クリアされたセッションを温かく保つセッション持続性により、検証されたセッションがすべてのリクエストで再検証されるのではなく再利用されます。
app.scrapeless.comで無料プランのAPIキーを取得してください。
ベンチマークが「クリア」を測定する方法
公平性が全体のポイントであるため、ルールはすべてのツールに対して同一です:
- 1つのターゲット、1つの成功の定義。 すべてのツールは同じCloudflareのチャレンジページを読み込み、中立的なスコア関数によって評価されます:インタースティシャルのタイトルが実際のページタイトルに転換し、コンテンツがレンダリングされるまでページはクリアされません。「今しばらくお待ちください…」は失敗であり、スピナーから出ないページも同様です。
- 1試行につき1回の試行、再チャンスなし。 どのツールも悪い実行を隠すための二度目のアロケーションや再接続ループを持つことはできません。これは、単一の本番リクエストの挙動を反映しており、比較を正直なものに保ちます — 二度目の試行に対する予算は、すべてのツールを不均等に持ち上げてしまいます。
- みんなに1つのタイムアウト。 同じクロックの上限がフィールド全体に適用されるため、2分間の作業の後に「成功」するツールも、実際のパイプラインがそれを評価するのと同じ方法でスコアがつけられます。
- コストは測定され、主張されるものではない。 成功したクリアあたりのバイト数はクライアント側でキャプチャされ、各ツールの公開されたイーグレスレートで乗算されます。独自のIPのオープンソースツールは無料でバイトを移動しますが、クリアすることがほとんどないツールには成功1回あたりの厳しいコストが存在し、それは生のレートには隠れています。
フィールド:Scrapeless Scraping Browser;オープンソースのブラウザツールとしてnodriver、patchright、camoufox、そしてSeleniumBase(未検出モード);フロアとしてのプレインHTTPクライアント。これらのチャレンジが防止するために構築された自動脅威の語彙は、OWASP自動脅威に関するWebアプリケーションプロジェクトにカタログ化されており、3つの信号がそれに沿ってきれいにマッピングされています:TLS 1.3の仕様で説明されているTLSハンドシェイク、ブラウザフィンガープリンティング、およびHTTP状態管理仕様に基づいて設定されたクリアランスクッキー。Cloudflare自身の提供するチャレンジタイプの説明は、Cloudflareのチャレンジドキュメントに存在します。
無料プランでAPIキーを取得してください:app.scrapeless.com
戸建てIPでの結果(オープンソースツールの最良のケース)
戸建てIPから実行 — 自ホスト型ツールが持つ最も有利なイーグレス — フィールドは明確に分かれます。ツールごとに8回の試行、各1回の試行、同じタイムアウト:
評価は8回の試行での4段階スケールを使用します:非常に高い = 7〜8/8クリア · 高い = 5〜6/8 · 中程度 = 3〜4/8 · 低い = 0〜2/8。正確な試行ごとのカウントはベンチマークの結果テーブルにあるため、すべての評価は実行に追跡されます。
| ツール | チャレンジをクリアした | 注意事項 |
|---|---|---|
| Scrapeless Scraping Browser | 非常に高い | フィールドで最も高く、ほぼすべての試行でチャレンジをクリア |
| SeleniumBase(未検出モード) | 高い | この戸建てIP上で競い合った唯一のオープンソースツール |
| patchright | 低い | すべての実行でチャレンジに直面し、クリアなし |
| camoufox | 低い | すべての実行でチャレンジに直面し、クリアなし |
| nodriver | 低い | すべての実行でチャレンジに直面し、クリアなし |
| プレインHTTP(フロア) | 低い | すべてのリクエストで403 |
2つの点が際立っています。まず、自己ホスト型スタックに最も適したフィールドでも、Scrapeless Scraping Browserがリードし、より一貫してクリアしています。次に、「anti-detectブラウザを使用する」というのは完全な答えではありません:4つのオープンソースブラウザツールのうち3つがチャレンジを1回もクリアしておらず、迅速に失敗することもありませんでした — タイムアウトまでインタースティシャルを保持していました。
データセンターIPが本番の物語
住宅用Wi-Fiはスクレイパーが実行する場所ではありません。本番のパイプラインはクラウドサーバーで動作し、クラウドサーバーはデータセンターIPを通じて出口を持ち、それに対するCloudflareの評判信号は非常に異なる扱いをします。その単純な変化がフィールドを分けます。
CI(データセンターIP、GitHub Actions)で測定された同じターゲット、ツールごとに同じ8回の試行、同じ1回の試行ルール:
| ツール | チャレンジをクリアした | p50 | p95 | 平均KB / クリア | $/1k成功 | 安定性σ |
|---|---|---|---|---|---|---|
| Scrapeless Scraping Browser | 高い | 14,274 ms | 26,009 ms | 153.9 | $0.063 | 43.3% |
| seleniumbase-uc | 低い | 58,993 ms | 65,390 ms | — | — | — |
| camoufox | 低い | 56,574 ms | 59,348 ms | — | — | — |
| patchright | 低い | 51,920 ms | 52,302 ms | — | — | — |
| nodriver | 低い | 51,830 ms | 52,886 ms | — | — | — |
| プレインHTTP(フロア) | 低い | 100 ms | 254 ms | — | — | — |
| 以下の英語のテキストを日本語に翻訳します: |
SeleniumBase(未検出モード)が投稿した住宅用6-of-8は、ここでは何も根拠がありません — データセンターIPでは、チャレンジをクリアした回数はゼロ回であり、p50/p95の列がその理由を示しています:オープンソースのブラウザツールはすべて、タイムアウトが発火する前に中間画面で試行するのに約52〜65秒を費やし、何も返しませんでした。通常のHTTPのフロアは、チャレンジをまったく実行しないため、100 msのp50で「早く失敗」します — 403を受け取って終了します。成功したクリアがないため、0%ツールのコストとバイトの列は空白です。「無料」のツールには、クリアがないため、成功あたりのコストが未定義であり、安価ではありません。
データセンターIPでは、自己ホスティングツールは唯一の利点であるクリーンな住宅用終了点を失います — 彼らは依存できるクリーンな出口を持っていません。Scrapeless Scraping Browserは、種類には影響を受けません:ベンチマークプロセスがどこで実行されても、リクエストは住宅用プロキシを通じて終了し、6の8(高)でp50は14.3秒、成功したクリアあたりの測定コストは$0.063です。この結果は、生産環境に合わせたテストのバージョンです — 独自の住宅用エグレスを持つツールだけがチャレンジをクリアし続け、他のツールは0%を返します。
これは、管理されたクラウドブラウザの正直な考えです。オープンソースツールがCloudflareをクリアできないわけではありません — 正しいIPでは、いくつかのツールができます。重要なのは、実際にデプロイする環境における信頼性が持ちこたえる特性であり、その特性はエグレスと一貫性から来ており、ステルスパッチからは来ていません。
自分のスタックでの読み方
- **ラップトップまたは住宅用プロキシですでに運用していて、ボリュームが低い場合、**自己ホスティングの未検出ブラウザが機能する可能性があります — メンテナンスとランごとの変動を受け入れてください。
- **クラウドサーバーにデプロイし、一貫性が必要で、実際の同時実行を行う場合、**エグレスレピュテーションの問題が壁となり、独自の住宅用出口を持つクラウドブラウザが堅実な道です。自己ホスティングスタックを維持するためのエンジニアリングコストと 価格設定 を比較してください。
- **いずれにせよ、ターゲットで測定してください。**ここで使用されているチャレンジページは公実の実践ターゲットです;あなたのサイトはより厳しい構成の背後にあるかもしれません。ハーネスはテストする必要があるものに向けてポイントを設定するために構築されています。
クラウドブラウザを駆動するためのメカニズム — セッション作成、プロキシ国、レンダリングされたDOMの読み込み — は、Scraping Browserドキュメントで全体の流れをカバーしており、ボット対策のアプローチは、Cloudflare保護とTurnstileのクリアに関する兄弟ガイドでさらに詳しく説明されています。
結論:信頼性はエグレスの特性である
生産環境でCloudflareをクリアすることは、3つのシグナルに還元されます — 実際のブラウザ、一貫したフィンガープリント、クリーンな出口IP — そして、3つ目が自己ホスティングスタックが静かに破綻する場所です。住宅IPではフィールドは競争力があります;データセンターIPで実際のパイプラインが使用するものではありません。Scrapeless Scraping Browserは、最も頻繁にかつ一貫してチャレンジをクリアしました。そしてそれは、プロセスがどこで実行されるかに依存しない唯一のツールです。数字は信頼を訴えるものではありません — それらは運用するためのハーネスです。米国の住宅用エグレスを固定し、ターゲットページの前に1度サイトを読み込むことでセッションを温かく保ち、ホストあたりの同時実行を控えめに保ち、測定された成功率が議論を決定させてください。
生産環境でCloudflareをクリアする準備はできましたか?
無料プランを申し込むためにコミュニティに参加し、ボット耐性のあるパイプラインを構築する開発者とつながりましょう:Discord · Telegram.
無料のScraping Browserランタイムにサインアップし、あなたのパイプラインが必要とするCloudflare保護ページにベンチマークを指示してください:app.scrapeless.com。
FAQ
Q: チャレンジをクリアするにはプロキシが必要ですか?
はい — クリーンなエグレスはほとんどの結果を決定するシグナルです。Scrapeless Scraping Browserはデフォルトで米国の住宅用プロキシを使用します;自己ホスティングツールは独自の住宅用エグレスを必要とし、データセンターIPでそれがない場合、チャレンジをクリアすることは稀です。
Q: ページに「しばらくお待ちください...」またはアクセス拒否が表示されます。クリーンなレンダリングを取得するにはどうすればよいですか?
USの住宅用出口をピン留めし、最初にセッションを温めます: 対象ページをリクエストする前に、同じセッションでサイトのホームページを読み込むことで、クリアランスクッキーが検証されたセッションに設定されます。並行処理は控えめに — ホストごとに3つのワーカーが安全な上限です。
Q: なぜオープンソースツールは私のラップトップではクリアできるのに、サーバーでは失敗するのですか?
あなたのラップトップは住宅IPを通じて出口しますが、あなたのサーバーは悪い評判のデータセンターIPを通じて出口します。同じツール、同じコード — 出口IPが変わったことが、Cloudflareが最も重視する信号です。テストで成功したスタックが本番環境で失敗する最大の理由はこれです。
Q: オープンソースツールはそれをクリアできますか?
はい — SeleniumBaseの未検出モードがこのベンチマークで住宅IPでのチャレンジをクリアしました。ポイントは、自己ホスト型ツールが決して機能しないということではなく、それらの成功が通常本番環境で取り除かれるIP条件に依存していること、さらにツールとチャレンジの両方が変化する中での継続的なメンテナンスが必要であるということです。
Q: これらの数値を再現するにはどうすればいいですか?
ハーネスはGitHub上のオープンソースのCloudflareベンチマークです。これをクローンし、ツールをインストールし、Scrapeless APIキーを設定し、同じマトリックスを実行します — 同じターゲット、同じ試行、同じ一回限りのルールです。結果テーブルと生の試行ごとのJSONが書き込まれるため、すべての数値はそれを生成した実行にトレースバックされ、データセンターIPの数値はそのGitHub Actionsの実行から直接取得されます。
Scrapelessでは、適用される法律、規制、およびWebサイトのプライバシーポリシーを厳密に遵守しながら、公開されているデータのみにアクセスします。 このブログのコンテンツは、デモンストレーションのみを目的としており、違法または侵害の活動は含まれません。 このブログまたはサードパーティのリンクからの情報の使用に対するすべての責任を保証せず、放棄します。 スクレイピング活動に従事する前に、法律顧問に相談し、ターゲットウェブサイトの利用規約を確認するか、必要な許可を取得してください。



