スクリーンスクレイピング対ウェブスクレイピング
Scrapeless Scraping Browserは、ピクセルのみのスクリーンキャプチャに依存せず、表示状態と対話できるウェブスクレイピングアプローチをサポートします。
TL;DR
- スクリーンスクレイピングは、ユーザー向けのプレゼンテーションを読み取ります。 それは端末、デスクトップアプリケーション、リモートセッション、画像、およびレンダリングされたウェブビューを対象にできます。
- ウェブスクレイピングは、ウェブリソースから情報を抽出します。 それはHTMLを解析したり、ページレスポンスを消費したり、ブラウザの状態を検査したり、ウェブ専用コンテンツに対して視覚的技術を使用したりします。
- カテゴリは重なります。 レンダリングされたウェブインターフェースの読み取りは、強調される層に応じて、ウェブスクレイピングでもスクリーンスクレイピングでもあります。
- 構造化された層は通常ピクセルに勝ります。 HTML、DOM、アクセシビリティ、または承認されたエンドポイントは、座標やOCRよりも速く簡単に検証できます。
- 意思決定は、必要なソースと証拠に従います。 非ウェブまたは視覚専用の表面にはスクリーンスクレイピングを使用し、ウェブネイティブな構造にはウェブスクレイピングを使用します。コンテンツが要求する場合にのみ、それらを組み合わせます。
スクリーンスクレイピングとウェブスクレイピングはどちらもデータ収集を自動化しますが、それらは相互に交換可能なカテゴリではありません。スクリーンスクレイピングは、人のために意図されたプレゼンテーションを読み取る層によって定義されます。ウェブスクレイピングは、ウェブを通じて配信されるリソースによって定義されます。一方はプレゼンテーションレベルのアクセスを説明し、もう一方はウェブ中心の抽出を説明します。
その区別が重なりを説明します。サーバーHTMLを解析するスクリプトはウェブスクレイピングですが、通常はスクリーンスクレイピングではありません。デスクトップ会計ウィンドウを読み取るOCRツールはスクリーンスクレイピングですが、ウェブスクレイピングではありません。レンダリングされたウェブアプリケーションから値を読み取るブラウザボットは、両方とも説明できると言えます。
一目でわかる主な違い
| 次元 | スクリーンスクレイピング | ウェブスクレイピング |
|---|---|---|
| 主な範囲 | 人間向けのコンピューターディスプレイ全般 | ウェブページおよびウェブ配信リソース |
| 典型的な入力 | 端末セル、コントロール、アクセシビリティツリー、ピクセル | HTML、DOM、レスポンス、リンク、ブラウザ状態 |
| 一般的なツール | RPA、端末自動化、OCR、コンピュータービジョン | HTTPクライアント、HTMLパーサー、クローラー、ブラウザ |
| 主な変更リスク | レイアウト、座標、フォント、テーマ、ウィンドウ状態 | マークアップ、エンドポイント、レンダリング、ナビゲーション、アクセスポリシー |
| 典型的な出力 | ビューから推論された値 | ウェブ表現から解析された記録 |
| 最適な適合 | レガシーおよび視覚専用システム | ウェブネイティブなデータ収集 |
データの出所
スクリーンスクレイパーは、表示されているものから始まります。端末スクレイパーは位置やフィールドから文字を読み取ります。デスクトップ自動化はインターフェースコントロールを検査することがあります。OCRはピクセルを読み取ります。基盤となるシステムはデータベースや内部APIを使用する可能性がありますが、スクリーンスクレイパーはそれに直接アクセスすることに依存しません。
ウェブスクレイパーは、URLまたはウェブ配信リソースから始まります。それは初期のHTMLを取得し、リンクを追跡し、属性を解析し、構造化メタデータを検査し、JavaScriptをレンダリングし、ネットワークレスポンスをキャプチャすることができます。可視ページは、いくつかの有用な表現のうちの1つに過ぎない可能性があります。優れたウェブワークフローは、ユーザーが見るピクセルにデフォルトするのではなく、最も安定した承認された層を選択します。
速度、精度、メンテナンス
構造化されたウェブ抽出は、画像認識なしでテキストや属性を読み取ることができるため、しばしば高速です。それはまた、要素の関係、レコード識別子、URL、レスポンススキーマなどの検証アンカーを提供します。スクリーンスクレイピングは、すべてのビューをレンダリングし、レイアウトを待機し、領域を特定し、OCRで文字を解釈する必要があるかもしれません。
精度はカテゴリーだけでなく、フィールドにも依存します。安定した端末フィールドは非常に信頼性がありますが、構造が不十分なHTMLは困難です。ピクセルメソッドはスケール、コントラスト、隠蔽、フォント変更に敏感です。ウェブパーサーはテンプレートやレンダリングの変更に敏感です。両方ともフィールドレベルの検証と代表的な回帰テストを必要とします。
その WAI-ARIAの概要 は、役割とアクセシブルネームがインターフェースに意味を追加する方法を示しています。承認された自動化がこれらの信号を読み取ることができれば、それは脆弱な座標とより豊かなインターフェース理解のギャップを埋めることができます。
ブラウザ自動化が境界をぼかします
ブラウザ自動化タスクは、コントロールをクリックし、レンダリングされた状態を待ち、DOMに基づくテキストを読み取ることができます。それはウェブネイティブの構造を使用しながらプレゼンテーションと相互作用します。そのワークフローをウェブスクレイピングと呼ぶことは、ウェブソースを強調し、画面スクレイピングと呼ぶことはレンダリングされたインターフェースを強調します。実装の詳細はラベルよりも重要です。
キャンバスチャートや画像ベースのコンテンツは、ワークフローを視覚的抽出に向けて押し進めます。埋め込まれたJSONレスポンスやセマンティックテーブルは、構造化された解析に向かいます。ハイブリッドワークフローは、ナビゲーションのためにブラウザの相互作用を使用し、データのためにネットワーク応答を使用し、視覚的証拠のためにスクリーンショットを使用することができます。各出力は、そのソースレイヤーを記録する必要があり、後のユーザーが実際に観察されたことを理解できるようにします。
抽出レイヤーによる信頼性
- 要件を満たす場合は、認証された文書化されたAPIまたはエクスポートを優先してください。
- ウェブページの場合、許可されていて正確な場合は、安定した構造化されたレスポンスまたはセマンティックHTMLを優先してください。
- クライアント実行が必要な場合は、レンダリングされたDOMまたはアクセシビリティ状態を使用してください。
- 情報がピクセルまたはリモートディスプレイにのみ存在する場合は、OCRまたは座標に基づくキャプチャを使用してください。
- 抽出されたレコードを、場所を特定する方法とは独立して検証してください。
この順序は保守のヒューリスティックであり、アクセス権の階層ではありません。ブラウザが呼び出すことができるからといって、内部エンドポイントが自動的に認可されるわけではなく、APIには意図した再利用を許可しない条件がある場合があります。許可と技術的な適性の両方を評価する必要があります。
セキュリティとプライバシー
認証されたアプリケーションの画面スクレイピングは、資格情報、セッションデータ、インターフェースで見えるすべてのものを露呈させる可能性があります。スクリーンショットは無関係な個人情報や機密情報をキャプチャする可能性があります。ウェブスクレイピングも、敏感なデータを収集したり、アクセス制御と相互作用したりすることがあります。どちらのアプローチも、最低限の特権、データ最小化、セキュアな秘密の取り扱い、保持制限、監査トレイルが必要です。
その 一般データ保護規則 は、個人データの収集、保存、使用、および開示を処理活動として扱います。目に見えるフィールドは、オートメーションによってHTMLまたはピクセルから読み取られたからといって、その個人データの地位を失うわけではありません。
画面スクレイピングを選択するタイミング
- ソースはウェブベースではありません。 端末、デスクトップアプリケーション、仮想デスクトップ、またはリモートセッションには、適切なサポートされたインターフェースがありません。
- 視覚的結果が必要な証拠です。 レイアウト、チャート状態、または画面上のプレゼンテーションはユースケースに関係しています。
- コンテンツはピクセルとしてのみ存在します。 画像、キャンバス、スキャン、またはビデオフレームにはOCRまたはコンピュータビジョンが必要です。
- 制御されたレガシーブリッジが必要です。 認可されたプロセスは、置き換えが非現実的な間に古いシステムと新しいシステムを接続しなければなりません。
ウェブスクレイピングを選択するタイミング
- ソースは公共のウェブサイトです。 HTML、リンク、属性、およびページレスポンスには必要なレコードが含まれています。
- 発見が重要です。 ワークフローは、URL、ページネーション、サイトマップ、または多くのページにわたる構造化されたナビゲーションに従う必要があります。
- セマンティック構造が利用可能です。 DOMの関係、メタデータ、またはレスポンスは、ピクセルよりも強いフィールド識別を提供します。
- スケールと正規化された出力が重要です。 ジョブには繰り返し可能なレコード、出典、重複排除、スケジュールされた更新が必要です。
共有された法的および倫理的な質問
ラベルのいずれも合法性を決定するものではありません。認可、アクセス制御、条件、著作権、プライバシー、データベースの権利、リクエストの行動、および下流の使用を確認します。その ロボット排除プロトコル は、ウェブリソースに対するクローラの指示を標準化しますが、認可メカニズムではありません。非ウェブの画面スクレイピングには独自の契約、ライセンス、資格情報、および職場または業界の規則があります。
明示された目的に必要なものだけを収集します。明確な承認のない制限されたまたはプライベートなソースは避けてください。ボリュームを相応に保ち、データを保護し、出典を記録し、適用可能な場合は削除およびインシデントプロセスを提供します。影響の大きいまたは不確定なプロジェクトには、資格のある助言を求めてください。
実用的な意思決定フレームワーク
- ソースがウェブ、デスクトップ、端末、画像、文書、またはリモートディスプレイであるかどうかを特定します。
- 最も構造化されたものから最も視覚的なものまで、認可されたインターフェースをリストします。
- 正確なフィールド、視覚的証拠、新鮮さ、スケール、および許容可能なエラーを定義します。
- 変化の感度、検証の努力、資格情報のリスク、およびメンテナンスを見積もります。
- 主な抽出レイヤーを1つ選択し、派生または視覚的なフォールバックにはラベルを付けます。
- レイアウト、ロケール、空のフィールド、遅いレンダリング、重複、およびソースの変更をテストします。
- 権限、出典、ルールのバージョン、および例外の所有権を記録します。
ウェブサイドのScrapelessを使用する
Scrapelessスクレイピングブラウザ ナビゲーションやJavaScriptを必要とするブラウザレンダリングされた公開ページに適しています。ワークフローはページと対話し、その後デフォルトのOCRではなく意味的DOM状態から抽出できます。画面上の結果自体が重要な場合、視覚的キャプチャは利用可能です。
ブラウザのランタイム、ページ数、セッションの動作、下流のパースを別々に計画します。レビュー Scrapelessの価格設定 期待される取得量を考慮した。メンテナンスコストには、セレクターテスト、ビジュアルチェック、データ検証、ソースポリシーレビューも含める必要があります。
評価チェックリスト
フィールドの精度、レコードの完全性、偽の一致、見逃したレコード、レイテンシ、ランタイムコスト、変化への耐性を測定します。OCRの場合、フォント、スケール、コントラスト、言語をテストします。DOMパースの場合、テンプレートのバリエーションとクライアントレンダリングをテストします。どちらについても、代表的な証拠を保持し、抽出されたアイデンティティを誤りの結果が高い独立したソースと比較します。
結論
画面スクレイピングとウェブスクレイピングは重複していますが、異なる境界を説明します。画面スクレイピングは多くの種類のシステム間で人間に向けたプレゼンテーションを読み取ります。ウェブスクレイピングは、レンダリングされたブラウザから生のHTMLまでさまざまなウェブリソースから抽出します。必要な意味を保つ最も豊かな承認されたレイヤーを選択し、視覚的キャプチャをデフォルトではなく意図的な手法として扱ってください。
レンダリングされたウェブページから抽出する準備はできましたか?
ワークフローのウェブ側にはScrapeless Scraping Browserを使用し、意味的抽出、視覚的証拠、検証を明確に分離します。
無料スタート →FAQ
画面スクレイピングとウェブスクレイピングの主な違いは何ですか?
画面スクレイピングは人間に向けたプレゼンテーションを読み取ることによって定義され、ウェブスクレイピングはウェブリソースから抽出することによって定義されます。画面スクレイピングは非ウェブシステムをターゲットにできます。ウェブスクレイピングは可視画面を使用せずに構造化されたウェブデータを読み取ることができます。
1つのワークフローは画面スクレイピングとウェブスクレイピングの両方になれますか?
はい。レンダリングされたウェブインターフェイスを読み取るブラウザボットは両方の説明に当てはまります。信頼性を決定するために、値がDOM要素、ネットワーク応答、アクセシビリティ状態、またはピクセルから来たかを記録します。
どの方法がより正確ですか?
安定した承認されたレイヤーからの構造化された抽出は、ピクセルOCRよりも検証が容易ですが、精度はソースやテストに依存します。安定した端末フィールドは不安定なHTMLを上回ることができ、どちらの方法もデータを静かに誤読する可能性があります。
どの方法がより速いですか?
HTMLまたは構造化された応答のウェブパースは、レンダリングやOCRよりも通常は速いです。ブラウザのインタラクションと視覚分析はランタイムを追加しますが、クライアントレンダリングやピクセル専用コンテンツには必要な場合があります。
画面スクレイピングとウェブスクレイピングは合法ですか?
どちらも承認、アクセス制御、条件、権利、プライバシー、行動、管轄権、使用によって合法または違法であり得ます。技術的なラベルは合法性を決定しません。
ウェブページにOCRを使用すべきですか?
必要な情報が本当にピクセルにのみ存在する場合(キャンバスや画像コンテンツなど)はOCRを使用してください。それらの承認されたレイヤーが同じ意味を持っている場合は、DOM、アクセシビリティ、または構造化された応答データを優先してください。