ブラウザエージェントとは?
Scrapeless Scraping Browserは、ブラウザエージェントが標準の自動化とエージェント向けのインターフェースを介して制御できる管理されたブラウザセッションを提供します。
TL;DR
- ブラウザエージェントは、ウェブ上の認知-行動ループを閉じます。 ページを観察し、行動を選択し、ブラウザツールを介して実行し、新しい状態を読み取り、目標または安全境界に達するまで停止します。
- 言語モデルは1つのコンポーネントであり、全体のエージェントではありません。 動作するシステムにはツール、状態、権限、エラーハンドリング、検証、明確な停止条件も必要です。
- ブラウザエージェントは固定スクリプトとは異なります。 スクリプトは事前定義された手順に従いますが、エージェントは現在のページ状態から手順を選択し、パスが変わると適応できます。
- 観察の質は行動の質を制御します。 スクリーンショット、DOMデータ、アクセシビリティツリー、ネットワーク応答、抽出されたテキストは、異なる証拠と異なる失敗モードを露呈します。
- 重要な行動には明示的な承認が必要です。 公開ページを読み、認証情報、購入、アカウントの変更を提出することは、異なる権限レベルに属します。
ブラウザエージェントの定義
ブラウザエージェントは、ブラウザをアクション環境として利用するソフトウェアシステムです。目標が与えられると、現在のウェブページを観察し、次のステップを考え、ブラウザ操作を呼び出し、その結果を検査します。タスクが完了する、進むことができない、またはポリシー境界に達するまで、このサイクルは続きます。エージェントは、検索、ナビゲート、クリック、入力、スクロール、情報の抽出、ファイルのダウンロード、または人に敏感なステップの承認を求めることができます。
ブラウザエージェントは、ブラウザボタンを持つチャットモデルよりも広範です。モデルは決定を提案しますが、周囲のアプリケーションはツール、認証情報、メモリ、ネットワークアクセス、許可されたドメイン、予算、ログ、承認を制御します。 WebArena研究 は、現実的で再現可能なウェブタスクを説明し、機能的な完了を評価します。これは、生成された計画がもっともらしいかどうかよりもエージェントのパフォーマンスをよりよく定義しています。
ブラウザエージェントは検索システムとも異なります。検索は候補情報を取得します。ブラウザエージェントは結果を追い、目的地をレンダリングし、ページ状態と対話し、複数のサイトで証拠を収集できます。検索はエージェント内の1つのツールかもしれませんが、検索は完全な制御ループを提供しません。同じ区別が抽出器にも当てはまります:抽出器はページからデータを読み取りますが、エージェントは次にどのページとどのアクションを実行すべきかを決定します。
この用語は、ウェブエージェント、コンピューター使用エージェント、およびブラウザ自動化エージェントと重なります。ウェブエージェントは、視覚ブラウザを開かずにHTTP APIを呼び出すことができます。コンピューター使用エージェントは、ウェブ以外のデスクトップアプリケーションを制御できます。ブラウザエージェントは、作用する環境によって定義されます:ブラウザタブ、ナビゲーション履歴、ページコンテンツ、ブラウザストレージ、ダウンロード、およびウェブインタラクション。
ブラウザエージェントの動作
ループは目標と制約されたタスク状態から始まります。「公式な仕様を3つ見つけ、そのリンクとともに要約する」は出力形式と証拠の要件を提供します。「このトピックを調査する」には自然な終わりがなく、オープンエンドのブラウジングを促します。良いオーケストレーションは、目標を受け入れ基準に変え、到達可能なドメインやアクションタイプを制限し、最終回答に残るべき証拠を記録します。
観察は複雑なページをモデルが読み取れる証拠に変換します。ビジュアルエージェントは、ピクセルとマークされたコントロールを受け取るかもしれません。セマンティックエージェントは、アクセシブルな役割、名前、DOMテキスト、および要素参照を受け取るかもしれません。データ指向のエージェントは、ネットワーク応答や構造化されたページのメタデータを検査することができます。 W3C WebDriver仕様 は、ブラウザ自動化で使用されるコマンドモデルを示していますが、現代のエージェントスタックはしばしばプロトコルレベルの制御をより高レベルの観察と組み合わせます。
計画は次の許可されたアクションを選択します。一部のシステムはモデルに1度に1ステップを要求します;他のシステムは短い計画を作成し、各観察の後にそれを修正します。ワンステップ制御は、コントローラが提案されたすべてのクリック、ターゲット、値をチェックできるため、検証が容易です。長い計画はモデル呼び出しを減らすかもしれませんが、ページが予期しない分岐を取ると、すぐに陳腐化します。
実行は環境を変え、検証がループを閉じます。成功したクリックは、意図したページが読み込まれたことの証明ではありません。エージェントは、結果のURL、可視状態、または構造化された確認を検査するべきです。フォーム提出は、フォームを埋めることとは区別されるべきであり、購入は最終レビュー画面に達することとは区別されるべきです。この分離は、人間の承認の場を作ります。
ブラウザエージェント対ブラウザ自動化スクリプト
両方のシステムはブラウザを操作しますが、次のアクションがどのように選択されるか、どれだけの不確実性を吸収できるかが異なります。
| 次元 | 主要な意味 | 一般的な間違い |
|---|---|---|
| 制御ロジック | エージェントは現在の観察からアクションを選択します。 | すべてのモデル駆動ブラウザワークフローをエージェントと呼ぶこと、各ステップが固定されている場合でも。 |
| 適応 | ページ状態や使用可能なコントロールが変更された場合、パスも変更される可能性があります。 | 適応がセレクタ、検証、またはテストの必要性を取り除くと仮定する。 |
| 証拠 | エージェントは結果を支えるソースページと状態遷移を保持します。 | 導出に使用されたページや観察なしで回答を返すこと。 |
| 最適な適合 | ルートが安価に列挙できない可変なマルチステップタスク。 | 短い決定論的スクリプトがより適切に処理できる安定した一括アクションにエージェントを使用すること。 |
| リスク | 誤解は実際のブラウザアクションに変わる可能性があります。 | 流暢な説明を承認または実行の証明と見なす。 |
一般的なブラウザエージェントのユースケース
ブラウザエージェントは、目的地がインタラクティブであり、ルートがタスク中に遭遇するページ状態に依存する場合に最も便利です。
証拠に基づく研究
エージェントは情報を検索し、主要な情報源を開き、主張を抽出し、レビュアーが検査できるリンクを返します。
操作ワークフロー
エージェントはダッシュボードやフォームを移動し、変更を準備し、重大な提出の前に一時停止します。
ウェブデータ収集
エージェントはページネーションを発見し、動的コンテンツをレンダリングし、構造化された記録をストレージまたは分析段階に渡します。
品質保証
エージェントはタスクフローを探索し、スクリーンショットやコンソールの証拠を記録し、期待される動作が逸脱する場所を報告します。
生産ブラウザエージェントのコンポーネント
ツールの契約は型付けされ、狭くなければなりません。ナビゲーションツールにはURLと許可リストのチェックが必要です。クリックツールには現在の要素の参照が必要です。テキスト入力ツールにはターゲットと値の分類が必要であり、秘密がより強力な管理を受けるようになります。 モデルコンテキストプロトコル仕様 は、クライアントとサーバーが呼び出し可能なツールを記述するための標準的な方法を提供しますが、スキーマは依然としてアプリケーションレベルの権限を必要とします。
メモリは、承認された事実と現在のタスク状態を保持し、ブラウジング履歴全体を次のプロンプトに変えないようにする必要があります。作業メモリは、アクティブな目標、訪問したURL、抽出した事実、および保留中の承認を保持する場合があります。耐久メモリは、アプリケーションが保持する理由と権限を持つ情報のみを格納する必要があります。ブラウザのクッキーとログイン状態は、物語のタスクメモリから分離して扱われるべきです。
ブラウザ層は、レンダリング、セッション、ダウンロード、ストレージ、およびプロトコルへのアクセスを提供します。管理されたクラウドブラウザはローカルのブラウザメンテナンスを取り除くことができますが、エージェントが何をするかを決定することはありません。ホストシステムは、ドメイン制限、資格情報の境界、アクションクラス、監査ログ、および承認ポリシーをモデルプロンプトの外に保持し、これらのルールが会話の助言として再解釈されないようにする必要があります。
評価には機能チェックが必要です。研究タスクは、要求された事実が保存された情報源によって支持される場合に合格します。フォームワークフローは、フィールドが意図した値を含んでおり、システムが要求された境界で停止する場合に合格します。スクレイパーは、出力スキーマが完全であり、ページ証拠に追跡可能である場合に合格します。視覚的な類似性や確信のある最終文だけでは不十分です。
リスクと失敗モード
ウェブページには信頼できない指示が含まれています。ページ上のテキストは、エージェントにタスクを無視する、データを開示する、または別のドメインを訪問するように指示することがあります。コントローラーは、ページコンテンツを証拠として扱うべきであり、優先度の高いポリシーとは見なすべきではありません。ツールの権限、秘密のアクセス、および許可された宛先は、モデルが読み取るテキストの外部で強制されなければなりません。
動的状態は、タイミングやアイデンティティの問題を引き起こします。ロケータは、ナビゲーションや再レンダリング後に異なる要素を指し示すことがあります。古いスクリーンショットは、存在しないコントロールを説明できる可能性があります。要素の参照は観察と共に期限切れとなるべきであり、アクションは現在のURL、フレーム、およびページの状態に対して検証されるべきです。高影響の操作は、新しいキャプチャを必要とする。
エージェントもループで時間を無駄にすることがあります。明確なステップ予算、時間予算、および停止条件により、失敗が可視化されます。システムは「達成できなかった目標」と「証拠なしに達成された目標」、および「承認待ちでブロックされている」を区別する必要があります。これらの結果は異なる次のステップにつながり、一般的な成功フィールドに統合されるべきではありません。
プライバシーと承認は、全体のチェーンに適用されます。ブラウザエージェントは、個人データ、認証されたページ、アップロードされた文書、または支払いコントロールに遭遇する可能性があります。タスクが要求するものだけを収集し、可能であれば、モデルに送信する前に機密性のある観察を修正し、ブラウザがコントロールに到達できるからといって提出または開示する権限を推測してはいけません。
ブラウザエージェントの評価方法
タスクの成功から始めますが、成功を外部でチェック可能な状態として定義します。ショッピングタスクは、支払い後ではなく、レビュー画面で終了する可能性があります。研究タスクは、固定数の主要な情報源が必要です。データタスクは、スキーマ、出所フィールド、および重複処理を必要とする場合があります。評価者は、同じモデルに成功したかどうかを尋ねるのではなく、環境やアーティファクトを検査するべきです。
結果を知覚、意思決定、行動、および検証に分割します。知覚は、観察に必要なコントロールまたは事実が存在したかどうか尋ねます。意思決定は、選択された次のステップがタスクと一致していたかどうかを尋ねます。行動は、ブラウザが意図された操作を実行したかどうかをチェックします。検証は、新しい状態が期待される条件を満たしているかどうかを確認します。この分解は、失敗を行動可能にします。
コストと監視も測定します。ブラウザのステップ、モデルの呼び出し、ウォールタイム、繰り返しの観察、人間の承認、未解決の状態を数えます。多くの不必要なアクションでタスクを完了するシステムは、短いスクリプトよりも適していない場合があります。明確な境界で承認を要求するシステムは、最大の自律性を追求するシステムよりも安全で使いやすい場合があります。
再現可能なテストサイトと限られたライブサイトのチェックの両方を使用します。再現可能な環境は回帰を比較可能にします。ライブサイトはレイアウトの変動、認証の境界、および実際のレンダリング動作を明らかにしますが、それらの状態は時間とともに変化します。タスクの定義、ビューポート、ロケール、モデル、ツールのバージョン、および各結果を説明するために必要な証拠を保存します。
結論
ブラウザエージェントは、ウェブの観察をブラウザのアクションに変換する制御されたループです。その価値は、ページの状態に適応し、マルチステップの目標にわたって検索、ナビゲーション、インタラクション、および抽出を調整することから来ています。このモデルは推論を提供し、アプリケーションはツール、メモリ、ポリシー、および検証を提供します。
信頼できるブラウザエージェントは不確実性を可視化します。証拠を保持し、古い参照を期限切れにし、アクションを制限し、重要な変更の前に承認を求めます。その設計は、エージェントが支援なしで実行できるクリック数よりも重要です。
ブラウザエージェントワークフローの構築は準備ができましたか?
Scrapeless Scraping Browserを使用して、アプリケーションが計画、証拠、および承認の制御を維持しながら管理されたブラウザセッションを行います。
今日サインアップして、 $5の無料クレジットを獲得 — クレジットカードは不要です.
あなたの$5クレジットを請求する →よくある質問
ブラウザエージェントの最もシンプルな定義は何ですか?
ブラウザエージェントは、ウェブページを観察し、ブラウザアクションを選択して実行し、新しい状態を評価し、定義された目標または停止条件に達するまで繰り返すソフトウェアです。
ブラウザエージェントはウェブスクレイパーと同じですか?
いいえ。スクレイパーはデータの抽出に重点を置いています。ブラウザエージェントはスクレイプすることもできますが、ナビゲート、インタラクション、状態の比較、および次のアクションやソースを決定することもできます。
ブラウザエージェントはスクリーンショットが必要ですか?
いいえ。エージェントはスクリーンショット、DOMデータ、アクセシビリティツリー、ネットワーク応答、または混合観察を使用できます。最良の表現は、ページとタスクに依存します。
固定スクリプトがエージェントよりも優れているのはいつですか?
固定スクリプトは通常、安定した反復的な高ボリュームのワークフローで既知のステップに対してより良いです。エージェントは、経路が異なり、ページの理解が次のアクションを決定する場合に便利です。
敏感なブラウザアクションはどのように処理すべきですか?
モデルの外部で権限を強制し、資格情報をスコープ化し、現在の状態に対してターゲットを検証し、購入、提出、アカウント変更、または敏感なデータの開示の前に明示的な人間の承認を求める必要があります。