ブログに戻ります

2026年のコンピュータ使用エージェントのためのブラウザインフラストラクチャ

Daniel Kim
Daniel Kim

Lead Scraping Automation Engineer

27-Aug-2026

TL;DR:

  • コンピュータ使用エージェントは、クリックやスクリーンショットツールだけでなく、ブラウザランタイムが必要です。 ランタイムはセッションを隔離し、状態を管理し、タイムアウトを適用し、同時実行を制御し、証拠を保存しなければなりません。
  • セッションのIDは明示的であるべきです。 一時的な研究、認証された作業、そして人間の引き継ぎは、異なるクッキー、ストレージ、保持、およびクリーンアップポリシーを必要とします。
  • 観測可能性は正確さの一部です。 スクリーンショット、アクションログ、コンソール出力、ネットワークイベント、リプレイにより、失敗したり不安定な実行を診断可能にします。
  • Scrapeless MCP と Agent Browser は、エージェントのための管理されたウェブレイヤーを提供します。 それは、エージェントのオーケストレーションコードをタスクに集中させながら、検索、ブラウザアクション、抽出、および検証を分離することができます。

デモ用のコンピュータ使用エージェントは、ページを開き、スクリーンショットを検査し、ボタンをクリックできます。生産エージェントは、ユーザーを混ぜたり、状態を漏らしたり、証拠を失ったり、ブラウザプロセスを残したりすることなく、同じ作業を繰り返さなければなりません。

そのギャップはブラウザインフラストラクチャです。モデルはアクションを選択しますが、実行層はセッションを作成し、観測を公開し、制限を適用し、イベントを記録し、環境を解体します。

コンピュータ使用ブラウザアーキテクチャ

レイヤー 責任 欠如時の失敗
プランナー 次のツールアクションを選択 ループまたは誤った目標を追求
ブラウザセッション タブ、クッキー、ストレージ、およびビューポートを保持 ユーザー状態が混ざったり消えたりする
観測アダプタ スクリーンショット、DOM、アクセシビリティ、およびエラーを返す エージェントが不完全な状態に基づいて行動する
ポリシーレイヤー ドメイン、アクション、秘密、および承認を制限 エージェントが権限を超える
キューとランタイム セッション、タイムアウト、回復、およびクリーンアップをスケジューリング キャパシティがバーストの下で崩壊する
観測可能性 アクション、アーティファクト、および成果を保存 失敗を再構築できない

1. すべてのセッションを隔離する

各ユーザーまたはタスクは、別々に所有されたブラウザコンテキストを受け取る必要があります。クッキー、ローカルストレージ、キャッシュ、ダウンロード、クリップボードデータ、開いているページは、関連していない実行によって共有される周辺状態になってはいけません。

Amazon AgentCore Browserセッションのドキュメントは、同時セッションが別々の状態と環境を保持するセッションベースのモデルを説明しています。実装はプラットフォームによって異なりますが、要件は一般的です:セッションの境界はシステム設計で明示されるべきです。

3つのポリシーを定義します:

  • 一時的: 研究または公開ブラウジングタスクが終了したときにすべての状態を破棄します。
  • 永続的だがスコープ付き: 1人のユーザーと1つのワークフローのために認可されたプロファイルを保持します。
  • 引き継ぎ: エージェントが続行する前に、人物が同じセッションを検査または一時的に制御できるようにします。

永続性は自動的に良いわけではありません。それはセッションの価値を高め、誤ったルーティングや過剰なアクセスによって引き起こされる損害を増加させます。

2. 身元と秘密を別々の入力として扱う

パスワード、セッションクッキー、またはAPIトークンをプロンプトに置かないでください。実行時に秘密ストアまたは承認された資格情報メカニズムを通じて注入します。プランナーは必要な成功または失敗の状態だけを受け取るべきです。

ドメインアロウリストとアクションポリシーはセッションと共に移動する必要があります。注文ポータルを表示する権限を持つサポートエージェントは、同じ認証されたプロファイルを持って任意のサイトをブラウジングする権限を引き継ぐべきではありません。

高影響なアクション—購入、公開、削除、返金、または提出—の前に、一時停止し、意図されたアクションと関連するフィールドを承認のために提示します。ブラウザは明示的な権限がない限り、草案の推奨を外部のコミットメントに変えてはなりません。

3. 適切な観測サーフェスを選択する

コンピュータ使用モデルはしばしばスクリーンショットと座標を消費します。DOMベースのツールは要素とセレクタを使用します。アクセシビリティツリーはコンパクトな意味構造を提供します。ネットワークレスポンスは、最もクリーンな構造化データを含むことがあります。

どのサーフェスもすべてのページに対して十分ではありません。堅牢なアダプタは次のことを提供できます:

  • 視覚レイアウトとキャンバスコンテンツのためのスクリーンショット;
  • ラベルと安定したターゲットのためのDOMまたはアクセシビリティ情報;
  • 現在のURL、タイトル、ビューポート、およびタブID;
  • コンソールとナビゲーションのエラー;
  • タスクが検証を必要とする場合の選択されたネットワーク証拠。

アダプタは観測時間とページIDをマークするべきです。ナビゲーションの後に古いスクリーンショットに基づいて行動することは、座標エラーの一般的な原因です。

4. 明示的なアクション契約を構築する

ブラウザアクションは型付けされ、境界が設定されるべきです:URLを開く、ターゲットをクリックする、フィールドに記入する、領域をスクロールする、オプションを選択する、証拠をキャプチャする、またはセッションを終了する。それぞれのアクションは、文章の印象ではなく、構造化された結果を返すべきです。
Playwrightロケーターガイダンスでは、役割、ラベル、テキスト、プレースホルダーなどのユーザー向け属性を推奨しています。これらのターゲットは通常、深いCSSパスよりも安定しており、監査ログで説明しやすいです。

アクションの後は、状態の変化を確認してください。コマンドが返されたからといってクリックが成功したわけではなく、期待されたURL、見出し、ダイアログ、フィールド値、またはネットワーク結果が表示されたときに成功したことになります。

Scrapelessでスクレイピングを開始する

Scrapelessであなたのウェブスクレイピングと自動化のワークフローをパワーアップ!
今日サインアップして5ドルの無料クレジットをゲット — クレジットカードは不要

今すぐScrapelessダッシュボードで無料クレジットを請求してください。

5. タイムアウト、再試行、および同時実行の管理

コンピュータ使用のワークロードは、バースト的で変動的です。一つのタスクは単一のナビゲーションの後に完了する場合がありますが、別のタスクは人が確認している間に認証されたセッションを保持する場合があります。そのため、キャパシティプランニングは、タスク数だけでなく、アクティブセッション時間とピークの同時実行を使用するべきです。

セッションの寿命、ナビゲーション、アクション、アイドル時間、キュー待機に対して別々の制限を使用してください。単一のグローバルタイムアウトはあいまいな失敗を引き起こします。回復は失敗した境界のみを再起動する必要があります:一時的なロードエラーの後にリードを再試行しますが、既に成功したかどうかを確認せずに結果的な提出を繰り返さないでください。

同時実行制御は、ユーザー、ワークフロー、およびプラットフォームレベルに存在します。これにより、一つのループエージェントがブラウザプール全体を消費するのを防ぎます。常にページとコンテキストを最終的なクリーンアップパスで閉じてください。

6. 実行を観測可能かつ再生可能にする

最低限、セッションID、ユーザーまたはジョブのスコープ、タイムスタンプ、URL、アクション、結果、重要な境界でのスクリーンショット、最終ステータス、失敗カテゴリーを保持してください。長期保存の前に、秘密情報やセンシティブなフィールドを削除してください。

AgentCoreの録画および再生ドキュメントでは、DOMの変更、ユーザーアクション、コンソールメッセージ、ブラウザプロトコルイベント、ネットワークイベントが有用な再生証拠としてリストされています。小さなシステムではすべての表面を保存しない場合がありますが、エージェントが見たことと行ったことを説明するのに十分な情報を保持すべきです。

可観測性は評価のサポートも提供します。完了率、人間の引き継ぎ率、完了したタスクあたりのアクション、タイムアウトカテゴリー、および不安全アクションブロックをプランナーとブラウザアダプターの各バージョンで比較してください。

7. 所有権を壊さずに人間の引き継ぎを追加する

人間の引き継ぎは既存のセッションに接続すべきであり、クッキーを別の管理外ブラウザにコピーすべきではありません。システムは現在ページを制御している人を示し、同時に相反するアクションを防ぐ必要があります。

引き継ぎの開始と終了を記録し、その後エージェントに新しい観察を返してください。人が制御している間にページが同じURLに留まっていたり、フィールドが以前の値を保持していたりすることを決して仮定しないでください。

8. Scrapeless MCPとエージェントブラウザを接続する

Scrapeless Scraping Browserは管理されたブラウザ実行を提供し、Scrapeless MCPは互換性のあるエージェントにウェブ機能を公開します。有用な設計は異なるツールのシーケンスです:

  1. 候補ページを検索または発見する。
  2. 選択したページを隔離されたブラウザセッションで開く。
  3. 限られたブラウザ操作で観察し、行動する。
  4. 必要なフィールドとソースURLを抽出する。
  5. 結果をタスクの受け入れ条件と照合する。
  6. アーティファクトを保存し、セッションを閉じて構造化された結果を返す。

この分離により、失敗が明確になります。オーケストレーターは、発見が誤ったページを見つけたのか、ブラウザが状態に到達できなかったのか、抽出がフィールドを見逃したのか、検証が結果を拒否したのかを判断できます。

AIエージェントハーネスガイドでは、検索、ブラウザ、状態、および検証ツールが広範なエージェントループにどのように適合するかを説明しています。ピーク同時実行と平均アクティブセッションの持続時間を見積もった後に、Scrapelessの価格を確認してください。

生産準備チェックリスト

  • 各セッションには所有者、目的、保持ポリシー、クリーンアップパスがあります。
  • 認証されたプロファイルは一人のユーザーと認可されたワークフローにスコープされています。
  • 秘密情報は制御されたランタイムメカニズムを通じて入力され、プロンプトからは入りません。
  • ドメインおよび高影響アクションには明示的なポリシーチェックがあります。
  • 観察にはページの識別子とタイムスタンプが含まれます。
  • アクションは構造化された結果を返し、状態の変化を検証します。
  • タイムアウトは、キュー、ナビゲーション、アクション、アイドル、およびライフタイムごとに分かれています。
  • リトライは冪等であるか、再試行前に完了を確認します。
  • スクリーンショットおよびログは、データポリシーに従ってマスキングされます。
  • 人は引き継ぎを行い、コントロールを解除し、監査可能なトランジションを残すことができます。

結論

コンピュータ使用の品質は、モデルがクリックを選択する能力以上の要素に依存しています。セッションの隔離、スコープ付きアイデンティティ、アクション契約、バウンドされたキャパシティ、観察可能な実行、および制御されたハンドオフが、システムが本番環境で安全に操作できるかどうかを決定します。Scrapeless MCPとAgent Browserは、エージェントが計画、証拠、検証済みの結果に集中できるよう、これらの要件の周囲に管理されたウェブレイヤーを提供します。

FAQ

Q: コンピュータ使用エージェントのブラウザインフラストラクチャとは何ですか?

それは、ブラウザセッションを作成および隔離し、観察とアクションを提供し、キャパシティとタイムアウトを管理し、ポリシーを施行し、証拠を保存し、リソースをクリーンアップするランタイムです。

Q: なぜコンピュータ使用エージェントはセッションの隔離が必要なのですか?

隔離は、クッキー、ストレージ、ページ、ダウンロード、および秘密がユーザーやタスク間で越境するのを防ぎます。また、所有権とクリーンアップをテスト可能にします。

Q: エージェントはスクリーンショットを使用するべきですか、それともDOMを使用するべきですか?

ページとタスクに一致する表面を使用してください。スクリーンショットは視覚的状態をキャプチャし、一方でDOMおよびアクセシビリティデータは意味的ターゲットを提供します。多くの本番システムはそれらを組み合わせています。

Q: ブラウザセッションは何を記録すべきですか?

識別子、タイムスタンプ、URL、アクション、結果、重要なスクリーンショット、エラー、および最終ステータスを記録します。診断のために必要な場合はコンソールやネットワーク証拠を追加し、機密データはマスキングします。

Q: いつ人間が引き継ぐべきですか?

あいまいな状態、本人を必要とする認証ステップ、ポリシーの例外、または重要なアクションには引き継ぎを使用してください。コントロールの所有権と自動化への復帰は明示的でなければなりません。

Scrapelessでは、適用される法律、規制、およびWebサイトのプライバシーポリシーを厳密に遵守しながら、公開されているデータのみにアクセスします。 このブログのコンテンツは、デモンストレーションのみを目的としており、違法または侵害の活動は含まれません。 このブログまたはサードパーティのリンクからの情報の使用に対するすべての責任を保証せず、放棄します。 スクレイピング活動に従事する前に、法律顧問に相談し、ターゲットウェブサイトの利用規約を確認するか、必要な許可を取得してください。

最も人気のある記事

カタログ