セット・オブ・マーク プロンプティングとは?ビジョンモデルのためのガイド

セット・オブ・マーク プロンプティングとは?

スクレイプレス スクレイピングブラウザは、レンダリングされたページとスクリーンショットをビジュアルブラウザエージェントのワークフローに供給できるマネージドブラウザランタイムを提供します。

要約

  • セット・オブ・マーク プロンプティングは、位置を短いラベルに変換します。 ビジョンシステムは、意味のある画像領域に数字や文字を重ねて、マルチモーダルモデルがピクセル座標を発明することなくオブジェクトを指し示すことができるようにします。
  • この技術は、知覚自体ではなくコミュニケーションを改善します。 セグメンテーションやインターフェースパースリングが領域を提案し、マークはそれらの中から選択するためのコンパクトな語彙をモデルに提供します。
  • ブラウザエージェントは、言語をコントロールに接続するために SoM を使用します。 プロンプトは、モデルにマーカー 12 を選択するように要求し、その後自動化レイヤーがそのマーカーをボタンや入力領域にマッピングします。
  • マークは有用な視覚証拠を隠すこともあります。 混雑したラベル、貧弱な領域提案、テキストの上に配置されたオーバーレイは、精度を低下させる可能性があるため、マークされた画像には独自の品質チェックが必要です。
  • SoM はいくつかのうちの一つのグラウンディングオプションです。 DOM ロケーター、アクセシビリティツリー、OCR、スクリーンショット、および座標予測は、それぞれ異なるインターフェース条件に適合します。

セット・オブ・マーク プロンプティングの定義

セット・オブ・マーク プロンプティングは、画像の候補領域に異なる、発話可能なマーク(通常は数字または文字)を配置する視覚プロンプティング手法です。マルチモーダルモデルは注釈付き画像を見ることで、要求されたオブジェクトに対応するマークで応答します。この手法は論文で紹介されました。 セット・オブ・マーク プロンプティングは、GPT-4Vでの特別なビジュアルグラウンディングを解き放ちます, オフ・ザ・シェルフのセグメンテーションモデルが画像を分割し、オーバーレイがそれぞれの領域を名前を付けやすくします。

重要な問題は視覚的グラウンディングです。モデルは「アカウントメニューをクリック」の文を理解し、スクリーンショット内のメニューを認識することができるかもしれませんが、ターゲットがどこにあるかを示す信頼できる方法がまだ必要です。「右上隅の近くのアイコン」のような自然言語は、複数のアイコンが近接している場合には曖昧になります。マーカーは一時的な識別子を作成します:モデルは「17」を返し、コントローラーは17を保存された領域のジオメトリに関連付けることができます。

SoM は、基盤となるページを変更せず、新しいモデルを訓練せず、自動化プロトコルを定義するものではありません。モデルに表示される観察を変えます。その違いは重要です。なぜなら、チームは推論時にオーバーレイを追加または削除することができるからです。元の研究は、SoM を訓練不要のプロンプティング手法として提示し、公共の Microsoft SoM 実装 はマスクを作成し、マークをレンダリングするために使用される別々のステージを示しています。

マークされたスクリーンショットは、コンピュータビジョンと言語推論の間の小さなインターフェースです。ビジョン側は選択可能な領域を提案します。レンダリング側はユニークなラベルを割り当てます。言語モデルは画像とそれらのラベルの上で推論します。アクションレイヤーは、選択されたラベルを座標または構造化された要素参照に戻します。各ステージは、エージェント全体を一つの不透明な結果として扱うのではなく、個別に評価できます。

セット・オブ・マーク プロンプティングの仕組み

最初のステージは候補領域を生成します。自然の画像上では、セグメンテーションモデルがさまざまな詳細レベルでオブジェクトマスクを生成します。ウェブページでは、候補領域が検出されたコントロール、OCRボックス、アクセシビリティノード、DOMジオメトリ、またはその組み合わせから来る場合があります。この選択は、モデルが選択できる内容を決定します。領域生成器が小さな開示矢印を見逃すと、後でターゲットを回復するマーカープロンプトは存在しません。

第2のステージでは、領域をフィルタリングして順序を付けます。重なり合ったマスクは同じオブジェクトに対していくつかのラベルを生成する可能性がありますが、小さな装飾的な形状がスクリーンショットに無関係な番号を氾濫させる可能性があります。実用的なシステムは、サイズのしきい値の下の領域を削除し、重複をマージし、可能性の高いコントロールを優先し、一つの観察の間ラベルを安定させます。安定性は、モデルが後の推論ステップでラベルを参照する際のミスを減少させます。

第3のステージでは、各領域の近くまたは内部に高コントラストのラベルを描きます。ラベルは、オブジェクトを選択するために必要な証拠を覆うことなく読める状態を維持しなければなりません。例えば、チェックアウトボタンには、他のボタンと区別する価格や状態テキストが含まれているかもしれません。そのテキストの上にマーカーを配置すると、空間的な明瞭さがセマンティックロスと引き換えになります。良いレンダラーは空白エリアを選択したり、ラベルをオフセットしたり、元の画像とマーク付き画像の両方を提供します。

最終ステージでは、モデルに制約された回答を求め、それを検証します。コントローラーは、制限のない段落ではなく、1つのマーカー識別子とアクションタイプを受け入れる場合があります。選択された識別子は、クリックが発生する前に現在の観察と照合されます。スクリーンショットの後にページが変更された場合、コントローラーは新たな観察を行う必要があります。古いフレームからの正しいラベルが、新しい状態で間違ったコントロールを指し示す可能性があります。

SoMと他のグラウンディング手法の比較

セット・オブ・マーク プロンプティングは、その出力、依存関係、および失敗モードが近接する技術から分離されるときに最も理解しやすくなります。

次元主要な意味一般的な間違い
参照形式保存された領域に結び付けられた短い可視マーカー。マーカー自体を永続的な要素IDとして扱うこと。
領域ソースセグメンテーション、OCR、DOM ジオメトリ、アクセシビリティデータ、または検出されたコントロール。SoMが領域提案ステージなしで全てのターゲットを発見することを仮定すること。
最適な適合状況自然言語の位置記述が曖昧な密集した視覚シーンやインターフェース。安定したセマンティックロケーターが既に存在するシンプルなページにラベルを追加すること。
主なリスクオーバーレイの混乱や古いジオメトリが自信を持ったが誤ったアクションを生む可能性がある。最終的なタスクの成功のみを評価し、グラウンディングエラーを隠すこと。
代替手段DOMセレクター、アクセシビリティ参照、直接座標、またはテキスト検索。利用可能な構造に関係なく、すべてのページに対して一つの手法を選択すること。

セット・オブ・マークプロンプティングが役立つ場所

SoMは、タスクが視覚領域への正確な参照を必要とし、ページ構造だけでは十分な意味を表現できない場合にその地位を獲得します。

ブラウザ制御

ブラウザエージェントは、意図されたターゲットの横に描かれた番号を返すことで、アイコン、カード、キャンバスコントロール、またはラベルのないボタンから選択できます。

チャートや図の読み取り

マーカーは、いくつかの類似したバー、ノード、またはパネルを異なる参照に変え、モデルが選択した視覚アイテムを説明または比較するのに役立ちます。

ドキュメント検査

レビュアーは、壱番目のテーブルセル、署名ブロック、図、またはフォームフィールドについて尋ねることができ、脆弱な座標記述に依存することはありません。

ロボティクスと具現化タスク

領域ラベルは、別のコントローラーが物理的なアクションを計画する前に、カメラフレーム内のオブジェクトに対する一時的なボキャブラリーを提供できます。

信頼性のあるSoMパイプラインの設計

明示的なアクションインベントリから始めます。ブラウジングシステムには、クリック、タイプ、スクロール、ホバー、検査のアクションが必要かもしれませんが、すべてのマークされた領域が各アクションをサポートするわけではありません。許可されたアクションを領域識別子の横に保存します。テキストフィールドはタイプを受け入れ、段落は検査のみをサポートする場合があります。このシンプルな契約は、モデルが不可能な操作のために視覚的にプラウザビリティのある領域を選択するのを防ぎます。

マークされたバージョンと元の観察を並べて保持します。マークされたフレームは参照に便利であり、元のフレームはタイポグラフィ、色、境界、小さなステータステキストを保持します。二重ビューのプロンプトにより、モデルはクリーンな証拠から推論し、マークされた識別子で応答できます。また、レビュアーはオーバーレイがターゲットを隠しているかどうかを確認できるため、デバッグも容易になります。

すべてのマークを出所に接続します。ウェブインターフェースの場合、記録には、スクリーンショットの境界、ビューポートサイズ、スクロールオフセット、DOMノードのID、アクセシブルな名前、観察のタイムスタンプが含まれる場合があります。 WebArenaベンチマーク は、状態を持つブラウザタスクが魅力的なスクリーンショットだけでなく、再現可能な環境と機能評価を必要とする理由を示します。出所は、コントローラーが選択された領域がまだ現在のページ状態に属しているかどうかを確認することを可能にします。

パイプラインを段階的に評価します。モデル選択の精度の前に候補者リコールを測定します:地域生成器は必要なコントロールを全くマークしましたか?次に、ラベルの可読性、モデル選択の精度、アクションの実行、最終タスクの正確性を測定します。最終成功率は、視覚的グラウンディングの不足と、正しいグラウンディングに続く不良アクションという二つの非常に異なる問題を隠すことがあります。

制限と失敗モード

密なページは、有用なラベル予算を超えることがあります。数百のマークがページのテキストと互いに競い合います。領域によるフィルタリングだけでは不十分なことが多く、小さなアイコンは大きな装飾画像よりもアクションを起こしやすい場合があります。インターフェースの役割、可視性、遮蔽、そしておそらくタスクの関連性は、より良いフィルターを提供します。階層的なマーク付けも別の選択肢です:パネルを最初に選択し、その中のコントロールをマークします。

SoMは領域提案システムからのエラーを引き継ぎます。セグメンテーションは1つのコントロールをいくつかの部分に分割したり、隣接するオブジェクトを統合したりすることがあります。DOM矩形には不可視層が含まれることがあります。OCRはスタイライズされたテキストを見逃すことがあります。アクセシビリティツリーはキャンバスコンテンツを省略することがあります。ソースを組み合わせることでカバレッジを改善できますが、重複の解決は決定的でなければならず、同じ可視コントロールが複数の競合ラベルを受け取らないようにする必要があります。

マーカーはそれを生成したフレームに対してのみ有効です。アニメーション、レスポンシブレイアウト、レイジーロード、およびスクロールは、観察後にターゲットを移動させる可能があります。ブラウザエージェントシステムは、マーカーセットをページのURL、ビューポート、スクロール位置、および短命の状態識別子にバインドする必要があります。影響の大きなアクションには、視覚的選択が確実に見える場合でも、新しい観察と承認の境界が必要です。

この技術はまたアクセシビリティとセキュリティに関する疑問を引き起こします。オーバーレイは、ユーザー向けサイトの一部になってはならず、敏感なページ領域は承認された境界を超える前に削除される必要があります。マーカープロンプトはモデルのための観察であり、フォームを提出したり、資格情報を開示したり、アイテムを購入したり、アカウント状態を変更したりするための承認ではありません。

セット・オブ・マークプロンプティングを評価する方法

様々な密度、テキストサイズ、テーマ、ビューポートの幅、スクロール位置、インタラクションのタイプを持つ評価セットを構築します。ターゲットが提案されたか、ラベルが読みやすかったか、モデルがそれを選択したか、結果のアクションが意図した効果を持ったかを記録します。この層別記録は、改善が実際にどこにたどり着くかを示します。

SoMをセマンティックベースラインと比較します。アクセシビリティーツリーの参照が同じコントロールを少ないトークンと少ない間違いで選択した場合、セマンティックパスは勝つべきです。キャンバス、チャート、または画像に信頼できるセマンティックノードが含まれない場合、マークされた視覚パスがより良い観察かもしれません。ハイブリッドエージェントは、ステップごとに最も安価で信頼性のある表現を選択できます。

ラベル位置バイアスに注意します。モデルは、初期の数字、中央の領域、または視覚的に目立つ色を好むかもしれません。スクリーンショットを固定したまま、繰り返しの例の間でマーカーの割り当てをシャッフルします。安定した結果は、識別子ではなくオブジェクトに従うべきです。また、空間的グラウンディングが主な役割を果たすような、繰り返しの製品カードや同一のツールバーアイコンなどの近似複製ターゲットをテストします。

タスクの影響をグラウンディングの精度から分離して報告します。選択スコアが高いことは、不正確なアクションを減少させたり、完了への道を短縮する場合にのみ重要です。観察の数、モデルの呼び出し、修正された選択、古いフレームの拒否、人間の承認を記録します。これらの測定はSoMを巧妙なオーバーレイからエージェントシステムのアカウンタブルなコンポーネントに変えます。

結論

Set-of-Markプロンプティングは、マルチモーダルモデルにポイントを示すためのコンパクトな言語を提供します。提案された視覚領域にラベルを付け、モデルにラベルを選択させ、その回答を保存されたジオメトリにマッピングすることで機能します。この技術は、推論時に追加できるため、またそのグラウンディングの決定が簡単に検査できるため、便利です。

その限界も同様に具体的です:欠落した領域は欠落したままで、混雑したラベルは証拠を隠し、画面が変わるとすべてのマークは失効します。チームは、クリーンでマークされた観察を一緒に保ち、現在の状態に対して選択を検証し、視覚的な方法がすべてのステップを制御しなければならないと仮定する代わりに、SoMをセマンティックロケーターと比較することで最良の結果を得ます。

ブラウザエージェントグラウンディングのテストの準備はできましたか?

Scrapeless Scraping Browserで安定したブラウザ観察をキャプチャし、同じタスクに対してSoM、DOM、およびアクセシビリティのグラウンディングを評価します。

今日サインアップして、 $5の無料クレジットを受け取りましょう。クレジットカードは必要ありません。.

あなたの$5のクレジットを受け取る →

FAQ

Set-of-Markプロンプティングはオブジェクト検出と同じですか?

いいえ。オブジェクト検出またはセグメンテーションは領域を提案できますが、Set-of-Markプロンプティングはマルチモーダルモデルがそれらの領域を参照するために使用できる可視の識別子を割り当てます。

SoMはモデルのファインチューニングを必要としますか?

元のSoMメソッドは、トレーニングなしのプロンプティングアプローチとして提示されています。システムは推論時に画像に注釈を付け、対応できるマルチモーダルモデルにマークされたビューについて推論を求めることができます。

なぜブラウザエージェントは番号付きスクリーンショットを使用するのですか?

番号付きスクリーンショットは、曖昧な座標記述を短い参照に置き換えます。コントローラーは、返された番号を既知の長方形または要素にマッピングし、それを実行する前に検証できます。

Set-of-MarkプロンプティングはDOMに置き換えできますか?

いいえ。DOMとアクセシビリティデータはしばしばクリーンなセマンティックターゲットを提供します。SoMは、構造が欠けている、誤解を招く、高視覚的、またはキャンバスや画像コンテンツに散らばっている場合に特に役立ちます。

最大のSoM実装のミスは何ですか?

最大のミスは、マークを永久的なものと見なすことです。マーカーは1つの観察に属し、スクロール、ナビゲーション、レスポンシブな変更、または動的ページの更新後に更新される必要があります。

参考文献