什么是标签提示集合?
无抓取抓取浏览器提供一个受管理的浏览器运行时,可以为视觉浏览器代理工作流提供渲染页面和截图。
简而言之
- 标签提示集合将位置转换为短标签。 视觉系统在有意义的图像区域上叠加数字或字母,这样多模态模型可以在不发明像素坐标的情况下引用对象。
- 该技术改善了沟通,而不单独改善感知。 分割或接口解析建议区域;标记为模型提供了一个紧凑的词汇,以便在这些区域中进行选择。
- 浏览器代理使用SoM将语言连接到控制。 提示可以要求模型选择标记12,然后自动化层将该标记映射回按钮或输入区域。
- 标记还可以隐藏有用的视觉证据。 拥挤的标签、糟糕的区域建议和覆盖在文本上的覆盖物会降低准确性,因此被标记的图像需要自己的质量检查。
- SoM是多个定位选项中的一个。 DOM定位器、无障碍树、光学字符识别、截图和坐标预测适合不同的接口条件。
标签提示集合的定义
标签提示集合是一种视觉提示方法,在图像中的候选区域上放置不同的、可发音的标记——通常是数字或字母。多模态模型看到注释的图像并用与请求对象相对应的标记回答。该方法在论文中被提出。 标签提示集合释放了GPT-4V中的非凡视觉定位,其中现成的分割模型对图像进行分区,覆盖物使每个区域易于命名。
关键问题是视觉定位。模型可能理解“单击帐户菜单”这个句子,并可能在截图中识别菜单,但仍需要可靠的方式来表达目标的位置。当几个图标靠得很近时,自然语言如“右上角附近的图标”会变得模糊。标记创建一个临时标识符:模型可以返回“17”,控制器可以将17与存储的区域几何体关联。
SoM不会更改底层页面、训练新模型或定义自动化协议。它更改了显示给模型的观察。这一区别很重要,因为团队可以在推理时添加或删除覆盖。原始研究将SoM呈现为一种无训练的提示方法,公众 微软SoM实施 展示了用于创建掩膜和渲染标记的不同阶段。
因此,被标记的截图是计算机视觉和语言推理之间的一个小界面。视觉方面提出可选择的区域。渲染方面分配唯一的标签。语言模型在图像及其标签上进行推理。动作层将所选标签转换回坐标或结构元素引用。每个阶段可以单独评估,而不是将整个代理视为一个不透明的结果。
标签提示集合是如何工作的
第一阶段创建候选区域。在自然图像上,分割模型可能在多个细节级别上生成对象掩膜。在网页上,候选区域可能来自检测到的控件、光学字符识别框、无障碍节点、DOM几何体或组合。这一选择决定了模型被允许选择什么。如果区域生成器遗漏了一个小的披露箭头,那么无法通过标记提示稍后恢复该目标。
第二阶段过滤和排序区域。重叠的掩膜可能为同一对象创造多个标签,而微小的装饰形状可能使截图充斥着无关数字。实用系统会删除小于某一大小阈值的区域,合并重复项,优先考虑可能的控件,并在一次观察的生命周期内保持标签稳定。稳定性在模型引用后续推理步骤中的标签时会减少错误。
第三阶段在每个区域附近或内部绘制一个高对比度的标签。该标签必须保持可读性,而不覆盖选择对象所需的证据。例如,一个结账按钮可能包含价格或状态文本,这使其与另一个按钮区分开来。在文本上放置标记会以空间清晰换取语义损失。良好的渲染器选择一个空白区域,偏移标签,或同时提供原始和标记的图像。
最后阶段要求模型给出有限的答案并进行验证。控制器可能接受一个标记标识符加一个动作类型,而不是一个不受限制的段落。在任何点击发生之前,所选标识符会与当前观察进行检查。如果截图后页面发生了变化,控制器应该进行新的观察;来自旧框架的正确标签可能指向新状态中的错误控制。
SoM与其他定位方法的比较
标签提示集合最容易理解,当其输出、依赖关系和失败模式与邻近技术分开时。
| 维度 | 主要含义 | 常见错误 |
|---|---|---|
| 参考形式 | 一个短的可见标记与存储的区域相关联。 | 将标记本身视为永久的元素ID。 |
| 区域来源 | 分割、光学字符识别、DOM几何、无障碍数据或检测到的控件。 | 假设SoM在没有区域建议阶段的情况下发现每个目标。 |
| 最佳匹配 | 密集视觉场景和接口,其中自然语言位置描述模糊。 | 在已经存在稳定语义定位器的简单页面上添加标签。 |
| 主要风险 | 覆盖杂乱或过时几何会产生自信但错误的行为。 | 仅评分最终任务成功并隐藏定位错误。 |
| 替代方案 | DOM选择器、无障碍引用、直接坐标或文本搜索。 | 为每个页面选择一种方法,而不考虑可用结构。 |
Set-of-Mark 提示的帮助
当任务需要对视觉区域的精确引用,而仅靠页面结构无法表达足够的意义时,SoM 获得其位置。
浏览器控制
浏览器代理可以通过返回所绘制数字旁边的目标选择图标、卡片、画布控制或未标记按钮。
图表和图示阅读
标记将几个相似的条形图、节点或面板转换为不同的参照,这有助于模型解释或比较选定的视觉项目。
文档检查
审阅者可以询问关于编号表格单元格、签名块、图形或表单字段的问题,无需依赖脆弱的坐标描述。
机器人技术和具身任务
区域标签可以为相机帧中的对象提供临时词汇,在单独的控制器计划物理动作之前。
设计可靠的 SoM 流水线
从明确的动作库存开始。浏览系统可能需要点击、输入、滚动、悬停和检查动作,但并不是所有标记区域都支持每个动作。将允许的动作与区域标识符一起存储。文本字段可以接受输入;段落可能只能支持检查。这个简单的合同可以防止模型选择对不可能操作的视觉上合理的区域。
将原始观察与标记版本保持在一起。标记框对于参考很有用,而原始框保留了排版、颜色、边界和小状态文本。双视图提示让模型可以从干净的证据中推理,并使用标记标识符回答。它还使调试变得更容易,因为审阅者可以看到覆盖层是否遮挡了目标。
将每个标记与来源关联。对于网页界面,记录可能包括截图边界、视口大小、滚动偏移、DOM 节点身份(如可用)、可访问名称和观察时间戳。 WebArena 基准 展示了为什么有状态的浏览器任务需要可重复的环境和功能评估,而不仅仅是吸引人的截图。来源使控制器可以检查所选区域是否仍属于当前页面状态。
按阶段评估流水线。测量候选召回率,以检查模型选择的准确性:区域生成器是否标记了所需的控件?然后测量标签清晰度、模型选择准确性、动作执行和最终任务正确性。最终成功率可能隐藏两个非常不同的问题——糟糕的视觉定位和正确的定位后跟随错误的操作。
局限性和失败模式
密集页面可能超出有用的标签预算。数百个标记与页面文本和彼此竞争。仅通过区域过滤通常是不够的,因为小图标可能比大装饰图像更具可操作性。界面角色、可见性、遮挡和可能的任务相关性提供了更好的过滤器。分层标记是另一个选择:首先选择一个面板,然后标记其中的控件。
SoM 从区域提议系统继承错误。分割可能将一个控件分成几个部分,或合并相邻对象。DOM 矩形可能包括不可见层。OCR 可能错过风格化文本。可访问性树可能省略画布内容。结合多个来源可以改善覆盖范围,但重复解决方案必须保持确定性,以便相同的可见控件不会收到多个竞争标签。
标记仅对生成它的帧有效。动画、响应式布局、惰性加载和滚动可能在观察后移动目标。浏览器代理系统应将标记集绑定到页面 URL、视口、滚动位置和短暂的状态标识符。高影响力的操作即使在视觉选择看起来确定时,也值得进行新的观察和批准边界。
该技术还引入了可访问性和安全性问题。覆盖层不应该成为用户面向的网站的一部分,敏感页面区域应该在截图离开批准边界之前被编辑。标记提示是模型的观察,而不是提交表单、披露凭证、购买项目或更改账户状态的授权。
如何评估 Set-of-Mark 提示
构建一个具有不同密度、文本大小、主题、视口宽度、滚动位置和交互类型的评估集。记录目标是否被提议,其标签是否保持可读,模型是否选择了它,以及结果动作是否产生了预期效果。这个分层记录显示了改进实际落脚的位置。
将 SoM 与语义基准进行比较。如果可访问性树引用以更少的标记和错误选择相同的控件,则语义路径应胜出。如果画布、图表或图像不包含可靠的语义节点,则标记的视觉路径可能是更好的观察。混合代理可以选择每一步最便宜的可靠表示。
注意标签位置偏差。模型可能更倾向于早期数字、中心区域或视觉上显著的颜色。在保持截图不变的情况下,在重复示例中随机打乱标记分配。稳定的结果应随着对象而变化,而不是标识符。同时测试近重复目标,如重复的产品卡片或相同的工具栏图标,其中空间定位做大部分工作。
分别报告任务影响与定位准确性。较高的选择分数只有在减少错误操作或缩短完成路径时才重要。记录观察数量、模型调用、纠正的选择、陈旧帧拒绝和人工批准。这些措施使 SoM 从一个聪明的覆盖层变为代理系统中的一个可问责组成部分。
结论
Set-of-Mark 提示为多模态模型提供了一种紧凑的指向语言。它通过标记提出的视觉区域,要求模型选择一个标签,并将该答案映射回存储的几何体。该技术非常有用,因为它可以在推理时添加,并且其基础决策易于检查。
它的局限性同样具体:缺失的区域仍然缺失,拥挤的标签隐藏证据,每个标记在屏幕变化时都会失效。团队通过将干净的标记观察保持在一起,针对当前状态验证选择,以及将 SoM 与语义定位器进行比较而获得最佳结果,而不是假设视觉方法必须控制每一步。
准备好测试浏览器代理定位了吗?
使用 Scrapeless Scraping Browser 捕获稳定的浏览器观察,然后评估 SoM、DOM 和可访问性定位,针对相同的任务。
今天注册并获得 $5 的免费积分 — 无需信用卡.
申领您的 $5 积分 →常见问题解答
Set-of-Mark 提示与对象检测是一样的吗?
不是。对象检测或分割可以提出区域,而 Set-of-Mark 提示分配可见标识符,多模态模型可以使用这些标识符来引用这些区域。
SoM 需要模型微调吗?
原始 SoM 方法被呈现为无训练的提示方法。系统可以在推理时对图像进行注释,并要求有能力的多模态模型在标记视图上进行推理。
为什么浏览器代理使用带编号的屏幕截图?
带编号的屏幕截图用简短的引用替换了模糊的坐标描述。控制器可以将返回的数字映射到已知的矩形或元素,并在执行之前进行验证。
Set-of-Mark 提示可以替代 DOM 吗?
不可以。DOM 和可访问性数据通常提供更清晰的语义目标。当结构缺失、误导性、视觉性强或分散在画布和图像内容中时,SoM 特别有用。
最大的 SoM 实施错误是什么?
最大的错误是将标记视为永久。标记属于一个观察,必须在滚动、导航、响应式变化或动态页面更新后进行刷新。