什么是计算机使用?
无废Agent浏览器提供受管的浏览器会话,在这些会话中,计算机使用代理可以观察和与网络界面互动。
总结
- 计算机使用是界面级别的操作。 代理观察屏幕或结构化用户界面状态,并发出单击、输入、滚动或键盘操作。
- 它是对API的补充,而不是替代。 当它们暴露所需能力时,稳定的类型化操作仍然更受欢迎。
- 循环是感知、行动和验证。 每次实质性接口变化后都应进行新的观察。
- 会话基础设施很重要。 隔离、身份、超时、文物和清理决定了重复运行是否安全。
- 重要的操作需要控制点。 购买、提交、消息和凭证输入应使用明确的批准和有限的权限。
为什么这个主题重要
计算机使用是通过观察和输入操作来操作图形界面的人工智能能力。 OpenAI计算机使用文档 描述了一个循环,其中模型提出计算机操作,应用程序执行它们,并且更新的屏幕截图返回到模型。 Google计算机使用指导 同样强调对重要任务的密切监督,以及对敏感或难以逆转的操作要谨慎。
当软件未提供合适的API或可见界面是被测试对象时,这一能力是有用的。它的确定性也低于类型集成。布局变化、弹出窗口、动画、隐藏焦点、权限和帐户状态可以改变单击的含义。因此,生产系统需要浏览器或桌面运行时、政策层、观察适配器和持久的操作跟踪。
计算机使用循环
代理接受观察,例如屏幕截图、无障碍树、DOM表示或这些的组合。它解释当前状态并提出有限的操作:移动、单击、输入、滚动、按键或等待可见变化。宿主检查操作是否符合政策,执行该操作并返回新的观察。
验证不能等到最后。在单击按钮后,系统应在继续之前确认当前的URL、对话框、选定状态或结果记录。坐标不是证据,因为相同的屏幕位置在布局变化后可以表示不同的控件。接口语义和可见确认比假定几何更强。
计算机使用可以是特定于浏览器的或操作更广泛的桌面。浏览器会话提供更清晰的URL、DOM、标签、cookie和网络边界。桌面控制可能跨越多个应用程序,因此需要更严格的窗口定位、剪贴板政策、文件规则和跨应用程序数据移动之前的确认。
计算机使用系统中的层次
- 计划者。 从任务、当前观察、先前操作和剩余政策预算中选择下一个操作。
- 运行时。 拥有浏览器或桌面会话、视口、身份、标签、进程、存储和清理。
- 观察适配器。 返回带有当前URL、窗口、错误和时间戳的屏幕截图和结构化接口状态。
- 操作执行器。 将验证过的鼠标、键盘、导航、上传或等待操作应用于目标。
- 政策和证据。 限制操作,请求批准,存储审查所需的跟踪和文物。
计算机使用与API和浏览器自动化的比较
选择最符合要求的结构化接口。当用户界面是唯一实用界面或布局本身重要时,计算机使用才会值得其成本。
| 方法 | 强项 | 主要限制 |
|---|---|---|
| 类型API | 稳定的架构和明确的授权 | 可能不会暴露所需的用户面对的工作流 |
| DOM自动化 | 精确选择器和浏览器状态 | 选择器可能会改变,可能不反映视觉含义 |
| 无障碍自动化 | 语义角色和标签 | 覆盖范围取决于接口可访问性质量 |
| 视觉计算机使用 | 与可见接口合作 | 模糊像素、布局变化和更高的验证成本 |
| 混合方法 | 将结构化状态与视觉回退结合 | 需要仔细调和多个观察结果 |
构建更安全的计算机使用工作流程
围绕明确的会话和可逆步骤进行设计。模型应在不接收与无关应用程序或秘密的环境访问的情况下看到所需的状态。
- 创建一个隔离会话。 将一个任务和所有者分配给浏览器或桌面上下文,并制定明确的持续和清理政策。
- 声明允许的操作。 分离读取、导航、数据输入、上传、提交和交易权限。
- 更倾向于语义目标。 在可用时使用角色、标签、DOM或可访问性信息;使用视觉坐标作为验证的回退。
- 在状态变化后进行验证。 在计划下一步操作之前,捕获生成的URL、可见控制状态、确认文本或创建的记录。
- 插入批准门。 在发送消息、接受条款、输入敏感数据、下载文件或执行交易之前暂停。
评估比点击准确性更多。
计算机使用基准应捕获任务结果、行动路径、安全性和留下的证据质量。
- 完成。 预期的可见结果是否发生在正确的应用程序和账户中?
- 行动精度。 系统在第一次验证行动时,目标是否正确的控制频率有多高?
- 路径长度。 与合理参考路径相比,使用了多少观察和行动?
- 干预质量。 系统是否在批准边界处暂停,并提供足够的上下文供人决定?
- 追踪完整性。 审阅者是否能够重建屏幕截图、URL、操作、错误和最终状态?
计算机使用安全风险
接口将不受信任的内容与真实的控制结合。 NIST AI风险管理框架 提供一个生命周期框架,用于映射、测量、管理和治理这些风险。系统必须将页面所说的内容与代理被授权做的事情分开。
- 提示注入。 可见页面文本可能试图重新定向代理。任务合同和行动政策必须保持权威。
- 错误目标行动。 焦点、滚动、叠加和布局变化可能会移动控件。在有后果的点击前立即重新观察。
- 秘密暴露。 屏幕截图、剪贴板、自填和通知可能会泄露无关的数据。最小化可见状态并去除文物。
- 会话交叉。 共享的cookie或个人资料可能会导致操作放在错误用户的账户中。隔离所有权并验证身份。
- 不可逆完成。 最终按钮可以立即提交或购买。使用预览状态和人为批准,当反转困难时。
计算机使用应用程序
遗留软件
操作重要的工作流程,这些工作流程仅暴露图形界面而没有稳定的集成。
浏览器研究
导航客户端渲染的页面,展开控件,并在定义的只读政策下收集证据。
接口测试
在捕捉屏幕截图和结果状态的同时,使用用户遵循的相同可视路径。
人工交接
准备一个部分完成的表单或工作流程,然后让人验证并执行最终操作。
从试点到生产
一个有用的计算机使用AI试点应足够小,以便逐条检查记录。开始于 创建一个隔离会话: 将一个任务和所有者分配给浏览器或桌面上下文,明确持久性和清理政策。然后应用 声明允许的操作: 分离读取、导航、数据输入、上传、提交和交易权限。保持第一评估集故意混合,包括普通案例、模糊案例、缺失证据和系统必须拒绝或交接的操作。这揭示了工作流程是否理解其边界,以便高容量隐藏设计错误于聚合指标内。
生产准备需要每个衡量和工件都有一个所有者。跟踪 完成 以回答意图可见的结果是否发生在正确的应用程序和账户中?跟踪 操作精度 以确定系统在第一次验证的操作中多频繁地针对正确控件?添加 路径长度 这样团队可以看看与合理参考路径相比,使用了多少观察和操作?这些措施应链接到基础记录,而不仅仅作为仪表盘总数存在。审阅者需要从更改된 metric 移动到产生该 metric 的确切查询、源、观察或操作。
操作控制应瞄准最可能改变商业决策的失败模式。第一个审查规则应涵盖 提示注入: 可见页面文本可以尝试重定向代理。任务合同和操作政策必须保持权威性。退出审查应涵盖 不可逆完成: 最终按钮可以立即提交或购买。使用预览状态和人为批准,当反转困难时。分配响应所有者,定义什么证据解决问题,并记录结果是否更改数据、提示、工具、权限或源政策。该记录防止相同缺陷被发现为未解释的质量波动。
仅在试点行为可预测后扩展。团队可以从遗留软件开始,工作是操作重要的工作流程,这些工作流程仅暴露图形界面而没有稳定的集成。第二阶段可以增加浏览器研究,工作流程必须导航客户端渲染的页面,展开控件,并在定义的只读政策下收集证据。随着范围的增长,保持原始测试集运行。新的来源、市场、工具和权限应逐一引入,以便回归可以分配给特定更改,而不是同时的平台重写。
结论
计算机使用使AI系统能够感知和操作图形软件,但有用的能力取决于模型周围的运行时和政策。隔离会话、语义观察、验证操作、批准和证据将点击演示转变为可审计的工作流程。
优先选择API以实现稳定的业务操作,并在可视界面确实需要的地方使用计算机控制。混合设计通常提供最佳平衡:已知操作的结构化工具和其余UI步骤的计算机使用。
准备运行受管理的浏览器会话吗?
使用Scrapeless Agent Browser作为受限计算机使用工作流程后面的隔离、可观察的网络运行时。
今天注册并获取 $5的免费信用 — 无需信用卡.
领取您的$5信用 →常见问题
AI中的计算机使用是什么?
计算机使用是AI代理观察图形界面的能力,并通过执行环境请求鼠标、键盘、滚动或导航操作。
计算机使用和机器人流程自动化是一样的吗?
它们在接口控制上重叠。传统的自动化通常遵循预定义的规则或选择,而AI计算机使用代理可以从视觉或语义观察中选择下一个边界操作。
为什么每个任务不使用API?
当API采用稳定模式暴露所需操作时,使用API更可取。当没有合适的API存在,UI本身重要,或者路线随可见状态变化时,计算机使用是有价值的。
哪些操作应需要批准?
对敏感数据输入、外部消息、法律接受、文件传输、账户更改、购买及任何昂贵或难以反转的操作需要批准。
计算机使用追踪应存储什么?
存储任务合同、会话身份、观察、当前URL或窗口、建议和执行操作、批准、错误和经过验证的最终状态,受隐私政策的限制。