跳到主要内容
Zubnet AI学习Wiki › Computer Use
使用AI

Computer Use

别名:计算机操作智能体、GUI 智能体、Computer-Using Agent (CUA)
一种让 AI 模型像人一样操作真实桌面或浏览器的能力:模型观看屏幕截图,然后发出鼠标和键盘动作。它不调用 API,而是感知屏幕、决定点击或输入什么,再由一个执行器执行动作,如此循环,直到任务完成或智能体放弃。Anthropic 的 Computer Use 功能和 OpenAI 的 Operator 是最知名的实现。

为什么重要

大多数商业软件是为人而不是为机器构建的,其中相当大一部分没有可用的 API。计算机操作智能体原则上可以驱动其中任何一个——遗留 ERP、内部管理后台、没有集成路径的网站——这使它们成为迄今被尝试过的最通用的 AI 自动化形式。它们也是当下最不可靠的形式,所以理解它们的局限与理解它们的前景同样重要。

深度解析

计算机操作系统是一个循环,而不是单一模型。当前屏幕的一张截图进入一个多模态模型;模型结合任务和到目前为止的对话进行推理,然后发出一个结构化动作——在这些像素坐标点击、输入这个字符串、按下这个键、滚动;一个小型执行器在沙箱环境中执行该动作,拍下一张新截图,把它追加进对话,循环往复。像“找一张 900 美元以下飞往东京的机票并填写预订表单”这样的任务可能需要 30–100 个这样的步骤、耗时数分钟,因为每一步都是一次上下文中带图像的完整模型调用。这使它成为一种与基于 API 的自主智能体根本不同的契约:智能体不是用带类型的参数调用函数,而是操作人类会操作的同一批像素和控件,并承受由此带来的全部歧义与脆弱性。

截图-动作循环

这套机制被刻意设计得简单。模型看到的是像素,而不是 DOM 或可访问性树(不过浏览器智能体常把可访问性树作为第二输入加上,让元素更容易被引用),它用一个动作加精确坐标作答——“在 (412, 637) 处左键单击”。把坐标弄对是难点:模型必须把“保存按钮”这样的视觉概念落实到一个像素位置,这正是计算机操作推动多模态模型专门在带标注 UI 元素的截图上训练的原因。截图也很吃上下文:单个桌面帧可能花掉约一千个 token,所以一个 50 步的会话会积累大量视觉历史,实现上会降采样或丢弃旧帧以留在窗口之内。每次往返要花费几秒推理加动作执行,这就是 GUI 智能体相比基于结构化 API 的工具使用显得慢的原因——延迟是为通用性付出的代价。

定义这个品类的发布

2024 年 10 月,Anthropic 把“computer use”变成了一个产品品类:更新后的 Claude 3.5 Sonnet 以公开测试版形式搭载了这一能力,开发者得到一个参考环境(容器里带虚拟显示的 Linux 桌面)和一个工具定义,让模型能通过 API 请求鼠标、键盘和截图动作。Anthropic 明确把它定位为实验性的——有时笨拙且容易出错——面向的是想把重复性桌面工作自动化的开发者。2025 年 1 月,OpenAI 用 Operator 把这个想法带向消费者:这是一个由其计算机操作智能体(CUA)模型驱动的托管产品,智能体驱动一个云端浏览器,可以浏览网站、填写表单,并在登录、支付等敏感步骤把控制权交还给用户。随后一波开源浏览器智能体沿用了同一模式,“GUI 智能体”也成为智能体路线图上的标准项目。

OSWorld 与可靠性算术

进展主要在 OSWorld 上衡量,这是一个由约 370 个真实任务组成的基准测试——编辑电子表格、配置应用程序、在程序之间移动文件——在真实运行的 Ubuntu 虚拟机上执行,此外还有 WebArena 和 WorkArena 等侧重网页的套件。人类能完成约 72% 的 OSWorld 任务。第一个计算机操作发布版本只做到约 15%,而 OpenAI 的 CUA 在 2025 年初把它推到接近 40%——当时的最高水平,但仍远谈不上可靠。残酷的部分在于复利效应:如果每一步成功率是 95%,一个 30 步的任务成功率只有约 21%,100 步的任务几乎必然失败。这就是为什么 GUI 智能体的评估报告完整任务成功率而非单步准确率,也是为什么生产部署会把任务保持得短小、可验证、可逆。

它不会取代你的 API

一个常见的误解是 GUI 智能体会让集成过时——既然智能体能像人一样使用软件,为什么还要构建连接器?实践中,点击像素是最后的选择:它慢,对 UI 改版和弹窗脆弱,而且与一次结构化的 Function Calling 调用或一个带类型输入输出的 MCP 工具相比难以审计。如果目标系统有 API,就用它;GUI 留给没有 API 的长尾软件——遗留桌面应用、供应商门户、一次性的内部工具。最强的生产级智能体是混合式的:凡是有 API 的地方都走 API,只在没有更干净的路径时才退回到屏幕控制,这把脆弱的像素点击限制在真正需要它的少数几步里。

提示注入才是难点

GUI 智能体会读取屏幕上的一切,而在开放网络上,其中一些内容是带恶意的。一个网页、邮件或文档可能携带隐藏指令——比如用隐形文字告诉智能体把用户的文件转发到别处——而把屏幕内容当作命令的模型有时会照做,这就是背后带着真实鼠标点击的提示注入。两个旗舰产品发布时都附带了这一警告:Anthropic 建议在权限最小、不放任何凭据的专用虚拟机中运行计算机操作,Operator 则把购买和登录挡在用户确认和接管模式之后——由人类亲自输入密码。实操手册与任何智能体系统的 AI 安全姿态一致:沙箱化环境,用允许清单限定它可访问的网站,绝不给它超出当前步骤所需的秘密,对发送、付款、删除等不可逆操作要求人类批准。

← 所有术语
ESC