跳到主要內容
Zubnet AI學習Wiki › Computer Use
使用AI

Computer Use

別名:電腦操作代理、GUI 代理、Computer-Using Agent (CUA)
一種讓 AI 模型像人類一樣操作實際桌面或瀏覽器的能力:查看螢幕截圖,再發出滑鼠與鍵盤動作。模型不呼叫 API,而是感知螢幕、決定要點選或輸入什麼,再由執行器實際操作;這個迴圈會持續到任務完成或代理放棄。Anthropic 的 Computer Use 功能與 OpenAI 的 Operator 是最知名的實作。

為什麼重要

大多數商用軟體是為人類而非機器打造,其中許多沒有可用的 API。電腦操作代理原則上能操作任何這類軟體——舊有 ERP、內部管理後台,以及沒有整合管道的網站——使其成為迄今最通用的 AI 自動化嘗試。它們同時也是目前最不可靠的形式,因此了解其限制與了解其潛力同等重要。

深度解析

電腦操作系統是一個迴圈,而非單一模型。目前螢幕的截圖會傳入多模態模型;模型根據任務與目前為止的對話進行推理,再發出一個結構化動作——在特定像素座標點選、輸入某段字串、按下某個按鍵或捲動;小型執行器會在沙箱環境中執行動作、拍攝新截圖、將其加入對話,接著重複這個循環。「找出一張 900 美元以下飛往東京的機票,並填寫訂位表單」這類任務,可能需要 30–100 個步驟和數分鐘才能完成,因為每一步都是在上下文中包含影像的完整模型呼叫。這種互動模式與建立在 API 上的自主代理截然不同:代理不以具型別的引數呼叫函式,而是操作與人類相同的像素及控制項,也承受其中所有模糊性與脆弱性。

截圖與動作迴圈

這套機制刻意保持簡單。模型看見的是像素,而非 DOM 或無障礙樹(不過瀏覽器代理通常會將無障礙樹加入為第二項輸入,讓元素更容易參照),並以一項動作與精確座標回應——例如「在 (412, 637) 按一下滑鼠左鍵」。準確找出座標才是難處:模型必須將「儲存按鈕」等視覺概念對應至像素位置,這也是電腦操作推動多模態模型專門使用標註過 UI 元素的截圖進行訓練的原因。截圖也會占用大量上下文:單一桌面畫面可能耗用約一千個 token,因此 50 個步驟的工作階段會累積大量視覺紀錄,實作時必須降低舊畫面的解析度或將其捨棄,才能維持在上下文視窗內。每次往返都需要數秒的推論與動作執行時間,因此 GUI 代理的速度遠慢於透過結構化 API 進行的工具使用——延遲正是通用性的代價。

定義這個類別的產品發布

2024 年 10 月,Anthropic 將「computer use」變成產品類別,當時更新版 Claude 3.5 Sonnet 以公開測試版推出這項功能:開發者取得參考環境(在容器中執行、配備虛擬顯示器的 Linux 桌面),以及一項工具定義,讓模型可透過 API 要求執行滑鼠、鍵盤和截圖動作。Anthropic 明確將它定位為實驗性功能——有時操作繁瑣且容易出錯——目標使用者是希望自動化重複桌面工作的開發者。2025 年 1 月,OpenAI 透過 Operator 將這個概念帶給一般消費者;這項託管產品由其 Computer-Using Agent(CUA)模型驅動,代理可操作雲端瀏覽器、瀏覽網站及填寫表單,並在登入、付款及其他敏感步驟將控制權交還使用者。隨後,一批開放原始碼瀏覽器代理採用相同模式,而「GUI 代理」也成為代理發展藍圖中的標準項目。

OSWorld 與可靠性算術

業界主要透過 OSWorld 追蹤進展;這項基準測試包含約 370 個真實任務——例如編輯試算表、設定應用程式,以及在不同程式間移動檔案——並在實際運作的 Ubuntu 虛擬機器上執行,另有 WebArena 和 WorkArena 等聚焦網頁的測試套件。人類可完成約 72% 的 OSWorld 任務。最早發布的電腦操作功能只能完成約 15%,OpenAI 的 CUA 則在 2025 年初將成績推升至略低於 40%——這在當時是最先進的表現,卻仍遠稱不上可靠。殘酷之處在於錯誤會累積:如果每一步有 95% 的成功率,30 步任務的成功率只有約 21%,而 100 步任務幾乎不可能成功。因此,GUI 代理評估會報告完整任務成功率,而非單步準確率;正式環境部署也會將任務維持在簡短、可驗證且可逆的範圍。

它不會取代你的 API

常見的誤解,是認為 GUI 代理會讓整合變得過時——既然代理能像人類一樣使用軟體,為何還要建立連接器?實務上,點選像素是最後手段:速度緩慢、容易因 UI 改版與彈出視窗而失效,而且相較於結構化的 Function Calling 呼叫,或輸入輸出具備型別的 MCP 工具,更難進行稽核。如果目標系統提供 API,就應採用 API;GUI 是為沒有 API 的長尾軟體而存在——例如舊式桌面應用程式、供應商入口網站及一次性內部工具。最強大的正式環境代理採用混合模式:只要有 API 就透過 API 操作,只有在沒有更可靠的路徑時才改用螢幕控制,使脆弱的像素點選侷限在真正必要的少數步驟。

提示注入才是難點

GUI 代理會讀取螢幕上的所有內容,而開放網路中的部分內容帶有敵意。網頁、電子郵件或文件可能包含隱藏指示——例如以不可見文字要求代理將使用者的檔案轉寄至某處——把螢幕內容視為命令的模型有時會照做,這就是會實際操作滑鼠的提示注入。兩項旗艦產品發布時都附帶這項警告:Anthropic 建議在最低權限、未存放任何認證資訊的專用虛擬機器中執行 Computer Use;Operator 則要求使用者確認購買與登入動作,並提供由人類親自輸入密碼的接管模式。實務準則與所有代理系統的 AI 安全方針一致:將環境沙箱化、以允許清單限制可造訪的網站、絕不提供超出目前步驟所需的機密資訊,並要求人類核准傳送、付款或刪除等任何不可逆操作。

← 所有術語
ESC