最重要的數字是 22:五指 SharpaWave 手的自由度數,Google 新款機器人模型現在能在完整的人形身體上驅動它。在 7 月 30 日發表的兩篇部落格中,Google DeepMind 發布了 Gemini Robotics 2,這是其首個控制完整人形機器人的視覺-語言-動作模型,用 Google 的話說'從腳到指尖',而此前版本只能做桌面上的上半身任務。在 Apptronik 的 Apollo 2 上的示範中,機器人走到桌邊,抓起澆水壺,穿越房間放上架子,然後用這隻靈巧手打結、封夾鏈袋;Franka Duo 平台則用雙指夾爪完成緊湊裝箱。
第二個模型才是建構者真正能碰到的。Gemini Robotics ER 2 是規劃大腦:它編排持續數分鐘、包含 Google 所稱數百個決策的多步驟任務,自行糾正失敗的步驟,原生呼叫 Google 搜尋等工具,並接入 Gemini Live API 實現雙向串流互動。它今日起透過 Gemini API 和 Google AI Studio 公開可用,並在 Gemini Enterprise Agent Platform 上提供私有預覽。Google 自評聲稱:進度分類準確率 57.4%,時刻定位準確率 91.3%、平均絕對誤差 0.96 秒,執行速度是遠大於它的模型的 4 倍,還能讀取 10 種儀器,從數位顯示器到液體溫度計。
第三個模型 Gemini Robotics On-Device 2 在本機執行,Google 稱它能在幾小時內適配全新的機器人本體,通常只需不到 200 個樣本,已在 Dexmate、SO101 和 Trossen 硬體上示範。多機器人示範把 Apollo 2 與 Franka F3 Duo 配對,另一個示範中 ER 2 編排 Boston Dynamics Spot 的 API,按語音指令取來零食,程式碼已放上 GitHub。被點名的合作夥伴是 Apptronik、Boston Dynamics 和 Agile Robots。安全方面,Google 發布了針對不安全工具呼叫和人工介入請求的新基準 ASIMOV-Agentic,並表示當有人靠近時 ER 2 會讓人形機器人停下,道路清空後再繼續。
保留意見是結構性的。上述每一項基準都是 Google 自己執行的評估,展示給記者(包括 WIRED)的示範是預錄影片,不是現場執行。可用性的分佈也讓這則公告回到實際尺寸:三個模型中只有 ER 2 公開可用,Robotics 2 和 On-Device 2 仍限於搶先體驗合作夥伴。DeepMind 機器人負責人 Carolina Parada 把這次發布稱為通向'物理 AGI'的里程碑。對建構者更有用的是更安靜的解讀:機器人控制正在變成與文字生成同一張 API 帳單上的一行,而懸而未決的問題正從'模型能不能動手臂'變成'誰被允許執行它,依據什麼安全論證'。
