跳到主要內容
Zubnet AI學習Wiki › Embodied AI
基礎

Embodied AI

別名:Embodied Intelligence、Robotics Foundation Models、具身智慧
一種讓模型控制實體機器的人工智慧方法——機器人不只在螢幕上處理文字與圖像,而能在現實世界中感知、移動並操控物體。核心主張是,真正的智慧需要身體:感知、推理與運動控制必須透過和環境互動一併學習。這個詞涵蓋倉庫機械手臂、四足機器人,以及通用型人形機器人等各種系統。

為什麼重要

具身智慧是語言與視覺模型的近期進展和實體經濟交會之處:製造、物流、營造、農業及照護工作都仰賴體力勞動。能將餐具放入洗碗機或為貨架補貨的模型,價值遠高於只能描述步驟的模型,而業界許多公司如今也將機器人視為大型語言模型之後的下一個前沿。對實務人員而言,AI 最棘手的未解問題——資料稀缺、安全與即時控制——也正轉移到這個領域。

深度解析

具身智慧系統會執行一個連續迴圈:感測器——攝影機、深度感測器、關節編碼器,有時還包括觸覺——將資料送入感知堆疊,策略模型把觀測轉化為動作命令,再由馬達在實體世界執行,產生新的觀測。較舊的機器人以人工設計的管線執行這個迴圈,分別使用不同模組進行建圖、規劃與控制。目前這波發展則盡量以單一大型神經網路取代整條管線,直接借用大型語言模型的方法:採用 Transformer 骨幹,接收攝影機畫面與自然語言指示,再輸出馬達命令。其根本假設是,產生流暢文字模型的方法——大量資料、大型模型與自我監督式預訓練——也能造就通用實體技能,因為多模態模型如今已能看見圖像並對其進行推理。

視覺語言動作模型

這波發展的代表性架構是視覺語言動作模型(VLA)。VLA 以已能理解圖像與文字的預訓練視覺語言模型為起點,再加入動作輸出:馬達命令會離散化為 token,而模型預測這些 token 的方式,就像聊天機器人預測詞彙。Google DeepMind 於 2023 年發布的 RT-2 展現這項設計的重要性——當機器人被要求拿起「一種已滅絕的動物」時,它選擇恐龍玩具,運用了網路規模圖像文字預訓練所學到、卻從未出現在機器人訓練資料中的知識。Physical Intelligence 的 π0(pi-zero)進一步將概念延伸為在多種機器人平台上訓練的通用策略,而 Figure 等公司的機器人實驗室如今也自行建立 VLA 堆疊。其吸引力在於重複利用既有能力:模型從網際網路繼承物體、語言與場景的常識,只有運動層必須從頭學習。

資料難題

資料是這個領域的主要限制。語言模型可使用從公開網際網路擷取的數兆個 token 訓練,但並不存在「機器人動作的網際網路」:沒有預先存在的語料庫,能將攝影機畫面與完成任務所用的精確馬達命令配對。最直接的方法是遠端操作,由人類操作員遙控機器人,或穿戴動作擷取裝備,示範摺疊襯衫、將餐具放入洗碗機等任務。這能產生高品質資料,速度卻很慢——運作良好的團隊每天或許能收集數千次示範,而通用策略可能需要數百萬次。跨機體泛化讓問題更加嚴重:以一款機械手臂收集的資料,很難移轉至幾何形狀不同的另一款手臂,因此每種硬體平台都必須重新收集資料。

另一種方法是模擬。策略會透過強化學習,在 NVIDIA Isaac Sim 等物理模擬器中訓練,讓數百萬次試驗只消耗 GPU 時間,再移轉至實體硬體——這就是 sim-to-real 管線。由於模擬物理永遠無法完全符合現實,工程師會在訓練期間隨機改變照明、紋理、摩擦力和物體質量;這項技巧稱為領域隨機化,可迫使策略忽略兩者差異。模擬產生的Synthetic Data(合成資料)如今會在多數嚴謹計畫中補充真實示範,而經過訓練的世界模型則有望提供第三種來源:在神經網路的預測中訓練策略,而非使用人工建立的模擬器。這些方法都還未找出經驗證的實體技能縮放定律;在此之前,資料收集的經濟效益會決定誰有能力競爭。

難點不在思考

常見的誤解,是認為機器人落後於聊天機器人,只因背後模型較弱,因此換上更大的 LLM 便能消除差距。現實更接近 Moravec 悖論:成年人毫不費力就能完成的技能——走過雜亂房間、接住掉落的玻璃杯、摺疊衣物——在運算上極其困難,反而是下西洋棋或通過律師資格考試相對容易。語言模型之所以看似超越人類,部分原因是文字是一個乾淨、完整的管道:模型理解一句話所需的一切,都已包含在句子中。實體世界沒有這種便利。接觸力難以模擬、更難感測,物體會變形或滑動,而且錯誤無法用退格鍵復原。將抽象符號連結至實體指涉對象——也就是長久以來的事實接地問題——正是身體迫使模型處理的難題,也解釋了為何能撰寫十四行詩的系統,仍可能無法裝好燈泡。

為什麼是人形,又為什麼是現在

這波浪潮的旗艦機器——Figure 的人形機器人、Tesla 的 Optimus、Unitree 的 H1 與 G1——都基於相同論點:人類建造的環境是按照人體設計,因此人形機器人不需改造環境,就能使用樓梯、門把、工具及工作站。質疑者則認為輪子比雙腿有效率,而且機器人領域迄今最成功的商業產品,例如 Amazon 的倉庫搬運機器人,外型完全不像人。讓人形機器人的構想變得可信,關鍵進展來自軟體而非硬體。致動器與攝影機成本已降低多年,但直到基礎模型興起後,人們才可能相信單一策略可處理真實世界的長尾變化,而不需由專業工程師逐項處理。雙腿是否勝過輪子,遠不如這種泛化能力能否實現來得重要。

真實部署是什麼樣

現今的實際部署範圍狹窄,而且受到嚴密監督。人形機器人試驗會在汽車工廠與倉庫中,執行搬運周轉箱和分類零件等範圍明確的任務,通常也有遠端人類操作員,在策略出現混亂時隨時接管。安全規則仍會將機器人與人類隔開,一方面是因為策略會以難以預測的方式失敗,另一方面則是認證制度落後於技術。運算也是一項限制:策略必須在機載硬體上以控制迴圈的頻率執行,因此團隊會採用小型蒸餾模型與Edge AI(邊緣 AI)推論,而非資料中心規模的大腦。坦白來說,2020 年代中期的具身智慧,大致處於語言模型突破前的位置——示範令人驚豔、經濟效益尚未證實,而真正有力的論據是進步速度,而非目前能力。

← 所有術語
ESC