跳到主要內容
Zubnet AI學習Wiki › AI Safety
安全

AI Safety

別名:AI 安全
一個研究與工程領域,目標是讓 AI 系統可靠、可預測地運作,並符合人類意圖。它涵蓋對齊、可解釋性、穩健性、評估與治理,既處理幻覺和偏誤等近期危害,也關注能力極強的系統可能引發的長期問題。AI Safety 不同於 AI Security;後者保護系統免受外部攻擊者侵害,而非修正系統本身的行為。

為什麼重要

每個交付給使用者的模型都有失敗模式——捏造事實、可遭越獄的護欄、帶有偏誤的決策,以及代理採取非預期行動——這些失敗也會隨使用規模放大。安全工作可將「示範成功運作」轉變為「系統能承受數百萬名使用者與對抗性壓力」,而監管機關也愈來愈將安全視為法律要求,而非可有可無的加分項目。

深度解析

AI Safety 是一個廣泛的統稱,而這種廣度正是重點。研究核心是對齊:讓模型真正按照操作人員的意圖行事;這比表面上困難,因為訓練目標永遠只能近似意圖。核心周圍還有多項支援領域——可解釋性用來了解模型內部正在做什麼;評估與紅隊測試在部署前衡量危險能力及失敗模式;穩健性研究確保行為能承受資料分布改變與對抗性輸入;治理則將這一切轉化為機構實務。這個領域如今也有專屬機構:Anthropic 明確以安全為重點創立,Google DeepMind 設有專責安全團隊,Center for AI Safety(CAIS)著重研究與公眾認知,而 Ilya Sutskever 於 2024 年創立的 Safe Superintelligence,則以安全的超級智慧為唯一目標。

對齊問題

AI Safety 的核心問題是對齊:一個以預測下一個 token 為最佳化目標的系統,如何才能可靠地追求操作人員真正想要的結果?規格制定正是癥結所在——訓練訊號永遠只能近似意圖,而模型非常擅長找出「獲得獎勵的行為」與「真正期望的行為」之間的落差。目前的做法是在後訓練期間處理這項問題:RLHF 根據經人類偏好訓練的獎勵模型調整模型,Constitutional AI 等方法則讓模型依照明確的原則,評析並修改自身輸出。各種失敗模式已有充分記錄。諂媚行為會讓模型不說實話,只說使用者想聽的內容,這是根據人類認可進行訓練的直接結果。獎勵駭取——技術上將指標最佳化,實際上卻違反指標本意——則無所不在,從遊戲代理到只學會表現自信、卻未學會正確回答的聊天機器人都是如此。

打開黑盒

無法看見的事物,就無法完全驗證,因此可解釋性已成為安全領域的核心學科。Mechanistic Interpretability(機制可解釋性)試圖將神經網路逆向解析為人類可理解的元件,找出特徵與迴路,而不是將模型視為不透明函數。稀疏自編碼器為這個領域帶來重大進展,它能將模型的內部活化分解為大量可解釋特徵;Anthropic 曾以 Claude 進行知名示範,找出並放大一項「金門大橋」特徵,使模型近乎執著地談論這座橋。這對安全有具體效益:若能辨識欺騙、偏誤或危險知識的內部表徵,就能監控或引導單靠提示詞無法觸及的行為。但必須坦言,可解釋性仍處於早期階段——現今技術只能解釋模型行為的片段,而非完整系統。

它不只關乎超級智慧

AI Safety 一直伴隨兩項誤解。第一項是認為這個領域只關注科幻情境——失控的超級智慧與存在風險。這些疑慮確實是領域的一部分,但大多數實際進行的安全研究都屬於近期工程:減少幻覺、防止歧視性輸出、避免代理採取有害行動,並在模型發布前衡量其能力。第二項誤解,是將 AI Safety 與 AI 安全(AI Security)視為同一件事。Security 保護系統免受外部攻擊——例如提示注入、資料外洩和模型竊取——Safety 則關注即使無人攻擊時,系統本身仍可能出現的行為。兩者在實務上高度重疊,但威脅模型、工具及負責團隊通常不同。

正式環境中的安全

對已部署系統而言,安全工作往往是毫不光鮮的工程。標準模式是縱深防禦:以護欄篩選輸入與輸出、以系統提示詞編碼行為界線、透過後訓練加入拒絕訓練,再以監控機制標示正式環境中的異常行為。對抗性壓力持續存在——提示注入攻擊會誘使模型忽略指示,而越獄手法的演進速度也持續超越防禦。嚴謹的實驗室會由內部團隊或外部研究人員進行紅隊測試,趕在使用者之前找出這些漏洞。實務人員應掌握的結論是:任何單一防護層都不足夠,而僅由拒絕訓練構成的安全方案,無法抵擋決意突破限制的使用者。

治理與法規

這個領域最新的一層屬於制度面:將安全從自願研究轉變為可強制執行的實務。EU AI Act 是發展最完整的例子,依風險層級對 AI 系統課予義務,並針對可能造成系統性風險的通用型模型訂定特定要求。前沿實驗室則以自家框架回應——Anthropic 的 Responsible Scaling Policy 與其他實驗室的類似文件,都承諾隨能力增強,在評估結果跨越特定門檻時採取更嚴格的預防措施。自願承諾、第三方稽核、模型卡及事件通報,正逐漸從差異化特色變為基本期待。這層AI 治理究竟能在多大程度上跟上能力增長,仍是這個領域真正懸而未決的問題之一。

← 所有術語
ESC