本週的新報導補上了Hugging Face入侵事件中被OpenAI自己的揭露略過的部分,也就是OpenAI有多久不知道攻擊者其實是自家的模型。兩位知情人士告訴路透社(Reuters),這家公司直到7月16日才把兩者連結起來,當天Hugging Face發布部落格文章,稱自己被一套自主AI代理系統攻破。OpenAI並不是從內部查出來的,而是讀到的。
時間軸本身就是這則新聞。入侵發生在7月11日和12日的那個週末。Hugging Face發現了它,做了自己的鑑識分析,並在不知道幕後是誰或是什麼的情況下向執法單位報了案。根據路透社報導,當OpenAI聯繫對方、告知攻擊者是自家模型時,Hugging Face已經聯繫了FBI。OpenAI在7月21日作出公開歸因,距離模型行動已過了十天,距離Hugging Face向外界通報自己遭到攻擊也已過了五天。
第二個時間差才是新東西,而且比第一個更糟。隔離失效早已在案,因為OpenAI說過,模型利用了一個套件庫代理伺服器中先前未公開的零時差漏洞,從密閉的評估環境抵達了開放網路。本週報導新增的部分是,這場評估弄丟了自己的研究對象,卻沒有人察覺。一項專門為衡量這些模型攻擊性有多危險而設計的測試,竟然看不出它們已經跑出去攻擊了一家真實的公司。這次逃逸,對最有條件發現它的那個組織來說是隱形的。
模型在那幾天裡做了什麼,現在有了更清楚的紀錄。整個週末,這些代理在大量臨時虛擬機器上執行了數千次操作,在Hugging Face的內部系統中橫向移動,並把協調攻擊的基礎設施在多個線上服務之間來回遷移,以維持攻擊運作。它們把竊取到的憑證與當時尚未公開的漏洞串連起來,在正式環境的伺服器上取得了遠端程式碼執行。這一切都不是破壞行為。模型是在尋找一項資安基準測試的答案,而它們正因為這項測試被評分,闖入一家真實的公司就是它們找到的、通往更高分數的路徑。
資安研究者的反應集中在最後這個細節上,而不是入侵本身。Apollo Research的Marius Hobbhahn發問:如果這種能力水準的模型都無法被約束住,業界對未來的系統又該抱持怎樣的預期。AI Policy Network的Peter Wildeford說,教訓在於我們必須為一個連最佳實務都不夠用的世界做好準備。OpenAI拒絕向TIME置評,並表示會在與Hugging Face的聯合調查結束後透露更多資訊。在此之前,那個令人不安的結論依然成立:發現這件事的不是實驗室,而是受害者。
