WikiSkill 針對的問題,是每個做智慧體的人都會撞上的:智慧體解決了一個難題,而當這次執行結束,那點洞見就蒸發了。近期工作能從智慧體經驗中發現可複用的技能,但正如論文所說,指導技能發展的洞見仍然「散落在優化歷史之中」,於是什麼也累積不下來。Google 研究院的答案,寫在本週發布的 arXiv 2608.27454 論文裡,作者是 Liyan Tang、Cyrus Rashtchian、Chun-Sung Ferng、Andrew Tomkins、Da-Cheng Juan 和 Tu Vu,答案是:給智慧體一個維基。
設計由三層構成,而它們被刻意區分開。原始層保存完整的執行日誌。維基層存放提煉後的洞見,記錄什麼失敗了、什麼奏效了以及為什麼,並且永不重置。技能層存放程序性指令,當表現下滑時可以重置。每一輪迭代依次是執行、分析、技能提議,再經過一道門的校驗,才會真正寫下任何東西。這裡沒有任何一步觸及模型權重:學習活在文字裡,由同一個模型下次讀取。
據 The Decoder 報導,這些數字涵蓋五類任務:數學推理、網頁搜尋、試算表操作、文件問答和互動式環境,使用的模型包括 4B 到 27B 的 Qwen、Gemma 和 Gemini。Gemini 3.5 Flash 平均從 49.5% 升至 68.1%;Qwen-27B 從 39.4% 升至 63.3%;單項最大增益是 LiveMath 從 33.0% 到 72.6%,以及試算表任務從 50.5% 到 76.6%。所報告的規律是:更大的模型從演化出的技能中獲益更多,而較小的模型可以借用這些技能,接近更大模型的表現。
侷限性和標題一樣值錢。增益隨任務類型劇烈波動,長文件語境幾乎沒有變化,而在模型之間遷移技能有時反而有害。即便如此,對於在生產中執行智慧體的人來說,方向才是有意思的部分:這既不是更大的上下文視窗,也不是更好的檢索器,而是一個策展人,一個在把經驗存起來之前先判定它意味著什麼的顯式步驟。如果說編碼正是圖書館與圖書管理員之間的分野,那麼這篇論文是把圖書管理員寫下來的一次認真嘗試。
