WikiSkill 针对的问题,是每个做智能体的人都会撞上的:智能体解决了一个难题,而当这次运行结束,那点洞见就蒸发了。近期工作能从智能体经验中发现可复用的技能,但正如论文所说,指导技能发展的洞见仍然"散落在优化历史之中",于是什么也积累不下来。谷歌研究院的答案,写在本周发布的 arXiv 2608.27454 论文里,作者是 Liyan Tang、Cyrus Rashtchian、Chun-Sung Ferng、Andrew Tomkins、Da-Cheng Juan 和 Tu Vu,答案是:给智能体一个维基。
设计由三层构成,而它们被刻意区分开。原始层保存完整的执行日志。维基层存放提炼后的洞见,记录什么失败了、什么奏效了以及为什么,并且永不重置。技能层存放程序性指令,当表现下滑时可以重置。每一轮迭代依次是执行、分析、技能提议,再经过一道门的校验,才会真正写下任何东西。这里没有任何一步触及模型权重:学习活在文本里,由同一个模型下次读取。
据 The Decoder 报道,这些数字覆盖五类任务:数学推理、网页搜索、电子表格操作、文档问答和交互式环境,使用的模型包括 4B 到 27B 的 Qwen、Gemma 和 Gemini。Gemini 3.5 Flash 平均从 49.5% 升至 68.1%;Qwen-27B 从 39.4% 升至 63.3%;单项最大增益是 LiveMath 从 33.0% 到 72.6%,以及电子表格任务从 50.5% 到 76.6%。所报告的规律是:更大的模型从演化出的技能中获益更多,而较小的模型可以借用这些技能,接近更大模型的表现。
局限性和标题一样值钱。增益随任务类型剧烈波动,长文档语境几乎没有变化,而在模型之间迁移技能有时反而有害。即便如此,对于在生产中运行智能体的人来说,方向才是有意思的部分:这既不是更大的上下文窗口,也不是更好的检索器,而是一个策展人,一个在把经验存起来之前先判定它意味着什么的显式步骤。如果说编码正是图书馆与图书管理员之间的分野,那么这篇论文是把图书管理员写下来的一次认真尝试。
