Google Research 发布 WikiSkill,用持久 Wiki 进化 Agent 技能

Google Research 团队发布 WikiSkill 研究框架,把智能体的执行记录整理成持久 Wiki,再用这些知识持续创建和修改 Agent 技能。实验覆盖 5 类任务和 5 个模型;Qwen 9B 搭配进化技能后的平均成绩为 47.4%,超过无技能 Qwen 27B 的 39.4%。
Google WikiSkill 持久知识库与 Agent 技能进化流程

Wiki 不是给执行 Agent 直接查答案

WikiSkill 处理的是一个常见问题:智能体完成任务后会留下大量执行记录,包括推理步骤、工具调用、返回结果和最终答案,但这些经验容易散落在日志里。下一轮改技能时,系统可能重新分析同类错误,也可能重复已经失败的修改。

它把工作区拆成三层。raw/ 保存不可修改的原始执行记录;wiki/ 用 Markdown 页面整理反复出现的失败模式、有效策略、历次修改和验证结果;skills/ 存放真正交给执行 Agent 使用的流程指令。模型参数不需要更新,积累发生在工作区里的知识和技能文件中。

这里的 Wiki 更像技能维护者的工作笔记,不是执行 Agent 的外接记忆。在默认设置里,执行 Agent 只能读取当前技能,不能直接访问 Wiki。这样生成的执行记录会更清楚地暴露技能缺少哪些步骤。

四步循环把经验变成可验证的技能修改

每轮进化从执行任务开始。Inference Agent 使用当前技能完成训练任务,并把过程写入 Raw 层。Wiki Maintainer 随后分析成功和失败记录,把原因、策略与历史结果整理进 Wiki。

Skill Proposer 再读取 Wiki 和相关原始记录,每轮只创建一个技能或对一个技能做增量修改。候选技能会在独立验证集上评分;成绩高于此前最佳结果才会保留,否则回滚技能。无论修改是否通过,Wiki 都会保存提案、差异、得分和接受结果,避免后续再次提交同一种无效改法。

这套设计把“发生过什么”“从中总结出什么”“下一次具体怎么做”分开管理。原始记录用于追溯,Wiki 用于积累判断,Skill 保持为执行时需要的简洁步骤。

9B 模型配合技能超过无技能 27B 模型

实验覆盖数学推理、网页搜索、电子表格处理、长文档问答和文本交互环境 5 类任务,测试了 Qwen、Gemma 与 Gemini 系列的 5 个模型。所有方法都从空技能集开始,最终成绩取 3 次完整进化流程的平均值。

Qwen 3.5 9B 不使用技能时平均成绩为 29.9%,使用 WikiSkill 进化出的技能后达到 47.4%。无技能 Qwen 3.6 27B 的平均成绩为 39.4%。在 Qwen 3.6 27B 上,WikiSkill 把 5 类任务的平均成绩从 39.4% 提到 63.3%;Gemini 3.5 Flash 则从 49.5% 提到 68.1%。

持久 Wiki 的作用也经过拆分测试。当执行 Agent 不读取 Wiki 时,让 Skill Proposer 使用持久 Wiki,4 类任务平均成绩从 48.7% 提到 63.7%。如果执行 Agent 也能读取 Wiki,平均成绩反而降到 60.9%。这个结果只说明该实验配置下的访问分工,不等同于所有智能体系统都应禁止执行端读取长期知识。

技能能迁移,但不保证换模型后继续有效

WikiSkill 生成的技能可以跨模型使用。Qwen 3.6 27B 进化出的电子表格技能交给 Qwen 3.5 9B 后,成绩达到 50.5%,高于其自进化技能的 33.6%。在 ALFWorld 交互任务中,同一迁移把 Qwen 3.5 9B 的成绩从自进化技能下的 63.4% 提到 70.2%。

迁移也可能变差。Qwen 3.5 4B 生成的电子表格技能让 Gemini 3.5 Flash 的成绩从无技能时的 50.5% 降到 18.1%。这些技能包含适合小模型规避执行错误的低层操作和碎片化检查步骤,放到更强模型上会限制完整脚本的使用,并消耗更多工具调用次数。

对开发团队来说,Skill 可以成为独立于模型参数的可审计资产,但不能把某个模型验证过的技能直接视为通用流程。换模型、换工具或换任务环境后,仍要用独立验证集重新评分,并保留回滚能力。

目前适合研究技能维护流程

WikiSkill 评估的是技能质量,没有测试技能库变大后如何自动检索和触发合适的技能。实验会把当前技能全文放入执行 Agent 的提示词,这与拥有大量技能的实际系统不同。

Wiki 还会持续增加模式页面、历史日志和修改差异,当前方法没有自动清理机制。实验任务包含长文档与多步工具调用,但没有覆盖持续数小时或数百次环境操作的超长任务。现阶段更适合把它看作一套技能演化与验证方法,而不是一个下载后即可接入现有 Agent 的成品服务。