摘要
WikiSkill 把不可变执行轨迹、持续累积的结构化知识和可执行技能分成 Raw、Wiki、Skill 三层:维护智能体从成功与失败轨迹中归纳模式,技能提案智能体按需读取这些模式与原始证据,外层验证门只保留提高验证分数的技能,但无论技能是否回滚都保留 Wiki。它展示的是冻结模型下的持久技能演化,不是用强化学习更新模型参数。(来源:原始论文记录(本地存档),§3,pp.4-6)
核心内容
- Wiki 层用
patterns/、logs.md和skill-impact.md分别保存可复用模式、按轮历史和技能提案的差异、分数及接受结果;技能用PURPOSE.md追溯到促成改动的模式。(来源:原始论文记录(本地存档),§3.1-3.2,pp.4-6) - 训练时 Inference Agent 只能看到完整注入的技能,不能读 Wiki;Wiki Maintainer 每轮抽样成功与失败轨迹,Skill Proposer 用 ReAct 主动读取需要的模式页和原始轨迹,每轮只修改一个技能。(来源:原始论文记录(本地存档),§3.2,pp.5-6;Appendix C-D)
- 在五个基准、五个模型的三次完整演化平均中,WikiSkill 的模型级平均分均高于无技能和三个对比方法;相对各模型最强对比方法高 3.3-12.0 个百分点。(来源:原始论文记录(本地存档),Table 1,pp.7-8)
- Gemini-3.5-Flash 消融中,持续 Wiki 使四基准平均分从 48.7% 升到 63.7%;让执行智能体在训练时也读取 Wiki,分数反而降至 60.9%,支持“知识层服务改进器而非直接替代技能”的设计边界。(来源:原始论文记录(本地存档),Table 3,§5.1,p.11)
- 技能可以跨模型家族迁移并超过自演化技能,但也会负迁移:Qwen-3.5-4B 的 SpreadsheetBench 技能使 Gemini-3.5-Flash 从 50.5% 降到 18.1%,说明程序性知识的来源模型、抽象层次和目标模型执行能力都影响效果。(来源:原始论文记录(本地存档),Table 2,§4.2.2,pp.9-10)
相关页面
- 概念:Context Engineering、Harness Optimization、Self-Improving Harness、Recursive Self-Improvement
- 实体:WikiSkill
- 主题:LLM Agent Self-Improvement
来源
- 原始文件:原始资料(本地存档)
- alphaXiv:https://www.alphaxiv.org/abs/2608.27454
- arXiv:https://arxiv.org/abs/2608.27454
- 定位信息:§3-5,pp.4-13;Limitations,p.14;Appendix B-D
待核实问题
- 版本与公开性(2026-08-30):当前为 arXiv v1;arXiv 条目与论文正文没有官方代码、数据或复现仓库链接。
- 仍待独立复现:五基准、五模型结果、跨模型迁移和 Wiki 消融均为作者报告;本知识库未重跑完整演化实验。
- 长期边界:技能检索与触发、Wiki 自动裁剪、中性提案的延迟收益,以及数百步或数小时任务尚未覆盖。