摘要
WikiSkill 是 Google Research 提出的技能演化研究框架。它在不可变执行轨迹与可执行技能之间加入持续累积的 Wiki,把跨轮失败模式、成功策略和技能影响记录转成后续技能更新的证据。
核心内容
基本信息
- 实体类别:研究方法与技能演化框架
- 关键名称或版本:arXiv:2608.27454v1
- 时间范围:2026-08-27 至今
重要事实
- 工作区分为 Raw、Wiki、Skill 三层;技能更新可被验证门回滚,Wiki 模式和技能影响记录持续保留。(来源:WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution)
- 论文在五个基准、五个模型上与无技能、Trace2Skill、EvoSkill、SkillOpt 比较,并用三次完整演化平均和 paired bootstrap 报告结果。(来源:WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution)
- 持久 Wiki 消融显示,知识层对技能提案智能体有显著帮助,但在训练 rollout 中把 Wiki 同时暴露给执行智能体会降低最终技能质量。(来源:WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution)
关系与影响
WikiSkill 把 Context Engineering 的持久、按需上下文组织用于改进器,并以 Harness Optimization 的验证与回滚门演化程序性技能。它属于 Self-Improving Harness 的窄编辑面实例;模型权重和改进器本身均不更新,因此不是严格 Agentic RL,也不构成完整 Recursive Self-Improvement。(综合:WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution)
分歧与变化
当前证据只来自 v1 预印本。作者报告的跨模型迁移既包含显著正迁移,也包含 SpreadsheetBench 上的严重负迁移,不能把“技能可迁移”理解为与来源模型无关的稳定性质。(来源:WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution)
相关页面
- 概念:Context Engineering、Harness Optimization、Self-Improving Harness、Recursive Self-Improvement
- 实体:SkillForge、Recuris、HarnessLens
- 主题:LLM Agent Self-Improvement
来源
待核实问题
- 官方代码、数据和完整复现仓库尚未发布或未被本知识库发现。
- 需独立复现持续 Wiki 的增益,并测试技能检索、知识裁剪、长期成本和跨模型负迁移。