摘要
SkillForge 将可调用、可验证的 skill bank 放进多步环境中的 Agentic RL 回路:GRPO 同时学习环境动作和 skill 调用时机,成功与失败 rollout 驱动 skill 的提取、修订、去重和持续更新。模型参数与 skill bank 形成有限的交替共进化,但 improver 本身没有展示代际自改进。(来源:原始论文记录(本地存档),pp.3-6)
核心内容
- skill 以 intent、principle、适用条件和状态组织,检索到的 skill 内容作为观察返回;二值环境 outcome reward 通过 VeRL/GRPO 更新策略。(来源:原始论文记录(本地存档),pp.3-5)
- extraction、refinement、contrastive induction、语义去重和 EMA success rate 共同维护 skill bank,低效 skill 由 reflexion 决定 keep 或 revise。(来源:原始论文记录(本地存档),pp.5-6)
- 在 Qwen2.5-7B 上,作者报告 ALFWorld 93.6%、WebShop success 83.0%、AppWorld SGC 14.3;消融显示移除显式 skill calling 或 bank 会明显降分。(来源:原始论文记录(本地存档),pp.5-6)
相关页面
- 概念:Agentic RL、Recursive Self-Improvement、Self-Improving Harness
- 实体:SkillForge
- 主题:LLM Agent Self-Improvement
来源
- 原始文件:原始资料(本地存档)
- alphaXiv:https://www.alphaxiv.org/abs/2608.24747
- arXiv:https://arxiv.org/abs/2608.24747
- 定位信息:pp.1, 3-6, 8
待核实问题
- 版本与公开性核实(2026-08-28):仍为 arXiv v1;arXiv 页面、论文记录和作者信息中未找到官方代码、checkpoint 或训练数据链接,因此当前不能执行完整独立复现。
- 仍待实验拆分:teacher LLM、retrieval encoder、环境 verifier 和 H20 训练规模的独立贡献;论文消融不能完全替代跨实现复现。
- 分类边界:现有证据支持“策略参数与 skill bank 交替更新”,但没有证明 improver 本身发生代际改进,故仍只标为有限共进化。