摘要

SkillForge 将可调用、可验证的 skill bank 放进多步环境中的 Agentic RL 回路:GRPO 同时学习环境动作和 skill 调用时机,成功与失败 rollout 驱动 skill 的提取、修订、去重和持续更新。模型参数与 skill bank 形成有限的交替共进化,但 improver 本身没有展示代际自改进。(来源:原始论文记录(本地存档),pp.3-6)

核心内容

  • skill 以 intent、principle、适用条件和状态组织,检索到的 skill 内容作为观察返回;二值环境 outcome reward 通过 VeRL/GRPO 更新策略。(来源:原始论文记录(本地存档),pp.3-5)
  • extraction、refinement、contrastive induction、语义去重和 EMA success rate 共同维护 skill bank,低效 skill 由 reflexion 决定 keep 或 revise。(来源:原始论文记录(本地存档),pp.5-6)
  • 在 Qwen2.5-7B 上,作者报告 ALFWorld 93.6%、WebShop success 83.0%、AppWorld SGC 14.3;消融显示移除显式 skill calling 或 bank 会明显降分。(来源:原始论文记录(本地存档),pp.5-6)

相关页面

来源

待核实问题

  • 版本与公开性核实(2026-08-28):仍为 arXiv v1;arXiv 页面、论文记录和作者信息中未找到官方代码、checkpoint 或训练数据链接,因此当前不能执行完整独立复现。
  • 仍待实验拆分:teacher LLM、retrieval encoder、环境 verifier 和 H20 训练规模的独立贡献;论文消融不能完全替代跨实现复现。
  • 分类边界:现有证据支持“策略参数与 skill bank 交替更新”,但没有证明 improver 本身发生代际改进,故仍只标为有限共进化。