摘要
Agentic ESOpt 用参数空间 evolution strategy 在真实或模拟 Agent 环境中以标量轨迹回报更新完整 LLM 参数,目标是在低推理显存下适配长程 Agent。论文覆盖 Sudoku、ReAct Math、DocVQA、WebArena-Lite 以及与搜索 scaffold 的组合;其主要价值是把低显存参数搜索带入长程工具使用场景,但按严格定义它不是策略梯度式 Agentic RL,也没有证明持久 harness 自演化。(来源:原始资料(本地存档),pp.3-4、6、8-10)
核心内容
- 每代采样完整参数扰动,在环境中执行 Agent,按轨迹标量回报 z-score 后更新参数;实现使用有种子的噪声、原地加减和 sigma 余弦衰减。(来源:原始资料(本地存档),pp.3-4)
- Sudoku H*=15 上,Agentic ESOpt 达到 53.13±2.55%,高于最强 Agentic GRPO 的 40.63±2.55%,而报告的模型显存约为 8.41GB。(来源:原始资料(本地存档),p.6 / Table 1)
- Qwen3.5-4B 的 Math、AIME、DocVQA ESOpt+No Skill Mean@4 分别为 76.8、70.8、52.5,高于对应 No Skill 的 63.0、55.8、40.3;WebArena-Lite 平均成功率由 29.47±1.14% 提升到 36.16±0.70%。(来源:原始资料(本地存档),p.8、p.9)
- 论文将模型参数与 skill/context 组合称作 co-evolution,但 WebArena 的 Trace2Skill 组合没有第二阶段 skill-conditioned ES 或交替联合优化。因此可作为模型-外部上下文共演化的弱原型,不能直接归入严格 RSI。(综合分类,依据:原始资料(本地存档),p.9 / Appendix D.4.3)
- 主要限制是 sigma 调参、长轨迹评估成本和 continual learning 稳定性;当前结果缺少独立复现。(来源:原始资料(本地存档),Appendix A.1 p.16)
相关页面
- 概念:Agentic RL、Harness Engineering、Harness Optimization、Recursive Self-Improvement
- 实体:Agentic ESOpt
- 主题:LLM Agent Self-Improvement
来源
- 原始文件:原始资料(本地存档)
- alphaXiv:https://www.alphaxiv.org/abs/2608.agentic-esopt-long-horizon-llm
- arXiv:https://arxiv.org/abs/2608.17310
- 代码:https://github.com/zz1358m/Agentic-ESOpt
- 定位信息:算法 pp.3-4;Sudoku p.6 / Table 1;Math、DocVQA p.8 / Table 3;WebArena p.9 / Appendix D.4.3;AHD pp.9-10 / Appendix D.5;限制 Appendix A.1 p.16。