摘要

Agentic ESOpt 用参数空间 evolution strategy 在真实或模拟 Agent 环境中以标量轨迹回报更新完整 LLM 参数,目标是在低推理显存下适配长程 Agent。论文覆盖 Sudoku、ReAct Math、DocVQA、WebArena-Lite 以及与搜索 scaffold 的组合;其主要价值是把低显存参数搜索带入长程工具使用场景,但按严格定义它不是策略梯度式 Agentic RL,也没有证明持久 harness 自演化。(来源:原始资料(本地存档),pp.3-4、6、8-10)

核心内容

  • 每代采样完整参数扰动,在环境中执行 Agent,按轨迹标量回报 z-score 后更新参数;实现使用有种子的噪声、原地加减和 sigma 余弦衰减。(来源:原始资料(本地存档),pp.3-4)
  • Sudoku H*=15 上,Agentic ESOpt 达到 53.13±2.55%,高于最强 Agentic GRPO 的 40.63±2.55%,而报告的模型显存约为 8.41GB。(来源:原始资料(本地存档),p.6 / Table 1)
  • Qwen3.5-4B 的 Math、AIME、DocVQA ESOpt+No Skill Mean@4 分别为 76.8、70.8、52.5,高于对应 No Skill 的 63.0、55.8、40.3;WebArena-Lite 平均成功率由 29.47±1.14% 提升到 36.16±0.70%。(来源:原始资料(本地存档),p.8、p.9)
  • 论文将模型参数与 skill/context 组合称作 co-evolution,但 WebArena 的 Trace2Skill 组合没有第二阶段 skill-conditioned ES 或交替联合优化。因此可作为模型-外部上下文共演化的弱原型,不能直接归入严格 RSI。(综合分类,依据:原始资料(本地存档),p.9 / Appendix D.4.3)
  • 主要限制是 sigma 调参、长轨迹评估成本和 continual learning 稳定性;当前结果缺少独立复现。(来源:原始资料(本地存档),Appendix A.1 p.16)

相关页面

来源

待核实问题

  • 已核实(2026-08-28):传统 arXiv ID 为 2608.17310,当前为 v2(2026-08-21)。公开仓库已提供共享 ES 实现、任务入口、实验日志和 Math、DocVQA、WebArena、Sudoku checkpoint 链接。(arXivGitHub
  • 仍待独立复现:公开资源提高了可复现性,但本知识库尚未运行 GPU 训练或三次 WebArena-Lite 评估,不能据此确认论文数值。
  • 仍待跟踪:同行评审状态、完整端到端算力账本和大模型规模下的长期稳定性。