摘要
Agentic ESOpt 是一项将参数空间 evolution strategy 用于长程 LLM Agent 适配的方法与配套代码项目,重点是以较低推理显存执行完整参数扰动、环境交互和标量回报更新。(来源:Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Memory Requirements)
核心内容
基本信息
- 实体类别:Agent 训练方法与开源实现
- 关键名称或版本:Agentic ESOpt;arXiv:2608.17310v2
- 时间范围:arXiv v1 提交于 2026-08-18,v2 修订于 2026-08-21
重要事实
- 方法对完整模型参数采样扰动,在 Sudoku、数学、DocVQA 和浏览器任务中以轨迹回报做无反向传播更新。(来源:Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Memory Requirements,pp.3-4、6、8-10)
- 论文报告了低显存与任务成功率收益,但没有独立复现;仓库为 MIT 许可证,README 要求 Linux、NVIDIA GPU、Python 3.10+,并给出 vLLM/VERL 等依赖。(来源:Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Memory Requirements;代码仓库)
关系与影响
它连接了 Agentic RL、Harness Optimization 与 LLM Agent Self-Improvement:环境回报会更新模型参数,但 Trace2Skill 组合仍不足以证明持久 harness 或模型-harness 的严格 RSI。(综合:Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Memory Requirements)
分歧与变化
论文使用“Agentic RL”和“co-evolution”等宽泛表述;本知识库按优化机制将其标为参数空间 ES,而非严格策略梯度 Agentic RL,并保留其模型-外部上下文共演化的弱解释。(综合:Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Memory Requirements)
相关页面
- 概念:Agentic RL、Harness Engineering、Harness Optimization、Recursive Self-Improvement
- 实体:无
- 主题:LLM Agent Self-Improvement
来源
- Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Memory Requirements
- https://github.com/zz1358m/Agentic-ESOpt
待核实问题
- 已核实(2026-08-28):已定位 arXiv:2608.17310v2;代码、任务入口、实验日志与四类 checkpoint 已公开。
- 仍待核验:同行评审、独立复现、完整算力账本和大模型规模下的稳定性。