摘要

Agentic RL 指让可执行 LLM Agent 在多轮环境、工具或浏览器交互中依据轨迹回报更新策略或模型的强化学习范式。判断一项工作是否属于严格 Agentic RL,不能只看是否使用环境奖励,还要检查优化目标与更新机制是否真的是 RL;参数空间 ES、推理时搜索、SFT/蒸馏和静态 harness 评测应分别标注。(综合:Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Memory Requirements

核心内容

定义

严格分类至少需要:可执行 Agent 与环境交互、多步或工具使用轨迹、可验证或标量奖励,以及基于交互结果更新策略/参数的 RL 优化过程。具体算法可包括策略梯度、actor-critic 或其他明确的 RL 目标;参数空间 ES 应作为相邻的黑盒参数优化单独记录。

关键要点

适用范围与边界

该概念覆盖 coding、browser-use、computer-use、研究和检索 Agent 的在线或离线交互训练;单轮 RLHF、纯 SFT、只换 harness 后评测、任务内 self-refine 和无参数更新的搜索不应自动归入严格 Agentic RL。

分歧与演变

“Agentic RL”在论文和项目中常被用作宽泛标签,实际机制可能是策略优化、参数空间搜索、测试时搜索或上下文蒸馏。比较结果时应优先以训练目标、奖励、rollout 与更新代码为准,而不是以标题命名为准。

相关页面

来源

待核实问题

  • 需要补充更多明确采用策略梯度、异步 rollout、过程奖励和环境生成的原始论文,以完善与参数空间 ES 的比较。