摘要
Agentic RL 指让可执行 LLM Agent 在多轮环境、工具或浏览器交互中依据轨迹回报更新策略或模型的强化学习范式。判断一项工作是否属于严格 Agentic RL,不能只看是否使用环境奖励,还要检查优化目标与更新机制是否真的是 RL;参数空间 ES、推理时搜索、SFT/蒸馏和静态 harness 评测应分别标注。(综合:Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Memory Requirements)
核心内容
定义
严格分类至少需要:可执行 Agent 与环境交互、多步或工具使用轨迹、可验证或标量奖励,以及基于交互结果更新策略/参数的 RL 优化过程。具体算法可包括策略梯度、actor-critic 或其他明确的 RL 目标;参数空间 ES 应作为相邻的黑盒参数优化单独记录。
关键要点
- 长程 Agent 的奖励通常在终止或稀疏事件出现,信用分配、rollout 成本、验证器抗投机和环境状态管理是核心工程问题。
- 环境回报本身不等于严格 Agentic RL。Agentic ESOpt 用轨迹回报更新完整参数,但采用 evolution strategy,而非策略梯度式 RL(来源:Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Memory Requirements,pp.3-4)。
- 需要分开记录训练时环境、推理时 scaffold、skill/context 蒸馏和模型参数更新,避免把“执行了 Agent”误写成“训练了 Agent policy”。
- FACET 是一个重要的非严格反例:它在可执行 terminal 环境中生成 rollout 并使用 verifier 筛选成功轨迹,但实际用这些轨迹做 SFT,论文没有用环境回报更新 agent policy;因此应标为“环境/任务构建 + SFT”,而不是严格 Agentic RL。(来源:FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis,§3.1 / §5)
- SkillForge 是严格 Agentic RL 的正例:GRPO 同时更新环境动作和 skill calling,二值 outcome rollout 还会持续提取、修订和去重 skill bank;它与 Recuris、StarHarness 形成“策略更新”与“外部 harness 演化”的对照。(来源:SkillForge: Evolving Verifiable Skills for Reinforcement Learning Agents)
- Astar 是另一种严格但较窄的正例:GRPO 更新提出工业系统演化方向的模型策略,奖励由 reward model 近似并由真实训练审计校准;代码 Agent、部署系统和下一轮训练构成执行闭环。它不等于 coding/browser/computer-use Agent 的工具动作 RL。(来源:Astar: Learning to Propose Evolution Directions for Self-Evolving Industrial AI Systems,pp.9-16)
- Shepherd 的 Tree-GRPO 是严格正例:共享前缀的 terminal rollout 产生 sibling outcome advantage,再用 clipped GRPO 更新 Qwen/Nemotron worker policy;同一论文中的运行时 supervisor 与 CRO 没有参数更新,不属于 Agentic RL。(来源:Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces,§4.3)
- WebArena 与 OSWorld 是两个重要反例:它们定义多步环境和终局 reward,但原论文只评测固定模型,没有根据回报更新 policy。环境可供 RL 使用,不能反推环境论文自身属于 RL。(来源:WebArena: A Realistic Web Environment for Building Autonomous Agents、OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments)
适用范围与边界
该概念覆盖 coding、browser-use、computer-use、研究和检索 Agent 的在线或离线交互训练;单轮 RLHF、纯 SFT、只换 harness 后评测、任务内 self-refine 和无参数更新的搜索不应自动归入严格 Agentic RL。
分歧与演变
“Agentic RL”在论文和项目中常被用作宽泛标签,实际机制可能是策略优化、参数空间搜索、测试时搜索或上下文蒸馏。比较结果时应优先以训练目标、奖励、rollout 与更新代码为准,而不是以标题命名为准。
相关页面
- 上位概念:LLM Agent Self-Improvement
- 相关概念:Harness Engineering、Harness Optimization、Recursive Self-Improvement、Browser-Use Agent、Computer-Use Agent、Execution-Based Agent Evaluation
- 相关实体:Agentic ESOpt、SkillForge、Shepherd、WebArena、OSWorld
- 相关主题:LLM Agent Self-Improvement、Browser and Computer-Use Agents
来源
- Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Memory Requirements
- FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis
- SkillForge: Evolving Verifiable Skills for Reinforcement Learning Agents
- Astar: Learning to Propose Evolution Directions for Self-Evolving Industrial AI Systems
- Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces
- WebArena: A Realistic Web Environment for Building Autonomous Agents
- OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments
待核实问题
- 需要补充更多明确采用策略梯度、异步 rollout、过程奖励和环境生成的原始论文,以完善与参数空间 ES 的比较。