摘要

Shepherd 是一个面向可编程 Meta-Agent 的开源、自托管运行时研究系统。它把 agent 与环境的联合状态记录为 Reversible Agentic Execution Trace,让监督、反事实优化与树形训练能够从历史提交分叉和局部重放。(来源:Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces,表 2,pp.4-6;§5)

核心内容

基本信息

重要事实

关系与影响

Shepherd 为 Harness Engineering 提供了一种把执行轨迹变成一等运行时对象的实现,并为 Harness OptimizationSelf-Improving Harness 提供局部重放和反事实验证机制。Tree-GRPO 属于严格 Agentic RL,而 substrate、supervisor 和 CRO 本身不属于严格 Agentic RL。(综合依据:Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces,§5.1-5.3)

分歧与变化

论文 v3 的结果绑定实验仓库中的 frozen substrate snapshot,当前框架 main 已继续演进,因此论文数字不应视为当前版本的回归结果。Terminal-Bench 2.0 Stable25 的 train/dev/test 还是完全重叠的同一 25 个任务,相关提升不代表 held-out 泛化。(来源:Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces,表 15、附录 F.3、项目核验)

相关页面

来源

待核实问题