摘要
Shepherd 是一个面向可编程 Meta-Agent 的开源、自托管运行时研究系统。它把 agent 与环境的联合状态记录为 Reversible Agentic Execution Trace,让监督、反事实优化与树形训练能够从历史提交分叉和局部重放。(来源:Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces,表 2,pp.4-6;§5)
核心内容
基本信息
- 实体类别:智能体运行时与研究项目
- 关键名称或版本:Shepherd
- 时间范围:论文于 2026-05-11 首次提交,当前核对到 arXiv v3(2026-06-24);项目仍定位为 early-alpha 研究预览。(来源:Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces;Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces)
- 研究团队:作者来自 Northeastern University 与 Stanford University。(来源:Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces)
重要事实
- 四个核心原语为 Task、Effect、Scope 和 Trace,分别对应带类型的 agent 定义、动作 intent/outcome、agent 与环境的耦合执行域、以及持久提交图。(来源:Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces,表 2,pp.4-6)
- 支持观察、拦截、分叉、修改、回退与局部重放;文件系统等状态可原生回滚,但外部写入可能依赖补偿处理器,不可逆副作用只能审计。(来源:Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces,p.5)
- 作者用运行时监督、CRO 与 Tree-GRPO 展示系统用途:CooperBench joint pass rate 最高从 28.8% 到 54.7%;Tree-GRPO 在两个模型的 OOD Terminal-Bench 2.0 测试中分别报告 39.4% 和 37.2%。这些是 proof-of-existence 案例,不是独立复现。(来源:Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces,图 1、表 5、附录 A.1)
- Lean 证明不覆盖整个生产运行时;普通 Python run 默认为
runtime_only,模型、shell、文件系统、sandbox 与多分支重放都在非声明范围内。(来源:Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces,附录 B、表 6)
关系与影响
Shepherd 为 Harness Engineering 提供了一种把执行轨迹变成一等运行时对象的实现,并为 Harness Optimization 与 Self-Improving Harness 提供局部重放和反事实验证机制。Tree-GRPO 属于严格 Agentic RL,而 substrate、supervisor 和 CRO 本身不属于严格 Agentic RL。(综合依据:Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces,§5.1-5.3)
分歧与变化
论文 v3 的结果绑定实验仓库中的 frozen substrate snapshot,当前框架 main 已继续演进,因此论文数字不应视为当前版本的回归结果。Terminal-Bench 2.0 Stable25 的 train/dev/test 还是完全重叠的同一 25 个任务,相关提升不代表 held-out 泛化。(来源:Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces,表 15、附录 F.3、项目核验)
相关页面
- 概念:Meta-Agent、Reversible Agentic Execution Trace、Harness Engineering、Harness Optimization、Self-Improving Harness、Agentic RL、Recursive Self-Improvement、Agent Failure Localization
- 实体:无
- 主题:LLM Agent Self-Improvement
来源
- Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces
- Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces
待核实问题
- 生产版本路线、API 稳定性、补偿处理器的安全边界及跨后端一致性仍待后续资料。
- 公开实验快照的部分单元测试因结果产物缺失或实现/测试预期不一致而失败,尚需上游修复;三组论文结果仍待独立端到端复现。(来源:Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces,项目核验)