摘要

Shepherd 把 worker agent 与其环境的执行状态组织为可观察、拦截、分叉、回退和重放的一等对象,使 Meta-Agent 不必靠拼接 transcript 重建中间状态。论文用运行时监督、Counterfactual Replay Optimization(CRO)和 Tree-GRPO 展示这一 substrate,但把三组结果定位为 proof of existence,而非跨模型、跨基准的稳健性或独立复现。(来源:论文核验记录(本地存档),主文 pp.1-10;附录 A.1,p.15)

核心内容

书目信息

  • 作者:Simon Yu、Derek Chong、Ananjan Nandi、Dilara Soylu、Jiuding Sun、Christopher D. Manning、Weiyan Shi。(来源:论文核验记录(本地存档))
  • arXiv 首次提交于 2026-05-11;本页核对版本为 2605.10913v3,修订于 2026-06-24。该资料是 arXiv 预印本,本页不把作者结果写成同行评审结论。(来源:论文核验记录(本地存档))

运行时模型

  • 四个原语分别是 Task(带类型输入输出的 agent 定义)、Effect(动作 intent 与 outcome)、Scope(agent、文件系统、进程和工具环境的耦合执行域)与 Trace(持久的 Git 式提交图)。(来源:论文核验记录(本地存档),表 2,pp.4-6)
  • Meta-Agent 可在 Effect outcome 落地前观察或拦截 intent;Scope 以 copy-on-write 方式分叉 agent 与环境状态;Trace 让历史提交可寻址,分支共享前缀并只重放差异后缀。(来源:论文核验记录(本地存档),pp.5-6)
  • 可逆性分为原生 reversible、需要补偿处理器的 compensable、以及只能审计的 irreversible 三类。数据库写入、邮件和新的模型调用不因存在 Trace 就自动可撤销或确定性重现。(来源:论文核验记录(本地存档),p.5)
  • Lean 机械化只覆盖小型 trace machine 及满足静态 lowering 条件的片段;普通 Python 执行默认是 runtime_only,模型输出、SDK、shell、文件系统、sandbox 与多分支重放均不在证明范围内。(来源:论文核验记录(本地存档),附录 B、表 6,p.16)

系统性能

  • 三种 Terminal-Bench 2.0 镜像上的 fork 为 134-143 ms、revert 为 140-147 ms;在 5.8 GB 镜像上,Docker commit/run 为 725 ms、revert 为 828 ms,完整复制为 53.462 s 与 25.943 s。这些都是作者环境中的微基准。(来源:论文核验记录(本地存档),表 3,pp.6-7)
  • Claude Haiku 4.5、8 个 Terminal-Bench 2.0 任务的实验中,分叉数 K>=2 后平均 prompt-cache hit 约 95%;该结果依赖 Anthropic 缓存与论文设置,不能外推到所有模型后端。(来源:论文核验记录(本地存档),表 10,p.21)
  • 后端并不等价:本地 Docker/E2B 可利用 OverlayFS,Modal 使用 snapshot API,部分 gVisor 环境会退化为随工作目录增长的复制。(来源:论文核验记录(本地存档),表 11,p.21)

三类应用与作者报告结果

  • 运行时监督:CooperBench 配对编码的 joint pass rate 从无 Meta-Agent 的 28.8% 提升到 Sonnet 4.6 supervisor 的 45.3% 和 Opus 4.7 supervisor 的 54.7%。(来源:论文核验记录(本地存档),图 1,p.1)
  • CRO:候选编辑绑定 fix set 与 guard set,从最早受影响提交处分叉并只重放后缀,再由 dev set 选出持久工作流。论文报告它在五个数据集中的四个得到最高 test score;Terminal-Bench 2.0 从 31.2 提升到 35.2,wall-clock 为 73 分钟,对比 MetaHarness 的 173 分钟。(来源:论文核验记录(本地存档),表 4,pp.9-10)
  • Tree-GRPO:在 Endless Terminals 训练、Terminal-Bench 2.0 OOD 测试中,Qwen3.5-35B-A3B 的 Base / Flat GRPO / Tree-GRPO 为 26.1% / 34.2% / 39.4%;Nemotron-3-Super-120B-A12B 为 30.3% / 33.8% / 37.2%。(来源:论文核验记录(本地存档),表 5,p.10)

证据边界

  • Terminal-Bench 2.0 Stable25 的 train、dev、test 三栏均为同一组 25 个任务,论文明确称其为 overlapping splits,并说明 Stable25 同时充当 optimisation 与 reporting split。因此表 4 的提升不是 held-out 泛化证据;公开实验快照的 manifest 也为三者枚举了完全相同的 25 个 ID。(来源:论文核验记录(本地存档),表 15,p.35;附录 F.3,p.40;实验 commit c12ebd1b774cf12f70ef2b4486e61e7052f3e3ab
  • 附录 A.1 指向 F.4 的“逐臂总美元成本”,但 v3 的 F.4 只有 wall-clock 与 cache-reuse 图,没有这张成本表;实验快照也注明 MetaHarness proposer cost 未被归档。美元成本目前应标为缺失,不能自行补算。(来源:论文核验记录(本地存档),附录 A.1,p.15;附录 F.4,pp.40-44)
  • 对实验 commit c12ebd1b774cf12f70ef2b4486e61e7052f3e3ab 的本地仓库测试不是结果复现:CBO tests 为 5 passed, 4 failed,失败源于三个缺失的归一化结果目录;Tree advantage tests 为 11 passed, 1 failed,当前实现与测试对缩放因子的预期不一致。精确命令与失败范围保存在 Raw 核验记录。(来源:论文核验记录(本地存档),项目核验)

分类判断

  • 严格 Agentic RL(综合):substrate、运行时 supervisor 与 CRO 本身都不更新策略参数,不属于严格 Agentic RL;Tree-GRPO 使用交互 rollout、终局 reward 与 GRPO 目标更新模型参数,属于严格 Agentic RL。(综合依据:论文核验记录(本地存档),§5.1-5.3)
  • RSI(综合):CRO 会把选中的工作流编辑持久化,属于 harness 层的自改进;Tree-GRPO 会持久更新模型。但论文没有让改进器本身跨代变强,也没有模型、harness 与环境相互递归改进的闭环,所以整体不构成严格 Recursive Self-Improvement。(综合依据:论文核验记录(本地存档),§5.2-5.3)

开源状态

  • Shepherd 框架与 shepherd-experiments 均使用 MIT License。框架仍标为 early alpha;本次框架核对 commit 为 4b44f4e8822a919a74b4bf9c13d9370dbf4cd9be,其 GitHub Actions CI 成功。(来源:论文核验记录(本地存档),项目核验)
  • 论文实验绑定实验仓库内的 frozen substrate snapshot,不能把论文数字直接视为当前框架 main 的回归结果。(来源:论文核验记录(本地存档),项目核验)

相关页面

来源

待核实问题

  • 尚无独立端到端复现来确认微基准、CooperBench、CRO 与 Tree-GRPO 数字。
  • 论文需补齐逐实验臂美元成本,并说明缺失的 MetaHarness proposer cost 如何处理。
  • 公开实验快照需补齐 CBO tests 所依赖的归一化结果产物,并统一 Tree advantage 实现与测试预期。
  • Stable25 重叠协议只能支持同集优化比较;对 held-out Terminal-Bench 2.0 任务的泛化仍待验证。