摘要
Shepherd 是面向可编程 Meta-Agent 的运行时基础设施。它把模型调用、工具调用和文件写入记录为可回退的 Git 式执行轨迹,使另一个智能体能够在运行期间观察、分叉、修改、回退和恢复工作智能体及其环境。(来源:原始网页记录(本地存档))
核心内容
问题与设计
- 传统智能体框架通常只暴露原始对话记录和最终环境快照,Meta-Agent 若要干预,往往需要自行重建中间执行状态。(来源:原始网页记录(本地存档),Motivation)
- Shepherd 将智能体运行转化为可操作的数据结构,并用 Task、Effect、Scope、Trace 四个原语表示任务、动作意图、执行环境和提交图。(来源:原始网页记录(本地存档),Runtime Substrate)
- Effect 在实际执行前先记录动作意图,使 Meta-Agent 有机会阻止或修改危险操作;Scope 的分叉会同时复制智能体状态和文件系统环境。(来源:原始网页记录(本地存档),Runtime Substrate)
- Reversible Agentic Execution Trace 允许按历史节点分叉、保留成功分支、丢弃失败分支,并检查每次模型调用、工具调用和编辑。(来源:原始网页记录(本地存档),Runtime Substrate)
系统性能
- 项目页报告,在其单机测试中,Shepherd 对 42 MB 至 5.8 GB 环境的分叉延迟约为 134 至 143 毫秒,回退约为 140 至 147 毫秒;分支可复用未改变前缀的缓存。(来源:原始网页记录(本地存档),Infrastructure)
- 这些数据来自项目方设定的三种 Terminal-Bench 2.0 镜像和 4 vCPU / 8 GB Linux 主机,不能直接外推到所有后端与工作负载。(来源:原始网页记录(本地存档),Infrastructure / Setup)
三类 Meta-Agent 实验
- 运行时监督:监督智能体通过注入提示、移交工作或丢弃失败分支协调两个并行编码智能体;项目页报告 CooperBench 配对通过率由协作基线的 28.8% 提升至最高 54.7%。(来源:原始网页记录(本地存档),Multi-Agent Runtime Intervention)
- 反事实元优化:CRO 只从受改动影响的第一个轨迹节点重放后缀,以更局部地比较工作流修改;项目页报告其在五个基准中的四个取得最佳分数与最低优化耗时。(来源:原始网页记录(本地存档),Counterfactual Meta-Optimization)
- Meta-Agent 引导的树形强化学习:在选定步骤分叉多个共享前缀的后续轨迹,以分支间最终奖励差异形成更细粒度的信用分配信号。(来源:原始网页记录(本地存档),Meta-Agent-Guided Tree RL)
当前边界
- 项目页将 Shepherd 定位为研究预览而非成熟生产系统,并称其支持 Linux、macOS、自托管以及多种容器后端;Windows 原生支持尚未完成。(来源:原始网页记录(本地存档),FAQ)
- 重放会恢复完全相同的已记录前缀,但分叉点之后仍需重新调用非确定性的模型,因此反事实比较的有效性取决于分叉点和实验控制。(来源:原始网页记录(本地存档),FAQ)
- 关联论文进一步限定了“可逆”:文件系统等 Effect 可原生回滚,数据库写入等依赖补偿处理器,邮件与新模型调用等不可逆 Effect 只能审计;普通 Python 运行也不在 Lean 证明范围内。(关联资料:Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces,§3.2、附录 B)
相关页面
- 概念:Meta-Agent、Reversible Agentic Execution Trace、Harness Engineering、Harness Optimization、Self-Improving Harness、Agentic RL
- 实体:Shepherd
- 主题:LLM Agent Self-Improvement
来源
- 原始文件:原始资料(本地存档)
- 原始网页:https://shepherd-agents.ai/blog/
- 关联论文:Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces;https://arxiv.org/abs/2605.10913
- 定位信息:Motivation、Runtime Substrate、Infrastructure、Experiments、FAQ
待核实问题
- 已核实(2026-08-28):关联论文为 arXiv:2605.10913v3(2026-06-24),框架与实验仓库均采用 MIT,框架仍明确标为 early alpha。论文完整证据见 Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces。
- 论文披露边界:Terminal-Bench 2.0 Stable25 的 train/dev/test 是完全重叠的同一 25 个任务,因此相关 CRO 数字不是 held-out 泛化结果;论文虽指向附录 F.4 的逐臂美元成本,v3 实际未给出该表。(来源:Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces,表 15、附录 A.1、F.3-F.4)
- 仓库核验不是复现:固定实验 commit 的 CBO tests 为
5 passed, 4 failed,Tree advantage tests 为11 passed, 1 failed;前者缺结果产物,后者存在实现/测试预期不一致。未运行容器、模型或 benchmark 端到端实验。(来源:Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces,项目核验) - 仍待独立复现:分叉/回退延迟、CooperBench、CRO 和 Tree-GRPO 结果仍只有作者方证据。
- 仍待跟踪:early alpha API 的兼容性、跨后端故障恢复和生产安全模型。