摘要

Shepherd 是面向可编程 Meta-Agent 的运行时基础设施。它把模型调用、工具调用和文件写入记录为可回退的 Git 式执行轨迹,使另一个智能体能够在运行期间观察、分叉、修改、回退和恢复工作智能体及其环境。(来源:原始网页记录(本地存档))

核心内容

问题与设计

  • 传统智能体框架通常只暴露原始对话记录和最终环境快照,Meta-Agent 若要干预,往往需要自行重建中间执行状态。(来源:原始网页记录(本地存档),Motivation)
  • Shepherd 将智能体运行转化为可操作的数据结构,并用 Task、Effect、Scope、Trace 四个原语表示任务、动作意图、执行环境和提交图。(来源:原始网页记录(本地存档),Runtime Substrate)
  • Effect 在实际执行前先记录动作意图,使 Meta-Agent 有机会阻止或修改危险操作;Scope 的分叉会同时复制智能体状态和文件系统环境。(来源:原始网页记录(本地存档),Runtime Substrate)
  • Reversible Agentic Execution Trace 允许按历史节点分叉、保留成功分支、丢弃失败分支,并检查每次模型调用、工具调用和编辑。(来源:原始网页记录(本地存档),Runtime Substrate)

系统性能

  • 项目页报告,在其单机测试中,Shepherd 对 42 MB 至 5.8 GB 环境的分叉延迟约为 134 至 143 毫秒,回退约为 140 至 147 毫秒;分支可复用未改变前缀的缓存。(来源:原始网页记录(本地存档),Infrastructure)
  • 这些数据来自项目方设定的三种 Terminal-Bench 2.0 镜像和 4 vCPU / 8 GB Linux 主机,不能直接外推到所有后端与工作负载。(来源:原始网页记录(本地存档),Infrastructure / Setup)

三类 Meta-Agent 实验

  • 运行时监督:监督智能体通过注入提示、移交工作或丢弃失败分支协调两个并行编码智能体;项目页报告 CooperBench 配对通过率由协作基线的 28.8% 提升至最高 54.7%。(来源:原始网页记录(本地存档),Multi-Agent Runtime Intervention)
  • 反事实元优化:CRO 只从受改动影响的第一个轨迹节点重放后缀,以更局部地比较工作流修改;项目页报告其在五个基准中的四个取得最佳分数与最低优化耗时。(来源:原始网页记录(本地存档),Counterfactual Meta-Optimization)
  • Meta-Agent 引导的树形强化学习:在选定步骤分叉多个共享前缀的后续轨迹,以分支间最终奖励差异形成更细粒度的信用分配信号。(来源:原始网页记录(本地存档),Meta-Agent-Guided Tree RL)

当前边界

  • 项目页将 Shepherd 定位为研究预览而非成熟生产系统,并称其支持 Linux、macOS、自托管以及多种容器后端;Windows 原生支持尚未完成。(来源:原始网页记录(本地存档),FAQ)
  • 重放会恢复完全相同的已记录前缀,但分叉点之后仍需重新调用非确定性的模型,因此反事实比较的有效性取决于分叉点和实验控制。(来源:原始网页记录(本地存档),FAQ)
  • 关联论文进一步限定了“可逆”:文件系统等 Effect 可原生回滚,数据库写入等依赖补偿处理器,邮件与新模型调用等不可逆 Effect 只能审计;普通 Python 运行也不在 Lean 证明范围内。(关联资料:Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces,§3.2、附录 B)

相关页面

来源

待核实问题