摘要

PILOT 用 supervisor-worker runtime 在长程任务执行期间观察轨迹、实时干预,并把成功经验固化为跨运行的 skill library 与 memory。冻结模型、verifier gate 和跨运行状态是其主要贡献,因此它属于持久 harness 自进化而非严格 Agentic RL。(来源:原始论文记录(本地存档),pp.2-7)

核心内容

  • supervisor 与 worker 通过 live two-way channel 交互,支持 steer、abort、redirect;后续 worker 读取演化后的 harness。验证器只保留成功运行的更新,执行期间没有 reward shaping,也没有模型权重更新。(来源:原始论文记录(本地存档),pp.3-4, 7)
  • 在两个 open-weight backbone 和三个 benchmark 上,PILOT 在 6 个组合中 5 个第一;20 次 Terminal-Bench 迭代使最佳 pass 提升 12.4-14.6 points,并显著降低输出 token。(来源:原始论文记录(本地存档),pp.5-7)
  • 即时 live steering 只直接帮助少量运行,聚合收益不能简单归因于 supervisor 干预;异构 supervisor/worker、成本和更长时程仍待研究。(来源:原始论文记录(本地存档),p.7)

相关页面

来源

待核实问题

  • 日期核实(2026-08-28):arXiv 的 2026-08-27 是平台提交时间,PDF 首页 “Aug 25” 是稿件标注日期;二者指向不同事件,不构成书目冲突,应分别保留。
  • 代码状态核实(2026-08-28):论文列出的 XiaoYang66/Pilot 仍返回 404,尚无可验证公开实现。
  • 仍待独立复现:benchmark 结果、异构 supervisor/worker 组合、完整成本和更长时程稳定性。