摘要
PILOT 用 supervisor-worker runtime 在长程任务执行期间观察轨迹、实时干预,并把成功经验固化为跨运行的 skill library 与 memory。冻结模型、verifier gate 和跨运行状态是其主要贡献,因此它属于持久 harness 自进化而非严格 Agentic RL。(来源:原始论文记录(本地存档),pp.2-7)
核心内容
- supervisor 与 worker 通过 live two-way channel 交互,支持 steer、abort、redirect;后续 worker 读取演化后的 harness。验证器只保留成功运行的更新,执行期间没有 reward shaping,也没有模型权重更新。(来源:原始论文记录(本地存档),pp.3-4, 7)
- 在两个 open-weight backbone 和三个 benchmark 上,PILOT 在 6 个组合中 5 个第一;20 次 Terminal-Bench 迭代使最佳 pass 提升 12.4-14.6 points,并显著降低输出 token。(来源:原始论文记录(本地存档),pp.5-7)
- 即时 live steering 只直接帮助少量运行,聚合收益不能简单归因于 supervisor 干预;异构 supervisor/worker、成本和更长时程仍待研究。(来源:原始论文记录(本地存档),p.7)
相关页面
- 概念:Harness Engineering、Self-Improving Harness、Recursive Self-Improvement、Context Engineering
- 实体:PILOT
- 主题:LLM Agent Self-Improvement
来源
- 原始文件:原始资料(本地存档)
- alphaXiv:https://www.alphaxiv.org/abs/2608.26530
- arXiv:https://arxiv.org/abs/2608.26530
- 论文列出的代码:https://github.com/XiaoYang66/Pilot
- 定位信息:pp.1-7,尤其 pp.2-5、表 1-2、图 2-3
待核实问题
- 日期核实(2026-08-28):arXiv 的 2026-08-27 是平台提交时间,PDF 首页 “Aug 25” 是稿件标注日期;二者指向不同事件,不构成书目冲突,应分别保留。
- 代码状态核实(2026-08-28):论文列出的
XiaoYang66/Pilot仍返回 404,尚无可验证公开实现。 - 仍待独立复现:benchmark 结果、异构 supervisor/worker 组合、完整成本和更长时程稳定性。