摘要

Agentic Harness Engineering(AHE)通过组件、经验和决策三类可观察性,让 Evolve Agent 修改文件级 harness 组件、从分层轨迹证据提出编辑,并用下一轮任务结果证伪预测和回滚。一次 10 轮 Terminal-Bench 2 campaign 报告从 69.7% 到 77.0%,但系统对回归的预测 precision/recall 仅约 11%,治理也仍是研究原型。模型参数不更新,因此它不是严格 Agentic RL。(来源:原始论文记录(本地存档),pp.3-10)

核心内容

  • 七类 editable component 被表示为 Git 跟踪文件;千万 token 级原始轨迹被蒸馏成可下钻 evidence corpus;每个 edit manifest 记录证据、根因、目标修复和预期影响。(来源:原始论文记录(本地存档),pp.3-5)
  • AHE 在完整 89 题 Terminal-Bench 2 上进行单次约 32 小时的 10 轮演化,pass@1 从 69.7% 到 77.0%;Hard 子集低于 Codex,显示聚合改进不能替代分层任务检查。(来源:原始论文记录(本地存档),表 1,p.6)
  • 消融把主要增益定位到 memory、tool 与 middleware,system-prompt-only 反而退化;回归预测 precision/recall 为 11.8%/11.1%,说明可解释 edit rationale 不等于能预见副作用。(来源:原始论文记录(本地存档),表 3、图 4,pp.8-9)

相关页面

来源

待核实问题

  • 主结果来自一次高方差 campaign;需要独立复现、更多 evolution operating points、完整 Agent Debugger 开源与更强的长期治理/回归门。