摘要
Agentic Harness Engineering(AHE)通过组件、经验和决策三类可观察性,让 Evolve Agent 修改文件级 harness 组件、从分层轨迹证据提出编辑,并用下一轮任务结果证伪预测和回滚。一次 10 轮 Terminal-Bench 2 campaign 报告从 69.7% 到 77.0%,但系统对回归的预测 precision/recall 仅约 11%,治理也仍是研究原型。模型参数不更新,因此它不是严格 Agentic RL。(来源:原始论文记录(本地存档),pp.3-10)
核心内容
- 七类 editable component 被表示为 Git 跟踪文件;千万 token 级原始轨迹被蒸馏成可下钻 evidence corpus;每个 edit manifest 记录证据、根因、目标修复和预期影响。(来源:原始论文记录(本地存档),pp.3-5)
- AHE 在完整 89 题 Terminal-Bench 2 上进行单次约 32 小时的 10 轮演化,pass@1 从 69.7% 到 77.0%;Hard 子集低于 Codex,显示聚合改进不能替代分层任务检查。(来源:原始论文记录(本地存档),表 1,p.6)
- 消融把主要增益定位到 memory、tool 与 middleware,system-prompt-only 反而退化;回归预测 precision/recall 为 11.8%/11.1%,说明可解释 edit rationale 不等于能预见副作用。(来源:原始论文记录(本地存档),表 3、图 4,pp.8-9)
相关页面
- 概念:Harness Engineering、Harness Optimization、Self-Improving Harness、Recursive Self-Improvement、Agent Failure Localization、Meta-Agent
- 实体:Agentic Harness Engineering
- 主题:LLM Agent Self-Improvement
来源
- 原始文件:原始资料(本地存档)
- alphaXiv:https://www.alphaxiv.org/abs/2604.25850
- arXiv:https://arxiv.org/abs/2604.25850
- GitHub:https://github.com/china-qijizhifeng/agentic-harness-engineering
- 定位信息:v4,pp.1-10、15、35
待核实问题
- 主结果来自一次高方差 campaign;需要独立复现、更多 evolution operating points、完整 Agent Debugger 开源与更强的长期治理/回归门。