摘要
Agentic Harness Engineering(AHE)是以组件、经验和决策可观察性驱动 coding-agent harness 自动演化的研究系统。
核心内容
基本信息
- 实体类别:Coding-agent harness evolution 方法与开源系统。
- 关键名称或版本:AHE;arXiv:2604.25850v4。
- 时间范围:首次公开于 2026-04-28;v4 修订于 2026-05-18。
重要事实
- AHE 把七类 harness 组件表示为 Git 跟踪文件,把原始轨迹蒸馏为可下钻证据,并用下一轮任务变化检验 edit manifest。(来源:Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses,pp.3-5)
- 单次 10 轮 campaign 报告 Terminal-Bench 2 pass@1 从 69.7% 到 77.0%;消融将主要价值定位到 memory、tools 和 middleware,同时暴露组件干扰和 regression blindness。(来源:Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses,pp.6-9)
关系与影响
AHE 把 Harness Engineering 的可编辑面和 Agent Failure Localization 的证据链纳入同一 Self-Improving Harness 循环;Evolve Agent 是执行编辑与归因的 Meta-Agent。
分歧与变化
系统仍是受控研究原型。仓库采用 MIT,但 Agent Debugger 仅部分开源,完整复现需要外部 sandbox 与模型服务。
相关页面
- 概念:Harness Engineering、Harness Optimization、Self-Improving Harness、Recursive Self-Improvement、Agent Failure Localization、Meta-Agent
- 实体:Meta-Harness、Self-Harness
- 主题:LLM Agent Self-Improvement
来源
待核实问题
- 多次独立 campaign、不同模型/预算和完整 guardrail stack 下的收益与回归率尚待验证。