摘要
Harness Optimization 是围绕可测目标,迭代修改智能体的提示、工具、上下文、记忆、控制流和编排代码,并在有限评估预算下选择最终候选的过程。(来源:Harness Engineering for Self-Improvement、HarnessOpt-Bench: Evaluating LLMs at Harness Optimization)
核心内容
定义
HarnessOpt-Bench 将其形式化为受约束的随机程序优化:目标模型、环境和验证器固定,优化器只能修改可编辑 harness,并最大化不可见测试集上相对种子的期望改进。(来源:HarnessOpt-Bench: Evaluating LLMs at Harness Optimization)
关键要点
- 优化对象可以跨越提示、上下文管理、步数上限、重试与超时、工具 schema、答案提取、检索策略和推理强度。(来源:HarnessOpt-Bench: Evaluating LLMs at Harness Optimization)
- 评估通常昂贵且随机,因此搜索策略必须权衡诊断、候选广度、评估精度与剩余预算。(来源:HarnessOpt-Bench: Evaluating LLMs at Harness Optimization)
- 最终候选应在搜索期间不可见的数据上评价,避免把可见验证分数误当成泛化提升。(来源:HarnessOpt-Bench: Evaluating LLMs at Harness Optimization)
- 评估边界、预算、目标模型和验证器应由外部执行环境强制,而不是仅靠优化器的指令约束。(来源:HarnessOpt-Bench: Evaluating LLMs at Harness Optimization)
- 参数空间 ES 可以利用同一类环境回报,但它优化的是模型参数而不是可编辑 harness;Agentic ESOpt 因而应作为相邻方法单独比较,而不是直接当作 harness 优化结果。(来源:Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Memory Requirements)
- Recuris 将外部 memory、技能调用策略和 checker 作为可验证 patch 空间;StarHarness 则把工具 schema、MCP、subagent、上下文和 finish logic 一并纳入搜索,说明 harness 优化不应窄化为 prompt 改写。(来源:Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses、StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments)
- StarHarness 的 proposer-visible、hidden selection 和 held-out evaluation 分离,是防止 patch 针对可见 verifier 过拟合的具体实现;接受条件应包含回滚和跨任务无回归,而不只是单任务分数上升。(来源:StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments)
- HarnessLens 把验证预算进一步按行为簇分配:先从轨迹诊断可编辑组件,再选择最相关任务并要求可归因改善,最后做 confirmation/regression check;它提供了行为感知验证的具体协议,但 interaction units 与 token、延迟、成本尚未统一。(来源:Verify Smarter, Evolve Further: Efficient Harness Evolution through Behavior-Aware Verification)
- Meta-Harness 的搜索接口不预先规定 parent-selection 或摘要格式,而让 proposer 查询完整候选历史;raw-trace 消融优于 scores-only 和 summary,说明优化器可见信息本身是核心设计变量。(来源:Meta-Harness: End-to-End Optimization of Model Harnesses,表 3-4,p.7)
- Self-Harness 的 Pareto 式接受条件要求 held-in、held-out 均不退化且至少一侧改善;它比单一可见分数更保守,但 held-out 参与每轮选择,仍应另留 final test。(综合:Self-Harness: Harnesses That Improve Themselves,算法 1,pp.6-8)
- AHE 用 component files、layered evidence 与 change manifest 提高编辑可观察性;单组件消融和低回归预测率表明,联合 harness 优化还必须处理组件干扰,而不能只验证每个局部编辑的正向理由。(来源:Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses,pp.8-9)
- Shepherd 的 CRO 从改动最早影响的提交分叉并重放后缀,提供了反事实 harness 优化的运行时实现;但 Terminal-Bench 2.0 Stable25 的优化、选择与报告 split 完全重叠,31.2 到 35.2 不能当作独立 held-out 泛化证据。(来源:Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces,Appendix F.3)
适用范围与边界
适合具有可执行 harness 和可重复验证器的智能体任务。对评价模糊、反馈极慢或缺乏可靠 held-out 数据的任务,当前协议的适用性较弱。(来源:Harness Engineering for Self-Improvement、HarnessOpt-Bench: Evaluating LLMs at Harness Optimization)
分歧与演变
早期工作多以各自方法和任务展示改进,HarnessOpt-Bench 则主张固定问题与协议来分离模型、编码 harness 和优化算法的影响;当前 v1 是否足以代表通用 harness 优化能力仍待更多复现和任务覆盖。(来源:HarnessOpt-Bench: Evaluating LLMs at Harness Optimization)
相关页面
- 上位概念:Harness Engineering
- 相关概念:Self-Improving Harness、Recursive Self-Improvement、Agentic RL
- 相关实体:HarnessOpt-Bench、Agentic ESOpt、Recuris、StarHarness、HarnessLens、Meta-Harness、Self-Harness、Agentic Harness Engineering、Shepherd
- 相关主题:LLM Agent Self-Improvement
来源
- Harness Engineering for Self-Improvement
- HarnessOpt-Bench: Evaluating LLMs at Harness Optimization
- Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Memory Requirements
- Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses
- StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments
- Verify Smarter, Evolve Further: Efficient Harness Evolution through Behavior-Aware Verification
- Meta-Harness: End-to-End Optimization of Model Harnesses
- Self-Harness: Harnesses That Improve Themselves
- Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses
- Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces
待核实问题
- 比较协议结论(2026-08-28):normalized gain 只有在种子、上限定义、目标模型、数据划分和 verifier 相同或明确归一化时才可横向比较;至少还应并列报告 target-evaluation calls、完整案例次数、target-model tokens、优化器 tokens、wall-clock、货币成本、随机种子及置信区间。不同任务若缺少共同预算单位,应保留分任务结果,不计算一个掩盖差异的总排名。(综合:HarnessOpt-Bench: Evaluating LLMs at Harness Optimization、Verify Smarter, Evolve Further: Efficient Harness Evolution through Behavior-Aware Verification)
- 仍待形成标准:长期维护性、安全性、可审计性和回滚成本不能由单一任务分数表达;现有来源只提供部分机制,尚无共同量表。