摘要

Harness Optimization 是围绕可测目标,迭代修改智能体的提示、工具、上下文、记忆、控制流和编排代码,并在有限评估预算下选择最终候选的过程。(来源:Harness Engineering for Self-ImprovementHarnessOpt-Bench: Evaluating LLMs at Harness Optimization

核心内容

定义

HarnessOpt-Bench 将其形式化为受约束的随机程序优化:目标模型、环境和验证器固定,优化器只能修改可编辑 harness,并最大化不可见测试集上相对种子的期望改进。(来源:HarnessOpt-Bench: Evaluating LLMs at Harness Optimization

关键要点

适用范围与边界

适合具有可执行 harness 和可重复验证器的智能体任务。对评价模糊、反馈极慢或缺乏可靠 held-out 数据的任务,当前协议的适用性较弱。(来源:Harness Engineering for Self-ImprovementHarnessOpt-Bench: Evaluating LLMs at Harness Optimization

分歧与演变

早期工作多以各自方法和任务展示改进,HarnessOpt-Bench 则主张固定问题与协议来分离模型、编码 harness 和优化算法的影响;当前 v1 是否足以代表通用 harness 优化能力仍待更多复现和任务覆盖。(来源:HarnessOpt-Bench: Evaluating LLMs at Harness Optimization

相关页面

来源

待核实问题

  • 比较协议结论(2026-08-28):normalized gain 只有在种子、上限定义、目标模型、数据划分和 verifier 相同或明确归一化时才可横向比较;至少还应并列报告 target-evaluation calls、完整案例次数、target-model tokens、优化器 tokens、wall-clock、货币成本、随机种子及置信区间。不同任务若缺少共同预算单位,应保留分任务结果,不计算一个掩盖差异的总排名。(综合:HarnessOpt-Bench: Evaluating LLMs at Harness OptimizationVerify Smarter, Evolve Further: Efficient Harness Evolution through Behavior-Aware Verification
  • 仍待形成标准:长期维护性、安全性、可审计性和回滚成本不能由单一任务分数表达;现有来源只提供部分机制,尚无共同量表。