摘要

HarnessOpt-Bench 将 Harness Optimization 定义成一个受固定预算约束、评估昂贵且具有随机性的端到端优化任务。优化器接收目标智能体的初始 harness、分级披露的开发与验证反馈,并修改代码、提交最终候选;候选只在搜索结束后于不可见测试集上按相对初始 harness 的归一化增益评分。(来源:原始论文记录(本地存档),Abstract / §3)

核心内容

研究问题

  • 论文试图把 harness 优化从各方法自定种子、预算、目标智能体和评分协议的展示,转化为可控制变量、可复现比较的共同评估任务。(来源:原始论文记录(本地存档),§1-2)
  • 评估区分三类因素:作为优化器的模型、模型所使用的编码 harness,以及被优化的目标智能体和任务协议。(来源:原始论文记录(本地存档),§1 / §4)

评估协议

  • 候选 harness 是可执行代码库;优化器可修改提示、工具定义、记忆和控制流等文件,但目标模型、环境和验证器保持固定。(来源:原始论文记录(本地存档),§3.1 Candidates and invariants)
  • 数据划分为 development、validation 和 test。开发集可披露案例、结果与轨迹,验证集只披露聚合分数,测试集在搜索期间完全不可见。(来源:原始论文记录(本地存档),§3.1 Evaluation and disclosure)
  • 搜索受到评估调用、完整案例遍历和目标模型 token 的固定预算约束;优化器必须决定评估哪些候选及使用何种精度。(来源:原始论文记录(本地存档),§3.1 Budget)
  • 最终指标是候选相对初始 harness 占据剩余性能空间的比例,即 normalized gain;负值表示最终候选弱于种子。(来源:原始论文记录(本地存档),§3.1 Objective)
  • 可信执行环境隔离测试数据和凭据、执行预算与模型白名单,并保存每个候选版本用于审计;这些约束由环境强制,而非依赖优化器遵守提示。(来源:原始论文记录(本地存档),§1 / Figure 1)

实验设置

  • 论文在 OfficeQA、BrowseComp-Plus、Terminal-Bench 和 GAIA 四项任务上评估五个前沿优化器模型,并比较共享编码 harness 与各模型原生 harness,共得到 111 个计分运行。(来源:原始论文记录(本地存档),Abstract / §4)
  • 每个最终测试分数按每个案例三次尝试取平均,每个优化器配置运行两次;优化器自身推理被计量但未设上限。(来源:原始论文记录(本地存档),§4 Scoring protocol)
  • 四项任务使用刻意未调优且留有改进空间的 Python 种子;其中 GAIA 种子是不可用的 stub,因此它更接近从头构建而非改进成熟系统。(来源:原始论文记录(本地存档),§3.2)

主要结果

  • 论文报告,在控制任务后,更换优化器模型带来的平均增益变化为 0.142,更换编码 harness 为 0.079;模型差异约为 harness 差异的 1.8 倍。(来源:原始论文记录(本地存档),§5.1)
  • 原生 harness 没有一致优势:20 个模型与任务配对中,共享 harness 获胜 11 次、原生 harness 获胜 9 次,但具体方向随模型和任务变化。(来源:原始论文记录(本地存档),§5.4)
  • 搜索期间触及更多 harness 杠杆与 held-out gain 呈正相关,四项任务的 Spearman 相关系数在 +0.34 至 +0.88;论文同时提醒,该指标与整体修改量相关,不能单独证明“广度”导致提升。(来源:原始论文记录(本地存档),§5.3)
  • 详细轨迹读取很少发生,并与增益没有正相关;作者明确表示这不证明诊断无用,可能只是当前任务的逐案例摘要已足够定位问题。(来源:原始论文记录(本地存档),§5.3)
  • 优化器通常受完整案例预算而非 API 调用次数限制;可见验证集上的最佳成绩也往往高于最终测试成绩,说明 held-out 测试对识别实际泛化增益是必要的。(来源:原始论文记录(本地存档),§5.3)

限制

  • 论文将协议描述为抗攻击而非不可攻破;固定开发与验证反馈仍可能奖励针对稳定评估器特征的策略。(来源:原始论文记录(本地存档),Limitations)
  • 结果依赖当前任务与种子分布,未系统改变种子复杂度;候选仅限 Python,每项任务只固定一个目标模型。(来源:原始论文记录(本地存档),Limitations)
  • 优化器推理没有设置统一上限,因此结果更接近“推理资源不稀缺时可达到什么”,并非严格的端到端等算力比较。(来源:原始论文记录(本地存档),§4 / Limitations)

相关页面

来源

待核实问题

  • 版本核实(2026-08-28):仍为 arXiv v1;在 OpenReview 的标题限定检索中未找到公开评审记录。
  • 公开性核实:论文与 arXiv 页面没有给出官方代码或数据仓库;因此数据划分、可信执行环境和 111 次运行目前无法按公开实现独立复现。这不是“尚未检查”,而是公开复现材料尚不完整。
  • 仍待外部验证:其他语言、目标模型、成熟 harness、严格等算力条件与长期维护指标下的泛化。