摘要
HarnessOpt-Bench 是用于评估 LLM 端到端 Harness Optimization 能力的基准,重点覆盖昂贵、随机且受固定目标评估预算约束的优化过程。(来源:HarnessOpt-Bench: Evaluating LLMs at Harness Optimization)
核心内容
基本信息
- 实体类别:AI 智能体评估基准
- 论文版本:arXiv:2608.06301v1,提交于 2026-08-06。(来源:HarnessOpt-Bench: Evaluating LLMs at Harness Optimization)
- 研究机构:论文作者均标注为 Scale AI。(来源:HarnessOpt-Bench: Evaluating LLMs at Harness Optimization)
- 当前任务:OfficeQA、BrowseComp-Plus、Terminal-Bench 与 GAIA。(来源:HarnessOpt-Bench: Evaluating LLMs at Harness Optimization)
重要事实
- 优化器在固定预算内编辑种子 harness,并提交一个最终候选。(来源:HarnessOpt-Bench: Evaluating LLMs at Harness Optimization)
- 测试集在搜索期间不可见,最终使用 normalized gain 衡量候选捕获了多少相对种子的剩余性能空间。(来源:HarnessOpt-Bench: Evaluating LLMs at Harness Optimization)
- 可信执行环境负责隔离、预算计量、模型限制和候选版本审计。(来源:HarnessOpt-Bench: Evaluating LLMs at Harness Optimization)
关系与影响
该基准把 Harness Engineering 中的系统改进能力转化为可比较的评估对象,并为 Self-Improving Harness 的优化器模型、搜索方法和编码工具提供共同协议。(来源:HarnessOpt-Bench: Evaluating LLMs at Harness Optimization)
分歧与变化
当前结果来自 v1、四项任务、Python harness 和每任务一个固定目标模型;作者明确不将其视为完整的工具推理能力度量。(来源:HarnessOpt-Bench: Evaluating LLMs at Harness Optimization)
相关页面
- 概念:Harness Optimization、Harness Engineering、Self-Improving Harness
- 实体:无
- 主题:LLM Agent Self-Improvement
来源
待核实问题
- 后续版本、同行评审、代码发布和第三方复现状态。