摘要

Meta-Harness 用 coding-agent proposer 在完整 harness 代码空间执行外层搜索,并把所有候选的代码、分数与原始轨迹保存在可查询文件系统中。论文的核心证据是:对完整历史的选择性访问比只看分数或摘要更有效;但目标模型不更新,Terminal-Bench 结果也没有独立 held-out 任务,因此它属于持久 harness optimization,而不是严格 Agentic RL 或完整 RSI。(来源:原始论文记录(本地存档),pp.2-10)

核心内容

  • 在文本分类中,最终 harness 平均准确率 48.6%,ACE 为 40.9%,额外上下文分别为 11.4K 与 50.8K token;raw-trace 消融的中位/最佳搜索集准确率为 50.0%/56.7%,明显高于 scores-only 与 summary 条件。(来源:原始论文记录(本地存档),表 2-4,pp.6-7)
  • 一个搜索得到的 BM25 路由 harness 在 200 个未见 IMO 级问题、5 个 held-out 模型上平均比无检索高 4.7 points;它说明可迁移对象可以是可读的检索程序,而不只是提示文本。(来源:原始论文记录(本地存档),表 6,p.8)
  • Terminal-Bench 2 的 89 题同时用于搜索和最终报告,只以人工/正则泄漏审计控制过拟合;公开仓库主要提供最终 agent artifact,不是完整 Meta-Harness 搜索实现。(来源:原始论文记录(本地存档),p.9)

相关页面

来源

待核实问题

  • 需要比较不同 proposer、统一搜索成本并在独立 coding test set 上复现;完整搜索代码和三类实验配置的公开程度仍待跟踪。