摘要

Self-Harness 让固定模型用自身失败轨迹挖掘弱点、提出受限 harness 编辑,并以 held-in/held-out non-regression gate 决定接受和合并。九个 model-benchmark 组合都比最小初始 harness 更高,但被称为 held-out 的数据参与每轮 promotion,并非最终未触碰测试集。它是持久 harness 自进化,不是严格 Agentic RL。(来源:原始论文记录(本地存档),pp.1-15)

核心内容

  • 失败签名同时编码 verifier 终局原因、相关 Agent 行为的因果状态与可复用机制;候选必须针对已声明的 editable surface,保持差异性和最小改动。(来源:原始论文记录(本地存档),pp.6-8)
  • 接受条件要求 held-in 与 held-out 均不下降且至少一侧提升;兼容候选可以合并,拒绝项和评估重复均记录在可审计 lineage 中。(来源:原始论文记录(本地存档),算法 1,pp.6、8)
  • 最大相对提升是 Qwen3.5-35B-A3B 在 AppWorld 从 22.5% 到 52.2%;最大绝对提升是 GLM-5 从 44.4% 到 85.0%。结果依赖 benchmark verifier,尚缺完全未参与选择的 final test 和强基线统一比较。(来源:原始论文记录(本地存档),表 1,p.11;限制 p.15)

相关页面

来源

待核实问题

  • 需要在完全不参与 promotion 的测试集、更多重复种子和强人工/外部优化基线上验证;公开代码的复现完整性与许可状态仍待确认。