摘要

HarnessLens 在冻结模型和 Agent 框架的前提下,演化可编辑 harness 状态,并用行为感知任务选择、可归因证据门和回归检查减少验证预算。它是持久 harness 自进化的具体实现,不是严格 Agentic RL。(来源:原始论文记录(本地存档),pp.2-8)

核心内容

  • Context Exploration、Trajectory Diagnosis 和 Harness Evolution 把失败轨迹连接到可编辑 instructions、skills、tools、roles 与 runtime extensions;训练/测试任务分离。(来源:原始论文记录(本地存档),pp.2-5)
  • 在 OpenCode、Codex CLI 和 Pi 上,TEST pass@1 的平均结果分别为 47.53%、44.06%、49.67%,相对 H0 提升且 12 个比较中 8 个最好或并列最好。(来源:原始论文记录(本地存档),p.6)
  • 结果受行为重复性、预算单位不统一、模型/框架数量和外部 runtime 依赖限制;项目 benchmark 结果尚待独立复现。(来源:原始论文记录(本地存档),pp.7-9)

相关页面

来源

待核实问题

  • 单一模型系列、三种 harness 和四个 benchmark 的结果尚待第三方复现;交互单位与 token/延迟/成本的可比性需要补充测量。