摘要
HarnessLens 在冻结模型和 Agent 框架的前提下,演化可编辑 harness 状态,并用行为感知任务选择、可归因证据门和回归检查减少验证预算。它是持久 harness 自进化的具体实现,不是严格 Agentic RL。(来源:原始论文记录(本地存档),pp.2-8)
核心内容
- Context Exploration、Trajectory Diagnosis 和 Harness Evolution 把失败轨迹连接到可编辑 instructions、skills、tools、roles 与 runtime extensions;训练/测试任务分离。(来源:原始论文记录(本地存档),pp.2-5)
- 在 OpenCode、Codex CLI 和 Pi 上,TEST pass@1 的平均结果分别为 47.53%、44.06%、49.67%,相对 H0 提升且 12 个比较中 8 个最好或并列最好。(来源:原始论文记录(本地存档),p.6)
- 结果受行为重复性、预算单位不统一、模型/框架数量和外部 runtime 依赖限制;项目 benchmark 结果尚待独立复现。(来源:原始论文记录(本地存档),pp.7-9)
相关页面
- 概念:Harness Engineering、Harness Optimization、Self-Improving Harness、Recursive Self-Improvement
- 实体:HarnessLens
- 主题:LLM Agent Self-Improvement
来源
- 原始文件:原始资料(本地存档)
- alphaXiv:https://www.alphaxiv.org/abs/2608.27311
- arXiv:https://arxiv.org/abs/2608.27311
- GitHub:https://github.com/jhxu5214/HarnessLens
- 定位信息:pp.1-9,尤其 pp.3-7
待核实问题
- 单一模型系列、三种 harness 和四个 benchmark 的结果尚待第三方复现;交互单位与 token/延迟/成本的可比性需要补充测量。