摘要
HarnessLens 是用于行为感知 harness 演化与验证的研究系统,固定模型和运行框架,修改可编辑 harness 状态并用行为簇、可归因证据和回归门筛选候选。
核心内容
基本信息
- 实体类别:Agent harness evolution 论文与开源实现。
- 关键名称或版本:arXiv:2608.27311v1;GitHub
jhxu5214/HarnessLens。 - 时间范围:首次论文与仓库公开均在 2026-08-27。
重要事实
- 覆盖 OpenCode、Codex CLI、Pi 和四个任务 benchmark;论文报告 TEST 平均 pass@1 提升,但交互预算单位与基线不完全同质。(来源:Verify Smarter, Evolve Further: Efficient Harness Evolution through Behavior-Aware Verification,pp.5-7)
- GitHub 仓库包含演化循环、配置、脚本和测试,采用 MIT;外部 Agent runtime 与 benchmark 需要另行准备。(来源:Verify Smarter, Evolve Further: Efficient Harness Evolution through Behavior-Aware Verification;项目仓库)
关系与影响
HarnessLens 将 Self-Improving Harness 中“失败诊断到验证接受”的循环具体化,重点贡献是用行为相关性节省验证预算。
分歧与变化
论文为 v1 预印本,结果和独立复现状态仍待跟踪。
相关页面
- 概念:Harness Engineering、Harness Optimization、Self-Improving Harness、Recursive Self-Improvement
- 实体:无
- 主题:LLM Agent Self-Improvement
来源
待核实问题
- 需要第三方复现并统一 token、延迟和成本预算后再比较与其他优化器的效率。