摘要
Self-Improving Harness 是让智能体根据执行证据修改其工作流、上下文逻辑、工具配置或其他 harness 代码,并通过评估决定是否接受修改的系统。(来源:Harness Engineering for Self-Improvement)
核心内容
定义
核心循环是发现可重复的弱点、提出范围受限的改动、在独立评估上验证,并只合并无回归或达到接受标准的候选。(来源:Harness Engineering for Self-Improvement)
关键要点
- 改动应由失败轨迹和可定位的根因驱动,而不是凭空优化。(来源:Harness Engineering for Self-Improvement)
- 可编辑组件、执行经验与决策预测需要可观察、可追溯、可证伪。(来源:Harness Engineering for Self-Improvement)
- 失败提案也应记录,以避免重复尝试并支持后续分析。(来源:Harness Engineering for Self-Improvement)
- 可逆轨迹支持只重放受改动影响的执行后缀,为工作流改动提供更局部的反事实比较,并减少完整重跑带来的成本与噪声;Shepherd 的 CRO 会持久保存选中工作流,因此属于 harness 演化,但固定 proposer 没有改进自身,不构成完整递归自我改进。(来源:Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces,§4.2)
- HarnessOpt-Bench 的结果显示,当前前沿优化器能够改进智能体,但收益高度依赖任务和种子;可见验证集最优成绩通常高估最终 held-out 表现。(来源:HarnessOpt-Bench: Evaluating LLMs at Harness Optimization)
- 弱点挖掘应先区分模型、harness、工具、环境和 grader 的责任;错误归因会让优化循环修改无关组件,甚至掩盖评估系统缺陷。(综合:Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures)
- Agentic ESOpt 的参数更新会利用 Agent 轨迹回报,但没有持久 harness 编辑与接受循环;它是相邻的模型适配方法,不应仅因使用“co-evolution”措辞就归入严格自我改进 harness。(综合:Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Memory Requirements)
- FACET 的局部 repair loop 只负责让单个合成任务的 environment、solution、instruction 和 verifier 达到一致;它没有把修复持久化为跨任务 harness 改动,也没有训练 improver。因此它是 self-improving harness 的边界反例,而不是严格 RSI。(来源:FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis,pp.5-6, 10)
- Recuris 将失败定位、局部 memory patch、checker 和 held-out gate 组成可回滚的跨任务循环;StarHarness 将同一原则扩展到工具、MCP、上下文和验证逻辑,并用隐藏选择集筛选候选。(来源:Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses、StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments)
- HarnessLens 将上述循环具体化为 behavior-aware selection、attributable-evidence gate 和 confirmation/regression batch,在固定模型与框架的条件下演化 instructions、skills、tools、roles 等 harness 状态。(来源:Verify Smarter, Evolve Further: Efficient Harness Evolution through Behavior-Aware Verification)
- PILOT 把 supervisor-worker 监督放到执行中:实时 steer/abort/redirect 与成功轨迹固化的 skill/memory 并行工作,但即时 steering 只解释少量成功,不能把全部收益归给 live intervention。(来源:PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents)
- Astar 位于边界之外的共进化一侧:其提案模型通过 GRPO 更新,代码 Agent 与工业训练/部署结果回流,形成模型、harness 和目标系统的执行闭环;这不是无参数更新的纯 harness evolution。(来源:Astar: Learning to Propose Evolution Directions for Self-Evolving Industrial AI Systems)
- Meta-Harness 用外部 coding-agent proposer 搜索完整 harness,并让其访问所有候选代码与 raw traces;它支持跨任务复用,但改进者与目标 Agent 分离,且 Terminal-Bench 设置没有独立 held-out 任务。(来源:Meta-Harness: End-to-End Optimization of Model Harnesses,pp.2-9)
- Self-Harness 让同一固定模型完成 weakness mining 与 proposal,并把“至少一侧提升、另一侧不退化”作为自动 promotion rule;其限制是回归集被反复用于选择,不能替代最终测试。(来源:Self-Harness: Harnesses That Improve Themselves,算法 1,pp.6-15)
- AHE 把每个 edit 绑定到可证伪 change manifest,并可按文件回滚;但三类正向单组件增益并不能线性叠加,系统对实际回归也只能预见约一成,说明“可审计”与“可靠自改进”仍有距离。(来源:Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses,表 3、图 4,pp.8-10)
适用范围与边界
更适合有快速、客观评估器的任务;对研究品味、长期维护性等模糊目标,自动验证仍然困难。(来源:Harness Engineering for Self-Improvement)
分歧与演变
允许系统修改自身 harness 可能打破抽象边界,因此评估器、权限控制、只读区域和人工复核应置于演化循环之外。(来源:Harness Engineering for Self-Improvement)
相关页面
- 上位概念:Harness Engineering、Recursive Self-Improvement
- 相关概念:Context Engineering、Agentic RL、Meta-Agent、Reversible Agentic Execution Trace、Harness Optimization、Agent Failure Localization
- 相关实体:Lilian Weng、Shepherd、HarnessOpt-Bench、Agentic ESOpt、Interaction-Centric Agent Failure Taxonomy、Recuris、StarHarness、HarnessLens、PILOT、Astar、Meta-Harness、Self-Harness、Agentic Harness Engineering
- 相关主题:LLM Agent Self-Improvement
来源
- Harness Engineering for Self-Improvement
- Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces
- Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces
- HarnessOpt-Bench: Evaluating LLMs at Harness Optimization
- Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures
- Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Memory Requirements
- FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis
- Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses
- StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments
- Verify Smarter, Evolve Further: Efficient Harness Evolution through Behavior-Aware Verification
- PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents
- Astar: Learning to Propose Evolution Directions for Self-Evolving Industrial AI Systems
- Meta-Harness: End-to-End Optimization of Model Harnesses
- Self-Harness: Harnesses That Improve Themselves
- Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses
待核实问题
- 不同任务上“无回归”的接受标准及其长期有效性需要更多实证来源。