摘要
LLM 智能体自我改进关注系统如何从执行轨迹、失败证据和评估结果中改进其上下文、工作流、工具编排、harness 代码,乃至模型参数。一篇综述来源给出整体研究脉络,Shepherd 论文则展示了以可逆轨迹支持运行时监督、反事实优化和训练分叉的具体基础设施;Agentic ESOpt 补充了低显存参数空间搜索这一相邻路径,但不构成严格 RSI。(来源:Harness Engineering for Self-Improvement、Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces、Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Memory Requirements)
核心内容
范围与问题
核心问题包括:改进哪个系统层、如何表示可编辑空间、怎样发现真实根因、用什么评估器决定接受改动,以及如何避免短期指标损害长期可靠性。(来源:Harness Engineering for Self-Improvement)
综合结论
- Harness 把模型能力转化为可执行系统能力,因此是近期自我改进的重要优化对象。(来源:Harness Engineering for Self-Improvement)
- 有效循环需要持久状态、可观察轨迹、受限编辑、独立验证和失败记录共同工作。(来源:Harness Engineering for Self-Improvement)
- 自动演化在评估快速且客观的领域更成熟,在开放研究和长期软件维护中仍受模糊目标约束。(来源:Harness Engineering for Self-Improvement)
- Reversible Agentic Execution Trace 可把整次重跑缩小为对受影响后缀的重放,为局部干预、反事实验证和树形采样提供统一机制。(来源:Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces,§3-4)
- HarnessOpt-Bench 提供了固定预算、held-out 测试和可信执行边界下的共同协议,使“模型能否可靠改进智能体”成为可测能力。(来源:HarnessOpt-Bench: Evaluating LLMs at Harness Optimization)
- Agent Failure Localization 将表面失败映射到交互边和责任组件,为选择模型训练、harness 修改、环境重构或 grader 修复提供依据。(来源:Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures)
- Recuris 与 StarHarness 给出持久 harness 自进化的两个具体形态:前者演化带 checker 的 memory-control layer,后者搜索工具、MCP、上下文和验证控制流;两者都依赖 held-out 或隐藏选择集而非单次可见分数。(来源:Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses、StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments)
- SkillForge 把 skill bank 放入 GRPO 回路,是当前条目中更接近模型-harness/环境共进化的例子;但它与其他 Agentic RL 方法一样仍应和“无参数更新的 harness RSI”分开计类,且不等于 improver 本身递归改进。(来源:SkillForge: Evolving Verifiable Skills for Reinforcement Learning Agents)
- 2026-08-27 的新增证据把边界拉得更清楚:HarnessLens 以行为感知验证节省 harness 搜索预算,PILOT 将 supervisor 的 live intervention 与持久 skill/memory 结合,而 Astar 用 GRPO 训练工业演化方向提案模型。(来源:Verify Smarter, Evolve Further: Efficient Harness Evolution through Behavior-Aware Verification、PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents、Astar: Learning to Propose Evolution Directions for Self-Evolving Industrial AI Systems)
- 因而应把“持续 harness 自进化”和“严格 Agentic RL”分开报告:前两者冻结模型、接受外部状态更新;Astar 才在提案策略层更新模型,但目标是工业系统演化而非通用工具使用。(来源:上述三份来源摘要)
- Meta-Harness、Self-Harness 与 AHE 补全了“谁在改、看什么证据、怎样接受”三个轴:外部 proposer 读取全量历史、目标模型从自身失败提案、Evolve Agent 用分层证据和 manifest 管理组件编辑。三者都冻结模型权重,所以属于持久 harness 演化而非严格 Agentic RL;同时分别暴露同集 benchmark 优化、回归集参与选择和 regression blindness 风险。(综合:Meta-Harness: End-to-End Optimization of Model Harnesses、Self-Harness: Harnesses That Improve Themselves、Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses)
- Shepherd 的完整论文让三层边界可直接并列:runtime supervisor 只做任务内干预,CRO 持久修改 workflow,Tree-GRPO 更新 worker policy;三者共享 substrate,但没有构成彼此交替改进的完整 RSI 循环。(综合:Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces)
主要脉络
- 从提示词优化扩展到 Context Engineering 与工作流设计。(来源:Harness Engineering for Self-Improvement)
- 将 harness 编码为可搜索、可变异、可评估的程序空间。(来源:Harness Engineering for Self-Improvement)
- 通过 Self-Improving Harness 的提案、评估和接受循环实现持续改进。(来源:Harness Engineering for Self-Improvement)
- 探索 harness 与模型权重的联合优化,走向更完整的 Recursive Self-Improvement。(来源:Harness Engineering for Self-Improvement)
- 通过 Meta-Agent 直接观察和操作执行轨迹,把监督与优化落实到运行时基础设施。(来源:Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces)
- 用 Harness Optimization 基准分离优化器模型、编码 harness 与目标任务协议的影响。(来源:HarnessOpt-Bench: Evaluating LLMs at Harness Optimization)
- 在修改系统前定位最早未恢复失败和 fault side,避免把修复施加到错误组件。(来源:Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures)
- 应把 Agentic RL、参数空间 ES、推理时搜索、上下文蒸馏和持久 harness 演化分开标注;环境回报或“co-evolution”措辞不足以证明严格 RSI。(来源:Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Memory Requirements)
- 对自动 harness 演化同时记录 proposer 身份、可见证据、可编辑面、promotion data 和最终 test,避免把可审计流程误写成可靠泛化。(综合:Meta-Harness: End-to-End Optimization of Model Harnesses、Self-Harness: Harnesses That Improve Themselves、Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses)
分歧与适用边界
- 关于近期路径:作者预测 harness 工程比模型直接重写自身权重更可能成为近期 RSI 路径;这是预测而非已确认结论。(来源:Harness Engineering for Self-Improvement,2026-07-04)
- 关于自动化边界:自我改进需要开放编辑空间,但评估器、权限控制和关键人工复核又应置于循环之外,两者之间存在持续张力。(来源:Harness Engineering for Self-Improvement,适用于可自编辑系统)
- 关于实验成熟度:Shepherd 报告了多项基准改进,但项目仍是 early alpha;CRO 的 Stable25 报告集与优化集重叠,实验仓库也不是无摩擦复现包,不能直接等同于 held-out 泛化或生产收益。(来源:Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces)
- 关于模型与 harness 的作用:HarnessOpt-Bench 报告优化器模型的平均影响大于编码 harness,但原生 harness 在个别模型和任务上仍可能有明显优势,因此不能简化为“模型决定一切”或“原生工具总是更好”。(来源:HarnessOpt-Bench: Evaluating LLMs at Harness Optimization,§5.1 / §5.4)
相关页面
- 概念:Harness Engineering、Context Engineering、Self-Improving Harness、Recursive Self-Improvement、Agentic RL、Meta-Agent、Reversible Agentic Execution Trace、Harness Optimization、Agent Failure Localization
- 实体:Lilian Weng、Shepherd、HarnessOpt-Bench、Agentic ESOpt、Interaction-Centric Agent Failure Taxonomy、Recuris、SkillForge、StarHarness、HarnessLens、PILOT、Astar、Meta-Harness、Self-Harness、Agentic Harness Engineering
- 相关主题:AI Agent Failure Analysis
- 来源摘要:Harness Engineering for Self-Improvement、Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces、Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces、HarnessOpt-Bench: Evaluating LLMs at Harness Optimization、Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures、Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Memory Requirements
- 来源摘要:Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses、SkillForge: Evolving Verifiable Skills for Reinforcement Learning Agents、StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments
- 来源摘要:Verify Smarter, Evolve Further: Efficient Harness Evolution through Behavior-Aware Verification、PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents、Astar: Learning to Propose Evolution Directions for Self-Evolving Industrial AI Systems
- 来源摘要:Meta-Harness: End-to-End Optimization of Model Harnesses、Self-Harness: Harnesses That Improve Themselves、Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses
来源
- Harness Engineering for Self-Improvement
- Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces
- Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces
- HarnessOpt-Bench: Evaluating LLMs at Harness Optimization
- Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures
- Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Memory Requirements
- Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses
- SkillForge: Evolving Verifiable Skills for Reinforcement Learning Agents
- StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments
- Verify Smarter, Evolve Further: Efficient Harness Evolution through Behavior-Aware Verification
- PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents
- Astar: Learning to Propose Evolution Directions for Self-Evolving Industrial AI Systems
- Meta-Harness: End-to-End Optimization of Model Harnesses
- Self-Harness: Harnesses That Improve Themselves
- Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses
待核实问题
- 核实进度(2026-08-28):Meta-Harness、Self-Harness、AHE 与 Shepherd 已完成原文核对并分别入库。ACE、MCE 和更早期原始文献仍待逐篇核对。
- 仍有选择偏差:需要更多反对观点、失败研究和产业实践;项目方 benchmark 与作者综述不能替代独立证据。
- 外推边界:HarnessOpt-Bench v1、Recuris、SkillForge、StarHarness、PILOT、Astar 与 HarnessLens 的任务、种子、模型、公开性和算力条件各不相同,尚不能合并成“智能体自我改进整体有效”的单一结论。