摘要

AI 智能体失败分析需要同时回答“哪里最先出错”“哪个组件负责”“应修复什么”以及“如何验证修复”。现有资料共同强调持久且可观察的执行证据、组件级定位和独立验证,但自动归因仍受证据缺失与判断误差限制。(来源:Harness Engineering for Self-ImprovementShepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution TracesModel or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures

核心内容

范围与问题

分析对象包括模型与用户、grader、context、memory、tool、其他模型、本地环境和外部环境之间的交互,以及这些组件导致的级联失败。(来源:Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures

综合结论

主要脉络

  1. 保存完整执行轨迹、组件版本、环境状态和终局结果。(来源:Harness Engineering for Self-ImprovementShepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces
  2. 从终局症状逆向重建因果链,找到最早未恢复失败。(来源:Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures
  3. Agent Failure Localization 标记交互边、fault side 与 failure mode。(来源:Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures
  4. 把修复分配到模型、harness、工具、环境或 grader,并预测潜在回归。(来源:Harness Engineering for Self-ImprovementModel or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures
  5. 通过独立测试验证修复,并保留失败提案和未决归因。(来源:Harness Engineering for Self-Improvement
  6. 在可执行任务合成中,FACET 将 build/init、solution、verifier 和 instruction-state mismatch 分成可路由的失败类型,并在独立干净容器中重新验证修复;这说明 grader 与环境状态本身也应成为故障分析的一等证据。(来源:FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis,Appendix C.2)

分歧与适用边界

相关页面

来源

待核实问题

  • 并发与累积失败(2026-08-28):保留多标签因果图,不把共同原因压成单一“最早失败”;同时记录证据顺序、责任侧、是否可恢复和未决替代解释。该方案是知识库综合建议,仍缺生产验证。(综合:Agent Failure Localization
  • 轨迹保留策略:默认保存结构化事件、组件/模型/提示版本、工具参数摘要、状态 hash、错误码、验证结果与可重放引用;敏感输入输出做分级访问、脱敏或短期保留,只有事故或高风险任务升级到完整轨迹。成本应按“能否回答预定诊断问题”选择,而不是一律全量或一律只留终局。(综合:Harness Engineering for Self-ImprovementShepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces
  • 仍待实证:故障标签能否稳定预测最有效修复,以及上述分层保留策略在真实事故中的漏诊率、成本和隐私风险。