摘要
AI 智能体失败分析需要同时回答“哪里最先出错”“哪个组件负责”“应修复什么”以及“如何验证修复”。现有资料共同强调持久且可观察的执行证据、组件级定位和独立验证,但自动归因仍受证据缺失与判断误差限制。(来源:Harness Engineering for Self-Improvement、Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces、Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures)
核心内容
范围与问题
分析对象包括模型与用户、grader、context、memory、tool、其他模型、本地环境和外部环境之间的交互,以及这些组件导致的级联失败。(来源:Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures)
综合结论
- 终局失败不足以指导修复,必须回溯最早未恢复事件并区分发生边界与责任侧。(来源:Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures)
- 文件化轨迹、错误记录和可逆执行状态能提高事故证据的可恢复性与可检查性。(来源:Harness Engineering for Self-Improvement、Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces)
- 失败归因应连接具体干预面,并使用回归测试或 held-out 评估验证修复,而不是只根据合理叙述接受修改。(来源:Harness Engineering for Self-Improvement、Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures)
- 证据不足或多个解释同样合理时,应保留不确定性,必要时让自动分类器 abstain。(来源:Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures)
- WebArena 的 GPT-4 基线会过早判定不可完成、重复搜索,并且在同一 intent 模板的变体间表现不稳定;这些证据把“会不会做”拆成探索、状态跟踪、停止和恢复等不同故障面。(来源:WebArena: A Realistic Web Environment for Building Autonomous Agents,§5.1 / Appendix A.10)
- OSWorld 的失败更明显受 UI 与环境交互影响:550 个失败样例中超过 75% 出现鼠标点击不准,窗口移动、缩小和 clutter 也显著降低表现;这说明模型推理正确仍可能在 grounding 与执行边界失败。(来源:OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments,§5.3-5.4)
- Execution-Based Agent Evaluation 能确认已编码的终局目标,却可能漏掉未编码的副作用并产生 false positive/negative,因此 evaluator 本身也应进入故障树。(综合:WebArena: A Realistic Web Environment for Building Autonomous Agents、OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments)
主要脉络
- 保存完整执行轨迹、组件版本、环境状态和终局结果。(来源:Harness Engineering for Self-Improvement、Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces)
- 从终局症状逆向重建因果链,找到最早未恢复失败。(来源:Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures)
- 用 Agent Failure Localization 标记交互边、fault side 与 failure mode。(来源:Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures)
- 把修复分配到模型、harness、工具、环境或 grader,并预测潜在回归。(来源:Harness Engineering for Self-Improvement、Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures)
- 通过独立测试验证修复,并保留失败提案和未决归因。(来源:Harness Engineering for Self-Improvement)
- 在可执行任务合成中,FACET 将 build/init、solution、verifier 和 instruction-state mismatch 分成可路由的失败类型,并在独立干净容器中重新验证修复;这说明 grader 与环境状态本身也应成为故障分析的一等证据。(来源:FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis,Appendix C.2)
分歧与适用边界
- 责任规则:论文把“更强模型本可避免或恢复”的情况归为模型侧,这会使模型侧类别占多数;其他责任哲学可能得出不同分配。(来源:Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures)
- 自动化程度:多 judge 一致可提高精确率,但会降低覆盖率;生产系统仍需要针对高影响案例进行人工复核。(来源:Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures)
- 轨迹价值:完整轨迹有助于根因分析,但其上下文成本、隐私和规模化处理仍是实际约束。(综合:Harness Engineering for Self-Improvement、Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures)
相关页面
- 概念:Agent Failure Localization、Harness Engineering、Context Engineering、Self-Improving Harness、Reversible Agentic Execution Trace、Execution-Based Agent Evaluation、Browser-Use Agent、Computer-Use Agent
- 实体:Interaction-Centric Agent Failure Taxonomy、Shepherd、WebArena、OSWorld
- 相关主题:LLM Agent Self-Improvement、Browser and Computer-Use Agents
- 来源摘要:Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures、WebArena: A Realistic Web Environment for Building Autonomous Agents、OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments
来源
- Harness Engineering for Self-Improvement
- Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces
- Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces
- Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures
- FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis
- WebArena: A Realistic Web Environment for Building Autonomous Agents
- OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments
待核实问题
- 并发与累积失败(2026-08-28):保留多标签因果图,不把共同原因压成单一“最早失败”;同时记录证据顺序、责任侧、是否可恢复和未决替代解释。该方案是知识库综合建议,仍缺生产验证。(综合:Agent Failure Localization)
- 轨迹保留策略:默认保存结构化事件、组件/模型/提示版本、工具参数摘要、状态 hash、错误码、验证结果与可重放引用;敏感输入输出做分级访问、脱敏或短期保留,只有事故或高风险任务升级到完整轨迹。成本应按“能否回答预定诊断问题”选择,而不是一律全量或一律只留终局。(综合:Harness Engineering for Self-Improvement、Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces)
- 仍待实证:故障标签能否稳定预测最有效修复,以及上述分层保留策略在真实事故中的漏诊率、成本和隐私风险。