摘要
Agent Failure Localization 是从智能体执行证据中定位最早未恢复的关键失败,确定其发生在哪两个组件的交互边上,并判断修复责任属于哪一侧的过程。(来源:Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures)
核心内容
定义
当前交互中心方法使用“interaction edge + fault side + failure mode”三部分标签,把表面行为、发生边界和修复归属分开。(来源:Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures)
关键要点
- 从终局症状向前重建因果链,寻找最早且之后没有恢复的失败。(来源:Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures)
- 区分信息是否真的缺失,还是模型没有使用仍然可见的信息。(来源:Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures)
- 区分工具或环境自身故障,和模型面对可恢复故障时没有正确重试或绕行。(来源:Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures)
- 将归因映射到相应干预:模型后训练、harness 修复、工具集成、环境重构或 grader 修复。(来源:Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures)
- FACET 展示了较窄的工程化版本:根据 build/init、solution execution、test assertion 和 instruction-state mismatch 的执行证据,把修复路由到 environment、solution、verifier 或 instruction,并在干净状态重新验证。(来源:FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis,pp.6, 20)
- Recuris 报告结构化 trace 的组件定位准确率为 64.8%,高于只看终局结果的 13.0% 和 raw trajectory 的 37.0%;但该指标反映“最可能有效的 repair decision”,不是因果识别。(来源:Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses,pp.17-18)
- Self-Harness 的 failure signature 将 verifier 终局原因、相关行为的因果状态和抽象机制组合后再聚类,只有证据充分且能映射到 editable surface 的模式才进入 proposal;这减少了把任务难度误判为 harness 缺陷的风险。(来源:Self-Harness: Harnesses That Improve Themselves,pp.6-8)
- AHE 的 Agent Debugger 为原始轨迹生成逐任务报告与 benchmark overview,Evolve Agent 再把根因和目标组件写入 change manifest;实际修复预测高于随机,但回归预测 precision/recall 只有 11.8%/11.1%,说明正向归因不能替代副作用检测。(来源:Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses,pp.4-5、9)
- Shepherd 的 CRO 从候选编辑最早影响的提交处分叉,并用 fix set 与 guard set 分别检查修复和回归;这能减少无关前缀重跑,但论文没有单独消融 replay 与 gate 的因果贡献。(来源:Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces,§4.2)
- WebArena 与 OSWorld 说明终局 evaluator 的诊断边界:同一个失败分数可能来自观察解释、grounding、状态跟踪、工具环境或 validator 本身,必须结合轨迹与环境状态定位,不能从 binary outcome 直接断言根因。(综合:WebArena: A Realistic Web Environment for Building Autonomous Agents、OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments)
适用范围与边界
适用于编码智能体、长时个人助手和多智能体系统的事后诊断。可靠归因要求足够完整的轨迹、组件边界和环境证据;信息缺失时应保留多种解释或拒绝强行分类。(来源:Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures)
分歧与演变
该方法强调跨架构共享的组件交互,而许多既有分类更侧重特定 benchmark、内部模块或终局错误类型。两者可以互补:先定位关键事件与责任组件,再使用领域分类描述具体机制。(来源:Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures)
相关页面
- 上位概念:AI Agent Failure Analysis
- 相关概念:Harness Engineering、Context Engineering、Self-Improving Harness、Recursive Self-Improvement、Execution-Based Agent Evaluation、Browser-Use Agent、Computer-Use Agent
- 相关实体:Interaction-Centric Agent Failure Taxonomy、Recuris、Self-Harness、Agentic Harness Engineering、Shepherd、WebArena、OSWorld
- 相关主题:AI Agent Failure Analysis、LLM Agent Self-Improvement、Browser and Computer-Use Agents
来源
- Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures
- FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis
- Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses
- Self-Harness: Harnesses That Improve Themselves
- Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses
- Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces
- WebArena: A Realistic Web Environment for Building Autonomous Agents
- OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments
待核实问题
- 标注建议(2026-08-28):现有“最早未恢复失败”规则只适合能排成单一链条的证据。对并发根因应保留多个
interaction edge + fault side + failure mode标签,并另记共同必要、共同充分、反馈循环或顺序不可判定;不得为满足单标签格式强行选一个根因。这是基于现有证据边界的综合建议,不是原论文已验证的扩展。(综合:Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures、Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses) - 生产门槛仍待验证:自动归因应先作为 repair candidate,经过人工或独立 verifier、回归测试和可回滚部署后才转成修改;误修复率和人工复核成本尚无生产数据。