摘要

论文提出一种以组件交互为分析单位的 Agent Failure Localization 方法,用于解决“同一可见失败究竟应该修模型、harness、环境还是评估器”的 repair-assignment 问题。其分类体系把 41 种失败模式映射到两个组件之间的交互边,并标注应承担修复责任的 fault side。(来源:原始论文记录(本地存档),Abstract / §1 / §3)

核心内容

为什么结果标签不够

  • 智能体行为由模型、用户、上下文、记忆、工具、其他模型和环境共同产生;仅标记最终“成功或失败”会把表面相同但根因不同的问题合并。(来源:原始论文记录(本地存档),§1)
  • 例如,智能体忽略早期指令,可能是 harness 压缩时删除了约束,也可能是信息仍在上下文中但模型没有遵循;前者需要修 harness,后者更接近模型侧干预。(来源:原始论文记录(本地存档),§1)

交互边与责任侧

  • 论文把 Model 作为中心组件,并区分 Owner、Grader、Third party、Context、Memory、Tool、Peer/Subagent、Local environment 和 External environment 等交互端点。(来源:原始论文记录(本地存档),Table 1 / §3)
  • 一个标签由“交互边 + fault side + failure mode”组成。交互边说明问题发生在哪里,fault side 说明修复应落在哪个组件。(来源:原始论文记录(本地存档),§3)
  • 当轨迹中出现级联错误时,论文从最终失败向前追溯,标记最早且此后未被恢复的失败,而不是后续症状。(来源:原始论文记录(本地存档),§3-4)

失败家族

  • 用户侧交互:涵盖 owner 指令、grader 奖励或评估、第三方内容等边界,包括过度或不足主动、指令与评估错配、规格投机及间接提示注入等模式。(来源:原始论文记录(本地存档),§5.1)
  • Harness 侧交互:涵盖 context、memory、tool 与 peer/subagent,区分目标漂移、压缩造成的理由丢失、记忆写入或读取失败、工具选择与反馈处理、委派和通信失败等模式。(来源:原始论文记录(本地存档),§5.2)
  • 环境侧交互:区分外部服务故障、陈旧状态、可恢复错误未被模型处理,以及本地环境观察或恢复失败。(来源:原始论文记录(本地存档),§5.2)
  • 41 个角色特定失败模式中,36 个被归因于模型侧、5 个归因于周边组件;作者说明这部分源于其规则:若更强模型在相同条件下本可避免或恢复,则归为模型侧。(来源:原始论文记录(本地存档),§3 / §7)

Agent-as-a-Judge 验证

  • 论文使用 40 个 worked examples,要求四个独立推理模型从原始来源重建证据、定位最早未恢复失败,并预测交互类别和具体失败模式。(来源:原始论文记录(本地存档),§6)
  • 最强 judge 的交互类别准确率为 0.80,与人工标签的 Cohen’s κ 为 0.76;完整失败模式标签的一致性低于类别层。(来源:原始论文记录(本地存档),§6 / Table 2)
  • 三个 judge 达成一致时,选择性投票的类别精确率为 0.83、覆盖率为 0.90;四个一致时精确率升至 0.96,但覆盖率降至 0.68。(来源:原始论文记录(本地存档),§6 / Table 4)

限制

  • 分类体系是描述性的,不估计各失败模式出现频率;用于构建和验证的案例是说明性样本,不应被当作流行率统计。(来源:原始论文记录(本地存档),§4 / Limitations)
  • 分类结果依赖可获得证据,简短事故报告或系统卡可能不足以唯一确定根因。(来源:原始论文记录(本地存档),§6 / Limitations)
  • Agent-as-a-Judge 的准确率仍有限,尤其是具体 failure-mode 标签;集成投票以降低覆盖率换取更高精确率。(来源:原始论文记录(本地存档),§6 / Limitations)

相关页面

来源

待核实问题

  • 版本核实(2026-08-28):仍为 arXiv v1;在 OpenReview 的标题限定检索中未找到公开评审记录,因此只能确认其预印本状态,不能据此断言“未投稿”。
  • 仍待外部验证:41 种模式对新型架构、跨模态环境和复杂多智能体组织的覆盖率,以及真实生产事故中的标注成本、可靠性与修复收益。论文的 40 个 worked examples 不能回答这些问题。