摘要
Execution-Based Agent Evaluation 通过运行 Agent 并检查环境中的答案或终局状态来判断任务是否完成,而不是要求动作轨迹逐步匹配参考解。它允许多条有效路径,但可靠性取决于环境重置、状态读取器和 evaluator 的覆盖范围。(综合:WebArena: A Realistic Web Environment for Building Autonomous Agents、OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments)
核心内容
定义
该评测先物化任务初始状态,执行一段工具或 UI 交互,再用程序、API、数据库查询、文件解析、UI 状态或文本匹配计算 outcome reward。参考轨迹可以帮助调试,但通常不是判分的唯一合法路径。(来源:WebArena: A Realistic Web Environment for Building Autonomous Agents、OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments)
关键要点
- WebArena 的
r_info检查文本答案,r_prog查询网页、数据库或 API 状态;多个条件可组合,因此写操作必须真正落到环境中。(来源:WebArena: A Realistic Web Environment for Building Autonomous Agents,§3.2) - OSWorld 用 task-specific getter 和 metric 读取最终文件、配置、cookies、a11y tree 或网页数据,并允许 0-1 的部分得分。(来源:OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments,§2.2.3)
- outcome-based 不等于无漏洞:evaluator 可能 false positive/negative、遗漏无关破坏或安全副作用,也可能被公开任务和 validator 细节诱导出 reward hacking。(综合:WebArena: A Realistic Web Environment for Building Autonomous Agents、OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments)
- 可比结果需要固定任务版本、初始状态、账号、外部依赖、步数与 evaluator 修订;只固定模型名称不足以复现实验。(综合:上述两份来源摘要)
适用范围与边界
适合存在可读取终局状态的 browser-use、computer-use、coding 和工具任务。对审美、长期维护性、用户满意度或不可逆副作用,单一终局 validator 往往不足,应补轨迹审计、安全检查和人工判断。(综合:WebArena: A Realistic Web Environment for Building Autonomous Agents、OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments)
分歧与演变
论文有时把二元通过率、部分 reward 和“success rate”混称。记录结果时应保留 evaluator 的实际值域与聚合方式;OSWorld 的 0-1 fractional reward 不能一律解释为纯二元 pass 比例。(来源:OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments)
相关页面
- 上位概念:无
- 相关概念:Browser-Use Agent、Computer-Use Agent、Agentic RL、Agent Failure Localization
- 相关实体:WebArena、OSWorld
- 相关主题:Browser and Computer-Use Agents、AI Agent Failure Analysis
来源
- WebArena: A Realistic Web Environment for Building Autonomous Agents
- OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments
待核实问题
- 需要继续整理 evaluator 鲁棒性、污染审计、安全副作用和跨版本校准的共同量表。