摘要

Execution-Based Agent Evaluation 通过运行 Agent 并检查环境中的答案或终局状态来判断任务是否完成,而不是要求动作轨迹逐步匹配参考解。它允许多条有效路径,但可靠性取决于环境重置、状态读取器和 evaluator 的覆盖范围。(综合:WebArena: A Realistic Web Environment for Building Autonomous AgentsOSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments

核心内容

定义

该评测先物化任务初始状态,执行一段工具或 UI 交互,再用程序、API、数据库查询、文件解析、UI 状态或文本匹配计算 outcome reward。参考轨迹可以帮助调试,但通常不是判分的唯一合法路径。(来源:WebArena: A Realistic Web Environment for Building Autonomous AgentsOSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments

关键要点

适用范围与边界

适合存在可读取终局状态的 browser-use、computer-use、coding 和工具任务。对审美、长期维护性、用户满意度或不可逆副作用,单一终局 validator 往往不足,应补轨迹审计、安全检查和人工判断。(综合:WebArena: A Realistic Web Environment for Building Autonomous AgentsOSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments

分歧与演变

论文有时把二元通过率、部分 reward 和“success rate”混称。记录结果时应保留 evaluator 的实际值域与聚合方式;OSWorld 的 0-1 fractional reward 不能一律解释为纯二元 pass 比例。(来源:OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments

相关页面

来源

待核实问题

  • 需要继续整理 evaluator 鲁棒性、污染审计、安全副作用和跨版本校准的共同量表。