摘要

WebArena 把可重置的自托管网站、812 个长程浏览器任务和结果状态验证组合成可复现 benchmark。它允许 Agent 通过不同动作路径完成任务,但主实验只使用 accessibility tree 与 element ID;最佳 GPT-4 基线成功率为 14.41%,明显低于抽样人类评测的 78.24%。论文没有更新模型或持久化改进机制,因此既不是严格 Agentic RL,也不构成 RSI。(来源:原始论文记录(本地存档),pp.2-8、17)

核心内容

  • 环境覆盖电商、论坛、协作开发和内容管理四类网站,并加入地图、计算器、scratchpad、离线 Wikipedia 与手册;Docker 快照用于固定内容并恢复初始状态。(来源:原始论文记录(本地存档),§2、Appendix A.1-A.3)
  • 812 个任务来自 241 个 intent templates,分为 information seeking、site navigation 与 content/configuration,并包含要求回答 N/A 的不可完成任务。(来源:原始论文记录(本地存档),§3,pp.5-7)
  • r_info 用 exact、must-include 或 GPT-4 fuzzy match 检查答案;r_prog 通过 URL、页面内容、API 或底层状态检查功能结果,而不要求复现参考动作序列。(来源:原始论文记录(本地存档),§3.2、表 1,pp.6-7)
  • 主实验是 two-shot prompt-based evaluation:观察为带 element ID 的 accessibility tree,最多 30 次状态转移,并对重复或连续非法动作提前终止。(来源:原始论文记录(本地存档),§4、Appendix A.6,pp.7-8、17)
  • 去掉 unachievable hint 后,GPT-4 + CoT 总体成功率由 11.70% 升至 14.41%,但不可完成任务成功率由 77.78% 降至 44.44%;带提示时又会把 54.9% 可完成任务误判为不可完成。(来源:原始论文记录(本地存档),表 2、§5.1,p.8)
  • 公开 config、参考答案、执行轨迹和 evaluator 提高了可复现性,也使后续模型评测需要单独控制 benchmark contamination;论文自身没有做这项审计。(综合:原始论文记录(本地存档),项目核验与局限)

相关页面

来源

待核实问题

  • 发表场合元数据冲突:arXiv v4、ICLR Proceedings 与 OpenReview 支持 ICLR 2024;webarena.dev 根页项目卡在 2026-08-28 显示“NeurIPS 2024 · Oral”。当前采用正式论文记录,等待项目方修正或解释根页标签。
  • 公开任务、答案和轨迹对 2023 年后模型造成的 benchmark contamination 程度,以及在固定版本环境中的当代独立复现结果,仍待核验。