摘要
WebArena 把可重置的自托管网站、812 个长程浏览器任务和结果状态验证组合成可复现 benchmark。它允许 Agent 通过不同动作路径完成任务,但主实验只使用 accessibility tree 与 element ID;最佳 GPT-4 基线成功率为 14.41%,明显低于抽样人类评测的 78.24%。论文没有更新模型或持久化改进机制,因此既不是严格 Agentic RL,也不构成 RSI。(来源:原始论文记录(本地存档),pp.2-8、17)
核心内容
- 环境覆盖电商、论坛、协作开发和内容管理四类网站,并加入地图、计算器、scratchpad、离线 Wikipedia 与手册;Docker 快照用于固定内容并恢复初始状态。(来源:原始论文记录(本地存档),§2、Appendix A.1-A.3)
- 812 个任务来自 241 个 intent templates,分为 information seeking、site navigation 与 content/configuration,并包含要求回答
N/A的不可完成任务。(来源:原始论文记录(本地存档),§3,pp.5-7) r_info用 exact、must-include 或 GPT-4 fuzzy match 检查答案;r_prog通过 URL、页面内容、API 或底层状态检查功能结果,而不要求复现参考动作序列。(来源:原始论文记录(本地存档),§3.2、表 1,pp.6-7)- 主实验是 two-shot prompt-based evaluation:观察为带 element ID 的 accessibility tree,最多 30 次状态转移,并对重复或连续非法动作提前终止。(来源:原始论文记录(本地存档),§4、Appendix A.6,pp.7-8、17)
- 去掉 unachievable hint 后,GPT-4 + CoT 总体成功率由 11.70% 升至 14.41%,但不可完成任务成功率由 77.78% 降至 44.44%;带提示时又会把 54.9% 可完成任务误判为不可完成。(来源:原始论文记录(本地存档),表 2、§5.1,p.8)
- 公开 config、参考答案、执行轨迹和 evaluator 提高了可复现性,也使后续模型评测需要单独控制 benchmark contamination;论文自身没有做这项审计。(综合:原始论文记录(本地存档),项目核验与局限)
相关页面
- 概念:Browser-Use Agent、Execution-Based Agent Evaluation、Agentic RL、Recursive Self-Improvement、Agent Failure Localization
- 实体:WebArena
- 主题:Browser and Computer-Use Agents、AI Agent Failure Analysis
来源
- 原始文件:原始资料(本地存档)
- alphaXiv:https://www.alphaxiv.org/abs/2307.13854
- arXiv:https://arxiv.org/abs/2307.13854
- ICLR Proceedings:https://proceedings.iclr.cc/paper_files/paper/2024/hash/4410c0711e9154a7a2d26f9b3816d1ef-Abstract-Conference.html
- 项目页:https://webarena.dev/og/
- GitHub:https://github.com/web-arena-x/webarena
- 定位信息:arXiv v4;§2-5,pp.2-9;Appendix A.1-A.10,pp.15-22
待核实问题
- 发表场合元数据冲突:arXiv v4、ICLR Proceedings 与 OpenReview 支持 ICLR 2024;
webarena.dev根页项目卡在 2026-08-28 显示“NeurIPS 2024 · Oral”。当前采用正式论文记录,等待项目方修正或解释根页标签。 - 公开任务、答案和轨迹对 2023 年后模型造成的 benchmark contamination 程度,以及在固定版本环境中的当代独立复现结果,仍待核验。