摘要
WebArena 是面向自主网页 Agent 的自托管环境与功能正确性 benchmark,以可重置网站、长程自然语言任务和程序化结果验证支持可复现实验。(来源:WebArena: A Realistic Web Environment for Building Autonomous Agents)
核心内容
基本信息
- 实体类别:Browser-use Agent 环境、数据集与评测工具链。(来源:WebArena: A Realistic Web Environment for Building Autonomous Agents)
- 关键名称或版本:论文 arXiv:2307.13854v4;官方代码最新正式数据 release 为 v0.2.0。(来源:WebArena: A Realistic Web Environment for Building Autonomous Agents,项目核验)
- 时间范围:arXiv 首次提交于 2023-07-25;v4 修订于 2024-04-16;正式发表于 ICLR 2024。(来源:WebArena: A Realistic Web Environment for Building Autonomous Agents,书目信息)
重要事实
- WebArena 提供四类核心网站及地图、知识库等辅助站点,观察接口支持 screenshot、DOM 和 accessibility tree,动作覆盖页面元素、标签页与 URL 导航。(来源:WebArena: A Realistic Web Environment for Building Autonomous Agents,§2,pp.2-5)
- Benchmark 包含 812 个任务和 241 个 intent templates;结果验证检查答案、URL、页面内容或底层状态,因此多条不同动作路径可以获得成功。(来源:WebArena: A Realistic Web Environment for Building Autonomous Agents,§3,pp.5-7)
- 论文主实验只评测基于 accessibility tree 的固定模型与提示:最佳 GPT-4 成功率为 14.41%,抽样人类评测为 78.24%。(来源:WebArena: A Realistic Web Environment for Building Autonomous Agents,§4-5、表 2,pp.7-8)
- 官方仓库采用 Apache-2.0,公开 task config、evaluation harness、测试与环境部署资料;复现仍依赖较重的自托管站点、Docker/AMI、登录状态和模型 API。(来源:WebArena: A Realistic Web Environment for Building Autonomous Agents,项目核验)
关系与影响
WebArena 为 Browser-Use Agent、Execution-Based Agent Evaluation、Agentic RL 与 Agent Failure Localization 提供可执行环境和终局验证器,但原论文只做静态、prompt-based evaluation,没有策略更新或跨任务持久改进,因此不属于 Recursive Self-Improvement。(来源:WebArena: A Realistic Web Environment for Building Autonomous Agents)
分歧与变化
- 2023 年 v0.2.0 修正过标注问题;官方仓库后来建议使用 AgentLab/BrowserGym 承担并行运行和统一 benchmark 接入。比较成绩时必须记录 task config、环境镜像与运行框架版本。(来源:WebArena: A Realistic Web Environment for Building Autonomous Agents,项目核验)
- 正式论文记录为 ICLR 2024,但项目根页在 2026-08-28 显示“NeurIPS 2024 · Oral”;当前视为项目导航元数据冲突,不覆盖正式记录。(来源:WebArena: A Realistic Web Environment for Building Autonomous Agents)
相关页面
- 概念:Browser-Use Agent、Execution-Based Agent Evaluation、Agentic RL、Recursive Self-Improvement、Agent Failure Localization
- 实体:无
- 主题:Browser and Computer-Use Agents、AI Agent Failure Analysis
来源
待核实问题
- 公开任务与答案对当代模型的污染程度,以及当前多模态 Agent 在固定、无泄漏设置中的可复现表现。
- 功能正确性 evaluator 对安全副作用、视觉质量和未编码状态的漏检范围。