摘要
Browser-use 与 computer-use 研究把 LLM Agent 放进可执行网页或桌面环境,以多步观察、动作和终局验证衡量实际任务完成。WebArena 建立了自托管网页与状态验证的基础协议,OSWorld 将范围扩展到真实操作系统、原生应用和跨应用工作流。(综合:WebArena: A Realistic Web Environment for Building Autonomous Agents、OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments)
核心内容
范围与问题
该主题关注环境如何重置,Agent 看见 screenshot、DOM、a11y 或 terminal 中的什么,动作怎样落到 UI,以及 evaluator 如何确认结果而不拘泥于唯一轨迹。核心难点包括 grounding、长程状态、探索与恢复、上下文成本、环境漂移和副作用安全。(综合:上述两份来源摘要)
综合结论
- WebArena 的 812 个任务覆盖信息查询、导航和内容/配置操作;GPT-4 prompt-only 基线最高 14.41%,170 题人类抽样为 78.24%。差距主要是历史证据,不能代表 2026 年系统现状。(来源:WebArena: A Realistic Web Environment for Building Autonomous Agents,表 2)
- OSWorld 的 Ubuntu 主集有 369 个任务,包含 101 个跨应用 workflow;人类为 72.36%,原论文最强总体模型设置为 12.24%。它显示从网页扩展到完整桌面后,坐标 grounding、应用知识和恢复成本更加突出。(来源:OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments,表 3、表 5)
- 两者都采用 Execution-Based Agent Evaluation,因此允许多条有效路径;但 evaluator 只能检查已编码结果,未编码的破坏、安全风险和用户体验可能完全不计分。(综合:上述两份来源摘要)
- 两篇基础论文都提供 reward 和多步环境,但都没有根据交互回报更新模型,所以不是严格 Agentic RL。环境是否可用于 RL 与论文是否实际做了 RL 必须分开。(综合:上述两份来源摘要)
主要脉络
- WebArena 用自托管网站、预填数据、浏览器观察动作和网站状态 evaluator 建立可重复 browser-use benchmark。(来源:WebArena: A Realistic Web Environment for Building Autonomous Agents)
- OSWorld 用 VM、真实应用、任务级 setup/getter/metric 和 PyAutoGUI 扩展到跨应用 computer-use。(来源:OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments)
- 后续工作开始把这类环境用于参数优化,例如 Agentic ESOpt 在 WebArena-Lite 上使用轨迹回报,但其 evolution strategy 与严格策略梯度式 RL 仍需分开标注。(来源:Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Memory Requirements)
- 运行框架、任务修订和 evaluator 修复正在持续演变:WebArena 推荐更新的统一框架,OSWorld 推出 Verified 版本和独立的 2.0 工作;旧表格不能直接和新榜单混排。(综合:WebArena: A Realistic Web Environment for Building Autonomous Agents、OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments)
分歧与适用边界
- WebArena 的人类 78.24% 来自每个模板抽一题的 170 题样本;OSWorld 报告的 72.36% 来自另一套桌面任务。样本、协议和结果值域不同,不能把差值解释为任务难度的精确排序。(来源:WebArena: A Realistic Web Environment for Building Autonomous Agents、OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments)
- WebArena 的“真实”是可重置网站快照;OSWorld 的“真实”是 VM 内真实 OS 与应用。两者都为可重复性主动缩减了开放世界的不确定性。(综合:上述两份来源摘要)
- OSWorld v2 正文称 workflow 最佳为 6.57%,但同版表 5 加入 GPT-4o 后为 7.56%;本知识库保留这一内部不一致并以表格数值作为当前 v2 记录。(来源:OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments)
相关页面
- 概念:Browser-Use Agent、Computer-Use Agent、Execution-Based Agent Evaluation、Agentic RL、Agent Failure Localization、Context Engineering
- 实体:WebArena、OSWorld、Agentic ESOpt
- 相关主题:AI Agent Failure Analysis、LLM Agent Self-Improvement
- 来源摘要:WebArena: A Realistic Web Environment for Building Autonomous Agents、OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments、Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Memory Requirements
来源
- WebArena: A Realistic Web Environment for Building Autonomous Agents
- OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments
- Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Memory Requirements
待核实问题
- 下一批应单独核对 BrowserGym/AgentLab、VisualWebArena、WebArena++、OSWorld-Verified 与 OSWorld 2.0,建立跨版本谱系,而不是把其结果回填到原论文页面。