摘要
OSWorld 提供基于虚拟机的真实桌面交互环境、任务初始化和终局执行式评测,并据此构建 369 个 Ubuntu computer-use 任务。2024 年论文中的固定模型 baseline 与人类表现仍有明显差距,主要瓶颈包括 GUI grounding、应用知识和异常界面恢复;环境虽提供 reward 与潜在 RL 接口,但论文没有执行策略更新或持久自改进。(来源:原始资料(本地存档),pp.1-17)
核心内容
书目信息
- 作者共 17 人:Tianbao Xie、Danyang Zhang、Jixuan Chen、Xiaochuan Li、Siheng Zhao、Ruisheng Cao、Toh Jing Hua、Zhoujun Cheng、Dongchan Shin、Fangyu Lei、Yitao Liu、Yiheng Xu、Shuyan Zhou、Silvio Savarese、Caiming Xiong、Victor Zhong、Tao Yu。(来源:原始资料(本地存档),题名页)
- arXiv v1 首次提交于 2024-04-11,当前核对版本为 2024-05-30 的 v2;论文发表于 NeurIPS 2024 Datasets and Benchmarks Track。(来源:原始资料(本地存档),书目信息)
环境与评测
- 环境通过 VM snapshot 隔离和复位真实操作系统,以配置文件完成文件准备、应用启动和窗口状态设置;任务结束后,getter 从文件、配置、cookies、accessibility tree 或外部服务提取最终状态,再交给任务特定 evaluator。(来源:原始资料(本地存档),§2.2,pp.3-5)
- 原生观察包括完整桌面 screenshot、XML accessibility tree 和 terminal output;主要动作空间要求 Agent 生成
pyautogui代码,并以WAIT、FAIL、DONE控制任务状态。论文还给出有限的computer_13动作空间,定位为潜在 RL 研究接口。(来源:原始资料(本地存档),§2.3-2.4,pp.5-6;Appendix A.2-A.3,pp.23-25) - 终局 reward 位于 0 到 1,可表示完成、部分完成或正确判断任务不可行;论文实验使用固定模型、最多 15 步和 30 分钟限制。(来源:原始资料(本地存档),§2.1,p.3;Appendix C.1,p.34)
Benchmark 与结果
- Ubuntu 主集含 369 题:268 个单应用任务、101 个多应用 workflow、84 个整合自其他 benchmark 的任务和 30 个不可完成任务;另有 43 个需许可激活的 Windows 分析任务、302 种初始状态及 134 个独特 evaluator。(来源:原始资料(本地存档),§3,pp.6-8;表 3)
- 人类总体成功率为 72.36%;v2 表 5 的最佳总体 baseline 是 GPT-4 + accessibility tree 的 12.24%,GPT-4V + screenshot+a11y 为 12.17%,纯 screenshot 的强模型约为 5.26%-5.80%。(来源:原始资料(本地存档),§3.4、§4,pp.9-12;表 5)
- 在 550 个失败样例中,超过 75% 出现鼠标点击坐标不准。论文还观察到重复误点、意外弹窗或窗口噪声、专业软件知识不足、状态恢复失败、指令误解和视觉遗漏,但未分别量化这些类别。(来源:原始资料(本地存档),§5.4,p.15;Appendix D.2,pp.43-44)
分歧与版本边界
- v2 正文称 workflow 最高 baseline 为 6.57%,这对应 GPT-4V + Set-of-Marks;但同一版本表 5 已列出 GPT-4o + accessibility tree 的 7.56%。因此比较 v2 全部设置时应使用 7.56%,同时保留正文未同步更新的状态。(来源:原始资料(本地存档),正文 pp.2-3;表 5,p.10)
- 2025-07-28 发布的 OSWorld-Verified 修复了社区报告的样例问题并更新 benchmark signals;2026-06-26 又发布了独立的 OSWorld 2.0。论文的 arXiv
v2仅指 2024-05-30 修订稿,不等于 OSWorld 2.0,历史表 5 也不是当前 leaderboard。(来源:原始资料(本地存档),项目核验) - 论文页面标注 CC BY 4.0;官方仓库公开环境、任务、baseline 与 evaluator,根许可证为 Apache-2.0。复现仍可能依赖大型 VM、虚拟化权限、云资源、账号和网络配置。(来源:原始资料(本地存档),书目信息与项目核验)
分类与限制
- 严格 Agentic RL:否。 环境具有 POMDP、reward 和 RL-ready 动作接口,但论文只评测固定模型,没有用交互轨迹通过 RL 目标更新 policy。(综合:原始资料(本地存档),§2、§4、Appendix A.3)
- 严格 RSI:否。 最近若干轮上下文和任务内 reflection 不会形成跨任务持久的模型、memory 或 harness 改进。(综合:原始资料(本地存档),§4.1、Appendix C.2)
- 369 个公开任务以 Ubuntu 22.04 和有限的一组代表性应用为主;Windows 只有较小分析集,macOS 没有同规模公开任务。手写 evaluator、外部服务和闭源模型还会引入误判与时间漂移,VM 隔离也不覆盖账号、网络和潜在副作用。(来源:原始资料(本地存档),§3、§7、Appendix B.1)
相关页面
- 概念:Computer-Use Agent、Execution-Based Agent Evaluation、Agentic RL、Context Engineering、Agent Failure Localization
- 实体:OSWorld
- 主题:Browser and Computer-Use Agents、AI Agent Failure Analysis
来源
- 原始文件:原始资料(本地存档)
- 定位信息:arXiv:2404.07972v2,重点见 §2-5、§7、Appendix A-C、表 3、表 5-7 与 Appendix D.2。
待核实问题
- arXiv v2 结果对应的精确代码 revision 尚未在仓库 release/tag 中完成一一映射。
- 2024 年历史 baseline 与 OSWorld-Verified 当前任务集之间的逐题变更和可比性尚待独立复核。