摘要
OSWorld 是面向 multimodal computer-use Agent 的真实桌面环境与执行式 benchmark。它把虚拟机状态、截图或 accessibility tree、鼠标键盘动作、任务初始化和终局 evaluator 组合成可复位的交互评测闭环。(来源:OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments)
核心内容
基本信息
- 实体类别:computer-use 环境、benchmark 与评测基础设施。(来源:OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments)
- 关键名称或版本:2024 年论文 arXiv v2;后续项目版本包括 OSWorld-Verified 与独立的 OSWorld 2.0。(来源:OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments)
- 时间范围:论文 v1 于 2024-04-11 提交,v2 于 2024-05-30 修订,并发表于 NeurIPS 2024 Datasets and Benchmarks Track。(来源:OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments)
重要事实
- 2024 年主 benchmark 有 369 个 Ubuntu 任务、302 种初始状态和 134 个独特 evaluator;另有 43 个 Windows 分析任务。(来源:OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments)
- 观察支持 screenshot、accessibility tree 和 terminal output,动作主要通过
pyautogui操作真实桌面;评价器检查最终文件、应用配置或 UI 状态,而不是匹配单一路径。(来源:OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments) - 论文历史基线的最佳总体结果为 12.24%,对比人类 72.36%;550 个失败样例中超过 75% 存在鼠标点击坐标不准。(来源:OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments)
- 官方代码仓库公开环境、任务、baseline 和 evaluator,根许可证为 Apache-2.0。(来源:OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments)
关系与影响
OSWorld 将 browser-only benchmark 扩展到跨应用真实桌面,并为 Computer-Use Agent、Context Engineering、Execution-Based Agent Evaluation 和 AI Agent Failure Analysis 提供了可执行实验表面。它具有 reward 与潜在 RL 接口,但论文实验没有进行 policy update,因此不能仅凭环境形式化将其归为严格 Agentic RL。(综合:OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments)
分歧与变化
- arXiv v2 正文的 workflow 最高值 6.57% 没有随表 5 新增 GPT-4o 结果同步;表 5 的实际最高值是 GPT-4o + accessibility tree 的 7.56%。(来源:OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments)
- OSWorld-Verified 在 2025 年修复任务和 benchmark signals,OSWorld 2.0 于 2026 年另行发布。2024 年论文结果应作为历史版本保存,不与当前榜单直接合并。(来源:OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments)
相关页面
- 概念:Computer-Use Agent、Execution-Based Agent Evaluation、Agentic RL、Context Engineering、Agent Failure Localization
- 实体:无
- 主题:Browser and Computer-Use Agents、AI Agent Failure Analysis
来源
待核实问题
- OSWorld-Verified 相对 2024 年论文任务集的完整逐题差异及历史成绩可比性仍待独立复核。