摘要

Computer-Use Agent 是通过图形界面、键鼠或受控终端操作完整计算机环境的可执行智能体,目标通常跨越文件、桌面状态、原生应用与网页,而不是只生成文本答案。(来源:OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments

核心内容

定义

其执行闭环包含操作系统或虚拟机、screenshot/accessibility tree/terminal 等观察、键鼠或代码动作,以及读取最终文件、应用配置或 UI 状态的 evaluator。(来源:OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments,§2.2-2.4)

关键要点

适用范围与边界

适用于办公软件、浏览器、代码编辑器、媒体工具与跨应用工作流。Browser-Use Agent 可视为其重要子域,但网页环境通常有 DOM 与站点 API,而完整桌面任务更多依赖像素坐标、操作系统 accessibility 和文件状态,二者不能只按同一分数直接比较。(综合:WebArena: A Realistic Web Environment for Building Autonomous AgentsOSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments

分歧与演变

OSWorld 框架支持多种操作系统不等于 benchmark 已在各系统形成同规模覆盖;原论文主体是 Ubuntu,Windows 仅有补充任务,macOS 没有公开任务集。后续 OSWorld-Verified 与 OSWorld 2.0 也必须和原 v1 结果分开记录。(来源:OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments

相关页面

来源

待核实问题

  • 当前跨 OS、跨应用和 live-account 任务的安全评测协议、凭据隔离与长期可复现性仍待更多来源交叉验证。