摘要
Computer-Use Agent 是通过图形界面、键鼠或受控终端操作完整计算机环境的可执行智能体,目标通常跨越文件、桌面状态、原生应用与网页,而不是只生成文本答案。(来源:OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments)
核心内容
定义
其执行闭环包含操作系统或虚拟机、screenshot/accessibility tree/terminal 等观察、键鼠或代码动作,以及读取最终文件、应用配置或 UI 状态的 evaluator。(来源:OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments,§2.2-2.4)
关键要点
- OSWorld 用 VM snapshot、任务配置和结果 getter 将真实应用状态转成可重复实验;369 个 Ubuntu 任务覆盖单应用与跨应用工作流。(来源:OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments,表 3)
- UI grounding 是核心瓶颈之一:OSWorld 分析的 550 个失败样例中,超过 75% 出现鼠标点击不准,但这不是唯一根因,状态恢复、弹窗、应用知识和指令理解也会共同作用。(来源:OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments,§5.4)
- 观察越丰富不保证表现单调提升;screenshot、a11y、Set-of-Marks、分辨率和历史长度都与模型能力及上下文成本交互。(来源:OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments,§5.1-5.2)
- 环境提供 reward 或 RL-ready 动作空间,不代表论文已经训练了 Agent policy;OSWorld 原论文属于 benchmark/runtime,而不是严格 Agentic RL。(来源:OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments)
适用范围与边界
适用于办公软件、浏览器、代码编辑器、媒体工具与跨应用工作流。Browser-Use Agent 可视为其重要子域,但网页环境通常有 DOM 与站点 API,而完整桌面任务更多依赖像素坐标、操作系统 accessibility 和文件状态,二者不能只按同一分数直接比较。(综合:WebArena: A Realistic Web Environment for Building Autonomous Agents、OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments)
分歧与演变
OSWorld 框架支持多种操作系统不等于 benchmark 已在各系统形成同规模覆盖;原论文主体是 Ubuntu,Windows 仅有补充任务,macOS 没有公开任务集。后续 OSWorld-Verified 与 OSWorld 2.0 也必须和原 v1 结果分开记录。(来源:OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments)
相关页面
- 上位概念:无
- 相关概念:Browser-Use Agent、Execution-Based Agent Evaluation、Agentic RL、Context Engineering
- 相关实体:OSWorld、WebArena
- 相关主题:Browser and Computer-Use Agents、AI Agent Failure Analysis
来源
- OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments
- WebArena: A Realistic Web Environment for Building Autonomous Agents
待核实问题
- 当前跨 OS、跨应用和 live-account 任务的安全评测协议、凭据隔离与长期可复现性仍待更多来源交叉验证。