摘要

OSWorld 是面向 multimodal computer-use Agent 的真实桌面环境与执行式 benchmark。它把虚拟机状态、截图或 accessibility tree、鼠标键盘动作、任务初始化和终局 evaluator 组合成可复位的交互评测闭环。(来源:OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments

核心内容

基本信息

重要事实

关系与影响

OSWorld 将 browser-only benchmark 扩展到跨应用真实桌面,并为 Computer-Use AgentContext EngineeringExecution-Based Agent EvaluationAI Agent Failure Analysis 提供了可执行实验表面。它具有 reward 与潜在 RL 接口,但论文实验没有进行 policy update,因此不能仅凭环境形式化将其归为严格 Agentic RL。(综合:OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments

分歧与变化

相关页面

来源

待核实问题

  • OSWorld-Verified 相对 2024 年论文任务集的完整逐题差异及历史成绩可比性仍待独立复核。