摘要

Browser-Use Agent 是把网页观察转成浏览器动作,并以页面或后端状态判断任务是否完成的可执行智能体。它不仅检索网页,还要处理登录态、标签页、动态页面、长程状态与失败恢复。(来源:WebArena: A Realistic Web Environment for Building Autonomous Agents

核心内容

定义

其闭环至少包含浏览器环境、页面观察、可落地动作与结果验证。观察可来自 screenshot、DOM 或 accessibility tree;动作可按坐标或元素 ID 执行点击、输入、滚动、导航和标签页操作。(来源:WebArena: A Realistic Web Environment for Building Autonomous Agents,§2.3-2.4)

关键要点

适用范围与边界

适用于信息检索、站内导航、内容或配置操作及跨站任务。浏览器通常也是 Computer-Use Agent 的一个应用,但 browser-only benchmark 不覆盖桌面文件、原生应用和跨应用工作流。(综合:WebArena: A Realistic Web Environment for Building Autonomous AgentsOSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments

分歧与演变

早期 WebArena 主实验采用 accessibility tree 与元素 ID;这类结果不能直接代表视觉坐标控制能力。后续系统常通过 BrowserGym 等统一运行框架复用任务,比较时必须记录环境、任务标注和 evaluator 版本。(来源:WebArena: A Realistic Web Environment for Building Autonomous Agents

相关页面

来源

待核实问题

  • 当前不同 browser-use benchmark 在网站版本、凭据、网络访问和 evaluator 修订上的可比性仍待专项整理。