一个熟练的电脑用户,完成一项任务平均要花1.6小时。现在把这样的任务交给AI智能体,让它在一个真实的操作系统里从头做到尾——这就是OSWorld 2.0要测的事。
它来自XLANG Lab,是一套专门评测"电脑操作智能体"的基准测试。整套测试包含108个长流程任务,覆盖桌面端和网页端应用,横跨多个专业领域。和原版OSWorld相比,这批任务要长得多,难度也完全是另一个量级。
![]()
不是做完就算,而是逐项过关
OSWorld 2.0的评分方式很特别。它不看你最后有没有交差,而是把每个任务拆成一系列加权检查点,平均每个任务约27个检查点。只有当一个任务的所有检查点全部通过,才算真正完成。
这就带来一个直接后果:分数普遍很低,即便是前沿模型也不例外。原因不难理解——任务本身很长,而"全对才算过"的判定标准又极其苛刻,任何一步掉链子,整个任务就归零。
榜单同时给出两种口径:一种是二元准确率,即完整完成的任务占比;另一种是部分得分,即每个任务平均通过了多少比例的检查点。前者严格,后者能看出智能体"做到了一半"还是"几乎没动"。
500步预算下的真实成绩
所有结果都取自OSWorld 2.0的公开榜单,运行在榜单默认的500步智能体步数预算下。这个预算限制很关键——长流程任务天然需要更多操作步骤,500步够不够用,直接决定了智能体能走多远。
数据导出里还保留了每次运行的更多细节,包括推理设置、工具设置、步数预算和预估成本。这些维度放在一起看,才能判断一个高分到底是模型能力强,还是配置堆出来的。
需要说明的是,OSWorld 2.0和原版OSWorld是两套独立的基准,前者更难,不能混为一谈。它测的不是"能不能点对按钮",而是"能不能在真实系统里把一件复杂的事从头办完"。
从1.6小时的人类耗时,到27个检查点的逐项验收,再到500步的操作预算,这套基准把"电脑操作智能体"的门槛摆得明明白白。分数低不是坏消息,它只是说明:离真正能替你干活的AI,还有很长一段路。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.