网易首页 > 网易号 > 正文 申请入驻

华为云联手北大发布 OmniaBench给 AI 智能体做一次真正的"全身体检"

0
分享至

来源:市场资讯

(来源:机器学习算法那些事)

华为云联手北大发布 OmniaBench

给 AI 智能体做一次真正的"全身体检"

华为 OmniaBench 通用 AI Agent 基准测试


2026 年 7 月 25 日

项目主页:scuuy.github.io/OmniaBench|论文:arXiv:2607.14989

一、当 AI 学会"干活",谁来打分?

2026 年,大模型正从"会聊天"全面进化到"会干活"。GPT-5.6、Claude-Sonnet-5、DeepSeek-V4 等前沿模型已经能够理解复杂指令、调用外部工具、维护任务状态,在真实工作中充当"数字员工"。

但一个核心问题随之而来:我们如何系统性地评价一个 AI Agent 好不好用?

传统的 Agent 基准测试存在三大局限:场景单一(只测编程或只测网页操作)、工具生态狭窄(仅支持特定 API)、评估粗糙(只给一个"通过 / 失败")。这种评测方式,就像体检只量身高体重,却告诉你"身体非常健康"。

2026 年 7 月 16 日,华为云后训练团队联合北京大学 DCAI 团队,携手中国人民大学、北京理工大学、清华大学等多家机构,在 arXiv 上发布了 OmniaBench —— 一个面向通用 AI Agent 的"全身体检"基准,配有完整的论文、代码和开源数据集。


▲ 图 1:OmniaBench 整体架构——从真实应用知识到可执行轨迹与可验证结果

OmniaBench 不只是一个"排行榜生成器"。它在回答"哪个模型分数更高"的同时,还能进一步解释:模型强在哪里、在哪些场景更可靠、完成任务付出了多少行动成本,以及它为什么失败。

二、不止是"分数":OmniaBench 的深度诊断哲学

OmniaBench 的设计理念可以用一句话概括:评测不是终点,诊断才是目的。传统 Agent 评测往往只给一个 Pass@1 分数,但分数相同的两个模型,能力画像可能完全不同。

2.1 三大应用场景全覆盖

OmniaBench 构建了一套层次化场景分类体系,覆盖当今 AI Agent 落地的三大主战场:

ToC(消费者场景):22 个一级领域、101 个细分场景,源自真实应用生态和日常用户需求。比如帮用户规划旅行、管理日程、跨 App 协同操作等。

ToB(商业场景):38 个一级领域、186 个细分场景,涵盖专业服务、产业流程、企业运营。涉及供应链管理、财务分析、客户服务等复杂企业任务。

ToE(员工场景):30 个一级领域、67 个细分场景,基于通用知识工作和职场任务。包括文档处理、数据分析、会议协作等。

总计 90 个一级领域、354 个二级领域,这是目前覆盖面最广的 Agent 评测分类体系之一。


▲ 图 2:OmniaBench 三大场景(ToC / ToB / ToE)覆盖 90 个一级领域

2.2 十维能力诊断 + 八项难度因子

OmniaBench 独创性地引入了"十维能力分类法",将 Agent 表现拆解为十个可量化维度:

① 任务理解 ② 信息收集 ③ 规划与决策 ④ 状态管理 ⑤ 工具使用

⑥ 代码与编程 ⑦ 数据分析 ⑧ 办公与文档 ⑨ 互动协作 ⑩ 可靠性与安全

同时,还引入了"八项原子难度因子"(如模糊目标、长上下文证据、状态演进等),对每个任务轨迹进行细粒度归因。这让研究者不仅能知道"模型得了多少分",还能知道"分扣在哪里"以及"为什么扣分"。


▲ 图 3:OmniaBench 十维能力诊断雷达图——分数相同的模型可能拥有完全不同的能力画像

三、四管齐下:1,431 个任务的生成之道

OmniaBench 的数据并非简单的人工标注,而是从应用商店、产品文档、行业白皮书、网络检索中系统性地抽取场景知识,构建可执行的 Python 仿真环境,再通过四种互补路径合成任务。完整数据集包含 1,431 个任务,其中精选 644 个高难度任务作为排行榜挑战子集。

四种任务构造路线

每一种路线针对不同类型的 Agent 能力:

DAG(有向无环图)—— 354 个任务:多轮有状态交互和工具链执行,模拟复杂工作流。这是 OmniaBench 的核心路线,最接近真实 Agent 使用场景。

DAG-S(单轮派生)—— 200 个任务:通过对 DAG 任务进行查询细化得到的单轮任务,侧重意图理解和快速响应。

Solver(求解器驱动)—— 60 个任务:选择、调度、分配、优化类场景,测试 Agent 在运筹规划方面的能力。

Program(程序化推理)—— 30 个任务:涉及分支、循环和调试的程序化推理任务,考察 Agent 的编程思维。


▲ 图 4:OmniaBench 多路线任务构建管线——从分类种子和可执行环境到任务策展


▲ 图 5:OmniaBench 数据集统计概览——涵盖四个路线、多种语言的任务分布

四、排行榜揭晓:最强模型也仅过半

OmniaBench 基于 644 个挑战子集任务,使用 Pass@1(一次通过率)进行微平均计算,共评测了 22 个主流模型。结果令人警醒——当前最强模型也远未达到可商用的可靠性水平。

Top 8 模型排行榜(Pass@1)


▲ 图 6:OmniaBench 排行榜——Claude-Sonnet-5 以 58.54% 的综合通过率位居榜首

排行榜要点解读:

1. Claude-Sonnet-5 以 58.54% 的综合得分排名第一,GPT-5.6-Sol 以 57.14% 紧随其后,差距仅 1.4 个百分点。

2. 开源阵营中,GLM-5.2 以 56.83% 位列第三,DeepSeek-V4-Pro 以 54.50% 排名第五,展现了国产开源模型的强劲实力。

3. 所有头部模型的成绩都在 50%-60% 区间,说明当前 AI Agent 在真实复杂任务中还有近一半的任务无法可靠完成。

4. 不同路线上的表现差异显著:比如 GPT-5.6-Sol 在 Solver 任务上得分最高(65.00%),但在 Program 任务上仅 50.00%,显示了"偏科"现象。

核心洞察:即使是最强的 AI Agent,在真实世界的复杂任务中仍有超过 40% 的失败率。Agent 革命刚刚开始,可靠性仍是最大瓶颈。

五、模型为什么失败?——53.8% 的失败源自推理而非工具

OmniaBench 最亮眼的特点之一,是它能深入分析 Agent 失败的根本原因。研究团队对所有失败案例进行了系统性归因,得出了几条振聋发聩的结论:

5.1 瓶颈是"大脑"而非"双手"

在全部失败案例中,规划失误、任务分解错误、约束维持失败、反思不足和自适应校正不力等推理层面的问题占比高达 53.8%,远超工具调用本身的语法或接口错误。

这意味着:当前模型已经基本学会了"如何使用工具",但还不擅长"思考和规划如何使用工具"。就像一个会用扳手但不懂如何修车的人。

5.2 步数更多不一定代表更努力

研究发现了一个反直觉的现象:更强的模型反而用更少的工具步骤完成任务。步数更长的轨迹往往反映的不是更彻底的执行,而是冗余的探索、反复的重规划,甚至是"兜圈子"。

这揭示了一个重要的评估维度——行动效率。一个真正优秀的 Agent 应该在保证正确性的前提下,以最少的步骤达成目标。

5.3 综合排名掩盖了场景特化优势

不同模型在 ToB、ToC、ToE 三大场景下表现差异明显,甚至在同一场景的不同细分领域中也有不同表现。一个综合排名第五的模型,可能在财务分析场景中排名第一。


▲ 图 7:OmniaBench 失败归因与能力差异分析——推理层短板(53.8%)是最主要的失败原因

5.4 三大系统性短板

任务规划断层:多步任务中,Agent 容易出现步骤跳跃、逻辑死循环或子目标丢失。这在大规模企业级工作流中尤为突出。

长程约束漂移:在长上下文交互中,Agent 难以持续遵守初始条件和边界限制,往往"聊着聊着就忘了最初的要求"。

动态自适应弱:面对环境状态突变或工具返回错误时,Agent 缺乏有效的自我修正策略,容易"一条路走到黑"。

六、OmniaBench 的产业价值与开源生态

OmniaBench 不只是一个学术项目,更具有强烈的产业落地导向:

对于 AI 研发团队

提供一个统一的"体检平台",快速验证不同模型架构与工程优化策略下的真实落地能力,大幅降低迭代测试成本。十维能力诊断直接定位模型短板,让优化有据可依。

对于企业用户

结合自身业务场景定制分层评测方案,筛选真正适配的 AI Agent 产品,规避"实验室效果好、实际落地差"的选型陷阱。

对于学术研究

提供可复现的标准化横评基准,推动通用 AI Agent 能力边界的研究,为后续方向(如长程规划算法、约束强化学习、动态环境自适应等)指明攻关重点。

完全开源

OmniaBench 的代码、数据集、评估工具均已开源:

论文地址:https://arxiv.org/abs/2607.14989

项目主页:https://scuuy.github.io/OmniaBench/

GitHub 仓库:https://github.com/scuuy/OmniaBench

数据集:https://huggingface.co/datasets/scuuy666/OmniaBench

代码采用 Apache 2.0 许可证,支持 OpenAI 兼容和 Anthropic 原生 API,只需一条命令即可启动评测。研究团队来自华为云后训练团队与北京大学 DCAI 团队,中国人民大学、北京理工大学、清华大学也参与了本研究。

七、结语:评测决定方向

在 AI Agent 从实验室走向产业化的关键节点,"如何评测"本身就决定了"谁将被选中"。OmniaBench 的价值不仅在于提供了一个全面的排行榜,更在于建立了一套"能解释、可诊断、重效率"的评估范式。

好的评测不只是打分,而是告诉开发者:你的模型差在哪里、为什么差、以及下一步应该从哪里改进。

当 AI Agent 开始真正进入我们的工作和生活,我们需要的不是一个"全能冠军",而是一个能清楚了解其能力边界和适用场景的 AI 伙伴。OmniaBench 正是为这个目标而生——帮助整个行业更好地理解 AI Agent,让每一次优化都有方向,让每一次落地都有依据。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
菲尔兹奖美国得主走红:会说中文脱口秀,曾讲单田芳评书夺冠!儿子问:爸出生在中国?

菲尔兹奖美国得主走红:会说中文脱口秀,曾讲单田芳评书夺冠!儿子问:爸出生在中国?

红星新闻
2026-07-25 12:11:13
谁不喜欢“龟”航?前段时间刚来国内

谁不喜欢“龟”航?前段时间刚来国内

中国民航人
2026-07-26 08:24:05
那年,杨超越还是个厂妹,在厂里啃馒头

那年,杨超越还是个厂妹,在厂里啃馒头

微微热评
2026-07-08 23:03:27
贵阳一阿姨买水果怀疑被退假钞,商家咬定钱被掉包反指顾客敲诈:她在这里闹事,喊警察来

贵阳一阿姨买水果怀疑被退假钞,商家咬定钱被掉包反指顾客敲诈:她在这里闹事,喊警察来

扬子晚报
2026-07-25 14:22:39
郭碧婷不让女儿看《白雪公主》,称:我不能理解,为什么被别人救了就要嫁给他

郭碧婷不让女儿看《白雪公主》,称:我不能理解,为什么被别人救了就要嫁给他

韩小娱
2026-07-24 10:13:51
陶哲轩:在死胡同里寻找尤里卡时刻的人

陶哲轩:在死胡同里寻找尤里卡时刻的人

粤语音乐喷泉
2026-07-22 16:58:47
菲尔兹奖刷屏后,我想把英语这笔账重新算一遍

菲尔兹奖刷屏后,我想把英语这笔账重新算一遍

平流层散步者
2026-07-25 13:57:26
彻底摊牌!阿森纳启动天价挖角,锁定皇马殿堂级天王

彻底摊牌!阿森纳启动天价挖角,锁定皇马殿堂级天王

一隅非生
2026-07-26 08:17:42
又一小学通知了!北京多区中小学开学时间安排出炉!速戳了解→

又一小学通知了!北京多区中小学开学时间安排出炉!速戳了解→

辉哥说动漫
2026-07-26 03:35:31
28岁女演员突然宣布当妈,网友:好有种的女人,事业上升生孩子

28岁女演员突然宣布当妈,网友:好有种的女人,事业上升生孩子

娱人细品
2026-07-24 17:14:07
29国签约成功,新组织落户中国,日本另起炉灶,特朗普最怕当老二

29国签约成功,新组织落户中国,日本另起炉灶,特朗普最怕当老二

吕彏极限手工
2026-07-25 11:14:03
没了“回锅肉”,《披荆斩棘6》终于想明白该怎么翻身了

没了“回锅肉”,《披荆斩棘6》终于想明白该怎么翻身了

娱乐圈十三太保
2026-07-24 15:32:49
隐忍13年难逃法网!大数据锁定“消失的妻子”,四川兴文杀妻案告破

隐忍13年难逃法网!大数据锁定“消失的妻子”,四川兴文杀妻案告破

老欧讲大案
2026-07-24 20:50:04
贝克汉姆14岁的女儿小七怎么如此成熟了,好像少妇

贝克汉姆14岁的女儿小七怎么如此成熟了,好像少妇

西楼知趣杂谈
2026-06-13 19:52:21
大脑最爱的8道食物,建议多给孩子吃,提升记忆力,胃口好

大脑最爱的8道食物,建议多给孩子吃,提升记忆力,胃口好

美食店主
2026-07-22 00:17:36
28岁上海女健身教练确诊艾滋病,痛苦坦言:早有异常,当时没重视

28岁上海女健身教练确诊艾滋病,痛苦坦言:早有异常,当时没重视

杜医生聊健康
2026-07-13 18:58:31
曝理查兹是76人的潜在关注目标 或让其出任替补中锋

曝理查兹是76人的潜在关注目标 或让其出任替补中锋

北青网-北京青年报
2026-07-26 08:18:14
直击台风“红霞”登陆:楼层在晃动,雨水像从高压水枪里射向地面

直击台风“红霞”登陆:楼层在晃动,雨水像从高压水枪里射向地面

环球网资讯
2026-07-26 07:42:10
升职名单没我,七分钟办离职,下楼遇董事长:明年到你,淡定回:刚辞职

升职名单没我,七分钟办离职,下楼遇董事长:明年到你,淡定回:刚辞职

侃故事的阿庆
2026-07-26 07:21:08
女子和男友“发生亲密关系”,说自己像个服务员,考上北大被分手

女子和男友“发生亲密关系”,说自己像个服务员,考上北大被分手

汉史趣闻
2026-07-24 19:08:39
2026-07-26 09:08:49
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4213244文章数 9016关注度
往期回顾 全部

科技要闻

星舰13飞全中!20颗真卫星出舱

头条要闻

男子在饮品店匿名下单:每天30杯冰鲜柠檬水免费领取

头条要闻

男子在饮品店匿名下单:每天30杯冰鲜柠檬水免费领取

体育要闻

拿过两个金球奖,却说它只值10英镑

娱乐要闻

王祖贤这么缺钱吗 竟然把自己卖给了AI

财经要闻

滥用市场支配地位 携程被罚没51.79亿元

汽车要闻

轿跑姿态+大空间/标配655km续航 奇瑞风云A9置换价10.68万起

态度原创

教育
艺术
房产
数码
公开课

教育要闻

王虹五六岁解开的题你多久能算出答案

艺术要闻

林俊杰破例献曲,只因看了她的画!这个“狂野少女”到底什么来头?看完我头皮发麻!

房产要闻

37人抢1套房…海棠湾资产拍卖,爆了!

数码要闻

抵制天价内存!多家手机大厂联手拒绝供应商涨价要求

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版