网易首页 > 网易号 > 正文 申请入驻

Qwen3.8,登顶英伟达榜单!

0
分享至


智东西
作者 程茜
编辑 云鹏

智东西7月22日报道,昨日,阿里千问最新发布的Qwen3.8预览版模型在英伟达评估AI进行算子优化的榜单上登顶,排名超过腾讯混元、人类开发者、Cursor。

榜单中SOL得分指的是GPU的峰值算力与HBM带宽共同决定的理论性能极限。模型这一分数越接近1,代表其生成和优化GPU算子能力越接近理论极限,可以在无需人类标注的情况下,通过与真实硬件环境的交互,自主产生训练信号、评估自身输出质量并持续改进算子。

这一榜单中排名第二的是腾讯混元Hyra、排名第四的是人类开发者Amir M. Mir、排名第六的是美国AI创企doubleAI的全自动GPU内核生成智能体系统、排名第十的是AI编程独角兽Cursor,其他项目暂未找到公开打榜记录。


SOL-ExecBench榜单是今年3月,英伟达推出的GPU CUDA Kernel内核优化基准评测套件,面向Blackwell B200架构专门用来评测AI智能体、编译器、自动内核生成工具写出的GPU算子性能。Qwen3.8登顶的FlashInfer-Bench子集,就是专门用于测试和优化大语言模型推理系统中的GPU算子。

7月19日,阿里千问大模型团队宣布将很快发布并开源Qwen3.8。该模型参数2.4T,可能是除了Fable 5外最强大的模型。昨晚,Qwen3.8-Max-Preview更新,前端(WebDev)表现更好。

一、从124个模型中提取,共235项CUDA内核优化任务

随着AI智能体生成与优化GPU内核的能力持续增强,现有基准评测的一大局限暴露,其只看重相对软件基线的加速比,而非内核执行方案本身贴近硬件最优效率的程度。而在现代数据中心中,未能充分利用硬件的kernel意味着算力与能源的双重浪费。

基于此,英伟达提出了SOL-ExecBench基准套件。这一套件共有235项CUDA内核优化任务,提取自124个商用及前沿人工智能模型,覆盖大语言模型、扩散模型、计算机视觉、音频、视频以及混合架构,目标硬件为英伟达Blackwell系列GPU,涵盖BF16、FP8、NVFP4精度下的前向与反向计算负载。


与以往基于软件性能来进行评估标准相比,SOL-ExecBench的评估目标有所不同。其通过“Speed-of-Light(SOL)”界限来评估内核性能,即由GPU的峰值算力与HBM带宽共同决定的理论性能极限

英伟达开发的SOLAR工具能够从FLOP数量、字节数、GPU峰值吞吐量以及带宽等方面,分析出这些基于硬件的SOL界限,然后将这些界限与预先定义的评分基准相结合,从而得出SOL评分。

具体来说,评分为0.5表示与基准值相当,评分为1.0表示达到了硬件上的SOL界限。因此,这个评分不仅反映了相对于基准值的改进程度,还体现了与最大可实现硬件性能相比所剩余的优化空间。


为保证评分结果的可靠性和可重复性,SOL-ExecBench还包含一个沙盒评估工具。此外基于其开发的智能优化算法,可以在相同的评估协议下改进提供的PyTorch参考实现,这种优化算法可以识别出那些试图操纵评估器的行为,即试图绕过评估机制以获得更快的运算结果。

此次Qwen3.8拿下第一的是FlashInfer-Bench子集,专门用于测试和优化大语言模型推理系统中的GPU算子。

该子集包含26个来源于Llama-3.1-8B、Qwen3-30B-A3B、DeepSeek-V3/R1的问题。

该子集覆盖的精度格式为BF16与FP8,每个问题提供7-48个动态形状的输入配置,覆盖真实生产场景,典型任务包括融合注意力(Fused Attention)、FP8 MoE和RMSNorm等推理关键算子。

根据官方披露,该测试套件中所有提交内容均在真实NVIDIA B200 GPU上隔离执行,GPU时钟锁定在1500 MHz以保证可复现性。

二、榜单排名靠前,意味模型具备闭环自我改进潜力

Kernel优化是少数几个可以提供清晰、客观、可量化反馈信号的真实工程任务之一:

  • 反馈明确:运行时间、吞吐量、带宽利用率可以精确测量;
  • 标准客观:距离硬件理论极限还有多远,没有歧义;
  • 迭代自然:每一轮优化都可以作为下一轮的起点。

这意味着模型可以在无需人类标注的情况下,通过与真实硬件环境的交互,自主产生训练信号、评估自身输出质量并持续改进。

在SOL-ExecBench FlashInfer-Bench子集上表现靠前,就意味着模型在下面几项能力上具有优势:

  • 长程因果推理:优化决策之间存在复杂依赖链,局部改动会影响全局性能,模型需要跨越长上下文进行一致性推理。
  • 工具使用与环境交互中的策略规划:现实世界智能体任务面对多轮工具调用,模型需要根据每次执行反馈动态调整策略,而非机械执行预设步骤。
  • 稀疏反馈下的探索能力:性能提升往往不是线性的,模型需要在大量“看似合理但实际无效”的方向中识别真正有价值的优化路径。
  • 系统级抽象与具体实现之间的双向翻译:从高层算法语义映射到底层硬件指令,再从硬件反馈反推优化方向,这种双向能力在科学计算、编译器设计、芯片设计等领域均有直接迁移价值。

这也意味着,能在SOL-ExecBench上持续进化的模型,具备在客观物理约束下进行闭环自我改进的能力。

三、训练侧搭建真实GPU环境,推理侧引入阿里智能体框架 智东西从千问团队获悉,在训练、推理方面,千问团队均针对Kernel Self-Evolving进行了优化。

首先在训练侧,为了让模型真正具备kernel优化能力,而非仅仅学习表面的代码模式,其构建了一套基于真实GPU环境的大规模强化学习体系

1、研究人员搭建了基于沙盒的真实GPU训练环境:

为模型提供丰富的硬件文档与可交互的Workspace,使模型能够通过真实编译、执行与性能测量获取来自硬件的奖励信号,而非依赖代理指标或模拟器。这可以确保每一个训练信号都有真实的物理意义。

2、真实Kernel仓库作为训练数据

研究人员系统性收集了大规模真实的工程级kernel优化代码,以这些真实世界的kernel作为训练query。相比合成数据,真实反馈覆盖了更广泛的优化模式、硬件适配策略与工程取舍,为模型提供了更接近生产场景的学习信号。

3、RL基础设施的针对性优化

Kernel优化任务的一个显著特点是需要超长的工具调用序列单次优化过程可能涉及数十乃至数百轮的编译-执行-分析循环。

为此,研究人员对强化学习训练基础设施进行了专项优化,使其能够高效支持超长多轮工具调用的训练,从而让模型真正学会跨越长序列的持续优化策略。

在推理侧,研究人员使用阿里巴巴Atrex Kernel Agent框架来承载算子优化的完整分析迭代流程与经验沉淀机制。


▲阿里巴巴Atrex Kernel Agent框架和工作流(图源:GitHub)

在SOL-ExecBench FlashInfer-Bench子集的评测中,该模型完成了平均29354轮工具调用的持续迭代,在每一轮循环中对kernel实现进行编译、执行、性能分析与策略调整,将性能逐步推向硬件理论极限。

这意味着,模型在数万轮的迭代过程中可以保持方向一致性、持续产出有效优化、不陷入局部震荡,正是长程持续优化能力区别于普通代码生成能力的核心所在。

结语: 从手写算子到AI生成、调优, Qwen3.8刷新自动化算子生成能力上限

Qwen3.8此次登顶,意味着其有能力承担底层算力优化的复杂工程任务,并进一步压缩人工介入算子开发的工作环节,其能直接对接真实硬件环境采集运行反馈,形成从算子生成到性能调优的自动化闭环。

自动化GPU算子生成赛道的长期竞争,未来或取决于大模型理解硬件架构、推演访存瓶颈、自主迭代调参的综合智能水平。长远来看,伴随大模型能力升级,模型侧与编译层在算力优化方面将形成持续双向反馈,硬件规格、算子实现、模型架构三者协同演进可能会成为常态。


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
马斯克曾说:西方不搞电车,集体拥抱氢能,中国电动车错了吗?

马斯克曾说:西方不搞电车,集体拥抱氢能,中国电动车错了吗?

趣味萌宠的日常
2026-09-20 06:04:22
上海市民买房被套路,20万元订金打水漂!知名中介说得花好稻好,其实早就被相关部门否决;类似纠纷屡见不鲜,如何避坑→

上海市民买房被套路,20万元订金打水漂!知名中介说得花好稻好,其实早就被相关部门否决;类似纠纷屡见不鲜,如何避坑→

新民晚报
2026-09-19 18:03:47
华人注意!美绿卡公共负担新规生效,新版I-485启用

华人注意!美绿卡公共负担新规生效,新版I-485启用

华人生活网
2026-09-20 05:17:25
孙科比继母宋庆龄年长两岁,未唤母亲,建国前夕挺身保全其安全

孙科比继母宋庆龄年长两岁,未唤母亲,建国前夕挺身保全其安全

唠叨说历史
2026-06-05 11:34:11
浙江两女高中生搭顺风车被司机赶下车“不坐就滚下去”,家长称车上人数与下单时约定不一致,投诉后平台已封禁涉事司机账号

浙江两女高中生搭顺风车被司机赶下车“不坐就滚下去”,家长称车上人数与下单时约定不一致,投诉后平台已封禁涉事司机账号

台州交通广播
2026-09-19 14:48:30
很多公司开始发低薪,却无人敢离职,网友说:都在等N+1!

很多公司开始发低薪,却无人敢离职,网友说:都在等N+1!

黯泉
2026-09-19 10:31:06
看涨至5400美元!美联储加息后,国际大行看涨黄金

看涨至5400美元!美联储加息后,国际大行看涨黄金

财闻
2026-09-20 09:09:11
裙子竟然被猫咬了个大缺口!妹子穿裙子上班一天太尴尬了,当事猫:妈,我的设计还不错吧!

裙子竟然被猫咬了个大缺口!妹子穿裙子上班一天太尴尬了,当事猫:妈,我的设计还不错吧!

铲屎官阿伟
2026-09-20 08:30:27
1992年,叶利钦把苏联最尖端的军事家底打包卖给了中国。当时没人料到,这笔买卖竟让中国军工少走了二十年弯路

1992年,叶利钦把苏联最尖端的军事家底打包卖给了中国。当时没人料到,这笔买卖竟让中国军工少走了二十年弯路

人生录
2026-08-23 00:05:16
美国、丹麦和格陵兰岛达成安全协议

美国、丹麦和格陵兰岛达成安全协议

新华社
2026-09-19 13:32:07
劳塔罗:开局不佳是态度问题;梅西?我们会传承他留下的遗产

劳塔罗:开局不佳是态度问题;梅西?我们会传承他留下的遗产

懂球帝
2026-09-20 02:58:17
1-4惨败残阵浙江,武汉三镇换回邓卓翔是解药还是遮羞布?

1-4惨败残阵浙江,武汉三镇换回邓卓翔是解药还是遮羞布?

林子说事
2026-09-19 10:49:28
中国男篮输日本仅1天,难堪一幕还是发生了,郭士强的处境太尴尬

中国男篮输日本仅1天,难堪一幕还是发生了,郭士强的处境太尴尬

暖心萌阿菇凉
2026-09-19 16:15:06
女同学35岁丧偶三年,路过她家我住了一晚,第二天我掏5万不走了

女同学35岁丧偶三年,路过她家我住了一晚,第二天我掏5万不走了

人间百态大全
2026-09-19 06:30:03
中美俄离婚率:美国2.4‰,俄罗斯高达4.4‰,中国的数据是多少

中美俄离婚率:美国2.4‰,俄罗斯高达4.4‰,中国的数据是多少

影孖看世界
2026-09-17 19:21:58
今日(9.20)女排预告,中国女排迎战越南,为迎战泰国做准备

今日(9.20)女排预告,中国女排迎战越南,为迎战泰国做准备

林子说事
2026-09-20 07:26:41
紧急通知2.5亿股民,不管你现在空仓还是满仓,下周一A股这样走

紧急通知2.5亿股民,不管你现在空仓还是满仓,下周一A股这样走

风风顺
2026-09-20 02:10:04
新首相决定对中国赔钱那一刻,全世界都看懂了:不能对华继续天真

新首相决定对中国赔钱那一刻,全世界都看懂了:不能对华继续天真

比利
2026-08-06 11:11:07
涉及黄景瑜张凌赫,谁也没想到,男艺人会因走路和裤子刷爆网络

涉及黄景瑜张凌赫,谁也没想到,男艺人会因走路和裤子刷爆网络

梦在深巷qw
2026-09-19 08:21:47
5-1!2-0!中国队手下败将闪耀亚运,两战全胜提前出线,剑指金牌

5-1!2-0!中国队手下败将闪耀亚运,两战全胜提前出线,剑指金牌

绿茵舞着
2026-09-20 00:43:39
2026-09-20 10:20:49
智东西 incentive-icons
智东西
智东西,AI产业新媒体,专注报道人工智能的前沿技术发展,和技术应用带来的千行百业产业变革。
12622文章数 117170关注度
往期回顾 全部

科技要闻

谷歌承认:AI模型“黑”进3家公司

头条要闻

牛弹琴:中东传来一个好消息 美国真打不下去了

头条要闻

牛弹琴:中东传来一个好消息 美国真打不下去了

体育要闻

2026亚运会开幕式 胡明轩吴愉担任旗手

娱乐要闻

郭麒麟瘦到全网认不出,为新剧塑形

财经要闻

伪造票据洗白药品 回流药黑色产业链曝光

汽车要闻

大五座布局 车身尺寸不变 吉利银河M8申报信息公布

态度原创

艺术
本地
游戏
房产
公开课

艺术要闻

国宝级!石涛书画全集大公开,搜尽奇峰打草稿,这才是中国画天花板!

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

《宝可梦GO》联动欧洲航天局推出太空主题活动

房产要闻

海口房价,降不动了!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版