网易首页 > 网易号 > 正文 申请入驻

实测!Qwen下一代基础架构突袭!秒解AIME数学竞赛题

0
分享至

时令 发自 凹非寺
量子位 | 公众号 QbitAI

Qwen下一代模型架构,抢先来袭!

Qwen3-Next发布,Qwen团队负责人林俊旸说,这就是Qwen3.5的抢先预览版

基于Qwen3-Next,团队先开源了Qwen3-Next-80B-A3B-Base。

模型参数80B,但训练成本连Qwen3-32B的十分之一都不到,并且在32 k以上的上下文推理吞吐能达到后者的十倍以上

基于这一模型,团队接连出手,同步开发并发布了两大新模型:

  • Qwen3-Next-80B-A3B-Instruct:在256K超长上下文处理任务中展现出显著优势。
  • Qwen3-Next-80B-A3B-Thinking:在多项基准测试中超越闭源模型Gemini-2.5-Flash-Thinking。

网友表示,这更新频率令人震惊。

话不多说,赶紧来看看新模型有哪些改进吧。

4大重要改进

Qwen3-Next的核心改进有4方面:

  • 混合注意力机制
  • 高稀疏度MoE结构
  • 稳定性优化
  • 多token预测机制

混合注意力机制

线性注意力在长上下文处理中效率很高,但召回能力有限,而标准注意力计算开销大、推理效率低,单独使用均存在局限。

为此,Qwen团队引入Gated DeltaNet,其在上下文学习能力上优于常用的滑动窗口注意力和Mamba2,并在采用3:1的混合策略(75%层使用 Gated DeltaNet,25%层保留标准注意力)时,兼顾性能与效率。

同时,在保留的标准注意力层中,他们进一步引入了多项优化设计:

1、延续先前工作的输出门控机制,以缓解注意力中的低秩问题;

2、将单个注意力头的维度从128扩展至256;

3、仅对注意力头前25%的维度加入旋转位置编码,以增强长序列外推能力。

高稀疏度MoE结构

Qwen3-Next采用高稀疏度的MoE架构,总参数量达800亿,但每次推理仅激活约30亿参数。

相比Qwen3-MoE的128个总专家和8个路由专家,Qwen3-Next 扩展到512个总专家,并采用10路由专家加1共享专家的组合设计,在保证性能的前提下最大化资源利用率。

训练稳定性优化

在Qwen3-Next中,团队为进一步提高模型稳定性,采用了Zero-Centered RMSNorm,并在此基础上,对norm weight施加weight decay,以避免权重无界增长。

不仅如此,他们还在初始化时归一化了MoE router的参数,确保每个expert在训练早期都能被无偏地选中,减小初始化对实验结果的扰动。

多token预测机制

Qwen3-Next引入了原生Multi-Token Prediction(MTP) 机制,不仅获得了Speculative Decoding接受率较高的MTP模块,还提升了模型主干的整体性能。

此外,它还对MTP的多步推理进行了专项优化,即通过训练推理一致的多步策略,进一步提高了在实际应用场景下Speculative Decoding的接受率。

快10倍,但便宜10倍

接下来,让我们一起看看新模型表现如何。

首先,Qwen3-Next使用了Qwen3 36T预训练语料的均匀采样子集,仅包含15T tokens。

其训练所需的GPU Hours不到 Qwen3-30A-3B的80%,相比 Qwen3-32B,仅需9.3%的GPU计算资源就能取得更优性能

不仅如此,得益于创新的混合模型架构,Qwen3-Next在推理效率上也表现突出。

与Qwen3-32B相比,Qwen3-Next-80B-A3B在预填充(prefill)阶段就展现出卓越的吞吐能力:

在4k tokens的上下文长度下,吞吐量接近前者的7倍;当上下文长度超过32k时,吞吐提升更是达到10倍以上

在解码(decode)阶段,该模型同样高效。4k上下文吞吐量提升约4倍,长上下文(32k+)场景中仍可保持超过10倍的吞吐优势。

基于Qwen3-Next,Qwen团队首先训练了Qwen3-Next-80B-A3B-Base模型。

该模型仅使用十分之一的Non-Embedding激活参数,就已在大多数基准测试中超越Qwen3-32B-Base,并显著优于Qwen3-30B-A3B,展现出出色的效率与性能优势。

基于Qwen3-Next-80B-A3B-Base的优异表现,团队进一步开发并发布了Qwen3-Next-80B-A3B-InstructQwen3-Next-80B-A3B-Thinking

Qwen3-Next-80B-A3B-Instruct

首先,Qwen3-Next-80B-A3B-Instruct的表现显著优于 Qwen3-30B-A3B-Instruct-2507和Qwen3-32B-Non-thinking,并在多数指标上接近Qwen3-235B-A22B-Instruct-2507。

除此之外,在RULER测试中,无论上下文长度如何,Qwen3-Next-80B-A3B-Instruct 的表现均超过了层数相同但注意力层更多的Qwen3-30B-A3B-Instruct-2507。

甚至在256 k范围内也优于层数更多的Qwen3-235B-A22B-Instruct-2507,充分体现了Gated DeltaNet与Gated Attention混合模型在长文本处理场景下的优势。

Qwen3-Next-80B-A3B-Thinking

再来看Qwen3-Next-80B-A3B-Thinking,其表现也相当不错。

在多项基准测试中都超过了闭源模型Gemini-2.5-Flash-Thinking,并在部分指标上接近Qwen最新的旗舰模型 Qwen3-235B-A22B-Thinking-2507。

推理能力相当可以

接下来让我们实测一下Qwen3-Next-80B-A3B的推理能力。

使用Qwen Chat网页,一上来就给它扔一道AIME数学竞赛题试试:

由于Qwen3-Next-80B-A3B支持多模态,这里我们可以直接上传图片。

几乎瞬间,模型就开始飞快地列出了详细解题思路和计算过程,最终得到的答案“588”与AIME标准答案完全吻合。

小试牛刀之后,接下来进入编程环节。

  • 用p5js创建一个可直接玩的扫雷游戏。

代码成功运行后,我们也简单试玩了一下,流畅度还可以(doge)。

就是谁能解释一下为什么这个游戏背景是大红色,还没有网格线???

还有网友奇思妙想,用它生成了天气卡片。

不过,看到这个更新时,网友开心之余还是忍不住吐槽:

  • 名字实在太复杂了。

目前,新模型已在魔搭社区和抱抱脸开源,大家可通过Qwen Chat免费体验,也可直接调用阿里云百炼平台提供的API服务。

魔搭社区直通车:https://t.co/mld9lp8QjK
抱抱脸直通车:https://t.co/zHHNBB2l5X
Qwen Chat直通车:https://t.co/V7RmqMaVNZ
阿里云API直通车:https://t.co/RdmUF5m6JA

参考链接:
[1]https://x.com/Alibaba_Qwen/status/1966197643904000262
[2]https://x.com/JustinLin610/status/1966199996728156167
[3]https://mp.weixin.qq.com/s/STsWFuEkaoUa8J8v_uDhag?scene=1

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
阿根廷官方:梅西告别战门票最高48万比索,约合人民币2100多元

阿根廷官方:梅西告别战门票最高48万比索,约合人民币2100多元

兰亭墨未干
2026-09-20 00:42:02
亲信突然反水,美国拿到一手“罪证”,马杜罗恐将纽约牢底坐穿?

亲信突然反水,美国拿到一手“罪证”,马杜罗恐将纽约牢底坐穿?

独舞独舞
2026-09-20 17:54:18
父亲和弟弟被收押后,谢衣凤首现身,称“不了解过程,盼还家人清白”

父亲和弟弟被收押后,谢衣凤首现身,称“不了解过程,盼还家人清白”

海峡导报社
2026-09-20 18:10:09
科目三考试现场,看到安全员喝水就加速,听到喇叭声就靠边停车……上海一驾校经营者通过“暗语”提醒方式组织驾考作弊,最终被判刑

科目三考试现场,看到安全员喝水就加速,听到喇叭声就靠边停车……上海一驾校经营者通过“暗语”提醒方式组织驾考作弊,最终被判刑

扬子晚报
2026-09-20 18:05:13
抵达北京,郭艾伦发声,正式签约,新岗位曝光,国际篮联官宣

抵达北京,郭艾伦发声,正式签约,新岗位曝光,国际篮联官宣

喜欢体育的猫
2026-09-20 09:57:54
不舍!北京这家国营老商场要关了!

不舍!北京这家国营老商场要关了!

大北京早知道
2026-09-20 18:23:12
德甲最新积分战报:多特全胜登顶,不莱梅奇迹逆袭,美因茨4-3险胜

德甲最新积分战报:多特全胜登顶,不莱梅奇迹逆袭,美因茨4-3险胜

足球狗说
2026-09-20 06:54:35
救楼市三年全救错了方向?许善达一语捅破:不帮买房人,保交楼、消费、税收全是死结

救楼市三年全救错了方向?许善达一语捅破:不帮买房人,保交楼、消费、税收全是死结

365财经plus
2026-09-20 10:18:57
全网都骂周涛董卿不悼念敬一丹?葬礼现3个细节,打脸所有指责

全网都骂周涛董卿不悼念敬一丹?葬礼现3个细节,打脸所有指责

乡野小珥
2026-09-20 04:21:53
比伯夫妇庆祝结婚8周年,甜茶爬山,粉妈带娃骑车

比伯夫妇庆祝结婚8周年,甜茶爬山,粉妈带娃骑车

赴一场山海啊
2026-09-19 20:20:19
广东近日午后体感温度或达40℃!还有大雨或暴雨

广东近日午后体感温度或达40℃!还有大雨或暴雨

南粤女声
2026-09-20 12:06:08
王树声警卫员武功高强,威名远扬方面军,许世友不服要求比划比划

王树声警卫员武功高强,威名远扬方面军,许世友不服要求比划比划

寻史者也
2026-09-19 15:34:55
乒乓亚运会:世界冠军1-11惨败,国乒女团3-1逆转,孙颖莎打疯了

乒乓亚运会:世界冠军1-11惨败,国乒女团3-1逆转,孙颖莎打疯了

帛河体育
2026-09-20 17:52:04
70%欧洲成人片来自这里、妓院比学校多,捷克的桃色不是开放是穷

70%欧洲成人片来自这里、妓院比学校多,捷克的桃色不是开放是穷

春日在捕月
2026-09-20 04:10:36
带伤出战两度登场,孙颖莎赛后说状态比想象中好

带伤出战两度登场,孙颖莎赛后说状态比想象中好

元气满分吖
2026-09-20 18:13:00
四川彭州山区蛇患严重、致人死亡?警方回应

四川彭州山区蛇患严重、致人死亡?警方回应

新浪财经
2026-09-20 15:10:18
板荡识忠臣!身负“蓝皮绿骨”恶名,王金平、侯友宜与黄敏惠动了

板荡识忠臣!身负“蓝皮绿骨”恶名,王金平、侯友宜与黄敏惠动了

风干迷茫人
2026-09-20 02:01:47
北京奥运会背包现身名古屋亚运会:18年了,拉链和肩带完好,中国制造的含金量还在不断上升

北京奥运会背包现身名古屋亚运会:18年了,拉链和肩带完好,中国制造的含金量还在不断上升

新民周刊
2026-09-20 09:07:56
WTT球星赛:国乒夺1冠失4金!单打20人输光,混双决赛胜日本

WTT球星赛:国乒夺1冠失4金!单打20人输光,混双决赛胜日本

全言作品
2026-09-20 17:49:02
你有洗屁股的习惯吗?医生提醒:天天洗肛门的人或能预防4种毛病

你有洗屁股的习惯吗?医生提醒:天天洗肛门的人或能预防4种毛病

芹姐说生活
2026-08-21 22:28:55
2026-09-20 21:04:49
量子位 incentive-icons
量子位
追踪人工智能动态
13363文章数 176568关注度
往期回顾 全部

科技要闻

谷歌承认:AI模型“黑”进3家公司

头条要闻

微博大V"理记"称西贝已起诉罗永浩:就要开庭了

头条要闻

微博大V"理记"称西贝已起诉罗永浩:就要开庭了

体育要闻

游泳2小时6金!亚运金牌榜:中国11金领跑

娱乐要闻

许嵩刚官宣结婚,冯禧黑历史就被扒

财经要闻

民企土地 被政府"无偿收储"后转手卖7亿

汽车要闻

FREELANDER神行者8开启交付 首批新车正式交付用户

态度原创

本地
家居
亲子
公开课
军事航空

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

女子指出父母总是吼孩子的深层原因,“是因为自己童年没被耐心陪伴过”,“要先找到自己的问题和创伤,再去爱孩子”

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

伊朗称已向美政府传达7项谈判条件

无障碍浏览 进入关怀版