网易首页 > 网易号 > 正文 申请入驻

Qwen4提前剧透,架构这块底牌被掀开了!

0
分享至

智猩猩AI整理

编辑:林夕

Qwen这次又玩了一次提前剧透,预告了一款新模型——Qwen3.8-Flash-Next

它直接采用下一代Qwen4架构,提前把Qwen4的技术路线摆到了桌面上。


按照目前ModelScope官方预告信息,Qwen3.8-Flash-Next将在北京时间8月26日23:00左右开放权重,原版与FP8双版本同步放出。


为什么选择提前开源?

官方的说法是让社区提前准备runtime、量化方案与inference engine,模型还没正式落地,生态已经开始跟进。

Unsloth联合创始人Daniel Han随后确认团队在做day-zero支持。


同时,在预告页刚上线时还放了一段完整的Highlights,但很快被官方删除。

@AiBattle在X上及时截到了全文,这是目前关于这次发布最完整的一手文字记录:


01

参数、记忆、Attention,

Qwen开始全面做稀疏

删掉的Highlights里,信息密度最高的是第一行:125B主模型参数、额外51B的 N-gram Embeddings、每token激活6B。

其实回答的是同一个问题:怎么让模型知道得更多,同时算得更少?

(1)125B参数,却只激活6B

6B的激活量,是MoE最核心的一笔交易,模型内部被切成大量专家网络,每个Token到来时,由路由器挑出少数几个专家参与计算,其余专家全部休眠。

所以,125B是模型的总容量,6B是每个Token真正付出的计算量。算力账按6B付,知识容量按125B存。

而这个剪刀差,正在被Qwen一代代拉大。

Qwen3-Next-80B-A3B是80B存、3B付,占比3.75%;Qwen3.8-2.4T-A95B是2.4T存、95B付,约4%;到了Flash-Next,125B只激活6B,占比约4.8%。

存得越来越多,真正需要算的却越来越少,然而这条曲线不是自然形成的,而是Qwen在主动把模型容量和计算成本拆开。

当然,在这三个数字里,125B和6B其实还算Qwen的常规操作,真正反常规的,是旁边那块51B。

(2)51B N-gram,到底是在干什么?

51B N-gram Embeddings,可以理解成一张可以训练的巨型查找表。N-gram指连续几个Token组成的局部组合。

比如“人工”“智能”连续出现,可以形成2-gram;代码里的for i in,则可以形成3-gram。

模型会根据最近几个Token计算相关信息,再通过Hash找到对应位置,从表里取出向量,混入当前的hidden state。

它有点像一本随查随用的常用短语手册,高频的局部搭配,不必每次都让主模型重新计算;能查到的,直接拿来用。

主网络因此可以把更多计算预算留给真正需要理解、推理和决策的问题。

但看到51B,第一反应很容易是:这么大的参数量,不会把推理成本直接炸掉吗?

关键就在于,它不是把51B参数每次全部算一遍,每个Token只会访问其中极少数N-gram条目,读取对应的向量,再参与后续计算。

所以它的成本结构和普通稠密权重完全不同:

51B主要贡献的是存储容量,而不是每个Token对应的等比例计算量。

这也是Flash-Next最值得关注的地方之一:Qwen不是简单地继续给模型堆参数,而是在尝试给主模型外挂一套超大规模、稀疏访问的记忆。

而到了Attention,这套把存储和计算拆开的思路还在继续。

Qwen又开始动Attention了

这次动了两个地方:一个是延续,一个是全新。

延续的是GDN(Gated Delta Network),属于线性注意力路线。

它维护一个固定大小的recurrent state,通过learned gating和Delta rule持续更新,状态规模不会随着序列长度不断膨胀。


传统Transformer则是另一套账,每产生一个Token,就继续往KV Cache里堆一份Key和Value。上下文越长,这本历史账本就越厚,显存和计算压力也跟着上升。

GDN做的事情,就是用固定规模的state,替代这本不断变厚的账本。

但纯线性注意力有一个问题:精确检索能力通常不如全注意力,所以Qwen的解法不是彻底抛弃Transformer,而是做混合。

大部分层走GDN,少量层保留全注意力,在效率和精确检索之间做平衡,Flash-Next延续了这条路线,配置为69层GDN + 23层全注意力,仍然是3:1的比例

但这次又多了一个全新的组件:QSA(Qwen Sparse Attention)

这也是目前预览信息里最大的悬念,具体实现还没有公开,但从命名来看,它针对的正是Attention本身的稀疏化。

如果GDN解决的是大部分序列计算的效率问题,那么QSA进一步瞄准的,就是混合架构里剩下的全注意力计算

也就是说,Qwen连最后这块高成本区域,也开始动手了。

02

Qwen为什么开始

疯狂强调Long-Horizon?

线索藏在官方的话术里。Highlights 强调的 agentic coding、long-horizon tasks、multimodal intelligence,前两个词都指向小时级的任务。

Long-horizon 意味着什么?一个agent写代码,可能要跑几百轮工具调用,上下文累积到几十万 token。任务本身的长度成了负载

比如一个Coding Agent,从理解需求开始,到读代码、改代码、运行测试、读取报错,再继续修改,可能要经历上百轮工具调用。上下文一路累积,最后真正成为模型的负载。

传统Transformer在这个场景下有一笔死账。KV cache随token数线性堆积,长任务跑到后半程,算力大量花在搬运历史上,而不是生成新内容。

这也是为什么回头看Flash-Next这套架构,会发现前面那些看似分散的设计,其实都在解决同一个问题。

GDN用固定规模的state压住长上下文成本;N-gram通过稀疏查表处理局部模式;QSA则进一步压缩Attention本身的计算。

它们没有一个是单纯为了让短对话更快。目标很明确是让模型能够在更长的任务里持续工作,同时不要让计算成本跟着任务长度一起失控

这也顺带解释了6B激活的定位。agent的调用是高频、批量、长尾的,推理单价直接决定这类应用能不能成立:单次调用便宜还不够,跑一整天不破产才算过关。

Highlights的最后一条:训练成本约为Qwen3.7-Plus的1/9,整体能力相当,coding与cowork场景更强。

所以Flash-Next强调的,其实不是单纯的低成本模型,而是让低成本成为Agent长时间运行的基础设施


这套架构最终要回答的,还是一个非常现实的问题:这么多改动,究竟换来了什么?

Highlights给出的答案是:训练成本约为Qwen3.7-Plus的1/9,同时整体能力相当,并在coding和cowork场景更强。

这个数字目前还需要等完整技术报告和实际训练细节进一步验证,但它至少说明了Qwen在这代架构上追求的方向。

而且,这并不是Qwen第一次把成本直接写进模型发布材料。

此前Qwen3-Next发布时,官方也曾给出过类似的效率对照:训练计算量仅为Qwen3-32B的9.3%,但Qwen3-Next-80B-A3B-Instruct的整体表现已经接近Qwen3-235B-A22B旗舰模型。

这张图就是当时的能力对比。


两次发布相隔一年,方向没有变过。容量往上堆,成本往下压,中间的差额就是架构设计赚出来的钱。

03

Qwen4已经进入

正式发布前的倒计时

8月3日,Qwen3.8-Max闭源发布;8月12日,Qwen3.8-2.4T-A95B开源;8月中旬,27B稠密版跟上;8月26日,Flash-Next亮相,直接给出了下一代Qwen4架构的预览。

短短几周,Qwen几乎是两周一个版本

如果参考Qwen3-Next从架构预览到后续正式采用的节奏,Qwen4完整家族距离正式亮相,可能已经不是遥遥无期,而是进入了以月为单位的倒计时。

而Flash-Next真正的角色,也就越来越清晰了。

它更像是Qwen4的先头部队:提前把下一代架构的成本结构、稀疏策略和N-gram外挂记忆摊到台面上,让推理框架、量化工具和开源社区先适配,让开发者先跑起来,也让用户先验证这套架构究竟能不能打。

所以,Qwen4还没有正式登场,但从Flash-Next开始,下一代Qwen已经把第一块底牌摆到了桌面上。

今晚23点,等权重真正落地,这场关于Qwen4的提前预演,才算正式开始。

关注+星标,获取AI前沿进展与开源一线动态

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
研发猛增20%!从半年报看百年药企的“第二增长曲线”

研发猛增20%!从半年报看百年药企的“第二增长曲线”

智谷趋势
2026-08-26 09:40:41
买机票时候就被盯上!又抓一人:华人女子带娃旅游归来被ICE带走,孩子公民也没用

买机票时候就被盯上!又抓一人:华人女子带娃旅游归来被ICE带走,孩子公民也没用

华人生活网
2026-08-26 04:58:10
6909份证据压顶!2279条不利材料曝光,杜特尔特11月审判还能翻身吗

6909份证据压顶!2279条不利材料曝光,杜特尔特11月审判还能翻身吗

新姐看世界
2026-08-25 16:51:45
形势到底有多严峻?上海人社局发用人单位裁员报告通知...

形势到底有多严峻?上海人社局发用人单位裁员报告通知...

慧翔百科
2026-08-26 11:34:07
抬尸堵门大结局!1万9全额返还店家,对施压家属无任何处罚

抬尸堵门大结局!1万9全额返还店家,对施压家属无任何处罚

垛垛糖
2026-08-26 11:19:58
纪委朋友酒后吐真言:被围猎的干部,基本都栽在这四个“第一次”

纪委朋友酒后吐真言:被围猎的干部,基本都栽在这四个“第一次”

荷兰豆爱健康
2026-08-25 11:59:30
尼泊尔一侧发生泥石流灾害,致西藏吉隆口岸重大人员伤亡、失联,有建筑被掩埋,武警官兵已前往现场处置

尼泊尔一侧发生泥石流灾害,致西藏吉隆口岸重大人员伤亡、失联,有建筑被掩埋,武警官兵已前往现场处置

极目新闻
2026-08-26 16:40:04
有史以来最强的厄尔尼诺进入倒计时!2026年冬天,中国将面临什么

有史以来最强的厄尔尼诺进入倒计时!2026年冬天,中国将面临什么

抽象派大师
2026-08-25 17:11:50
国家防总、应急管理部组织多部门联合会商,调度部署台风“沙德尔”防范应对工作

国家防总、应急管理部组织多部门联合会商,调度部署台风“沙德尔”防范应对工作

界面新闻
2026-08-26 13:50:06
四川省成都市委常委刘任远接受审查调查

四川省成都市委常委刘任远接受审查调查

界面新闻
2026-08-26 17:22:54
美伊已就停火达成一致?美国务卿:就目前而言预计不会对伊朗发动新打击

美伊已就停火达成一致?美国务卿:就目前而言预计不会对伊朗发动新打击

红星新闻
2026-08-26 12:58:32
五问湖南衡阳店主扶人赔付事件

五问湖南衡阳店主扶人赔付事件

极目新闻
2026-08-25 20:05:57
大结局!常州星宇批量劝退应届毕业生风波,人力资源总监被停职,网友:代价之低,令人发指

大结局!常州星宇批量劝退应届毕业生风波,人力资源总监被停职,网友:代价之低,令人发指

火山詩话
2026-08-26 10:07:43
美国中情局局长坐“环球霸王III”军用运输机访俄,谈了什么?

美国中情局局长坐“环球霸王III”军用运输机访俄,谈了什么?

红星新闻
2026-08-26 12:37:27
吴向东地域文化直播爆火,背后的深意你看懂了吗?

吴向东地域文化直播爆火,背后的深意你看懂了吗?

首条研究院
2026-08-26 14:24:16
“无期徒刑”的人老了怎么办?如果无法自理,监狱会给养老吗?

“无期徒刑”的人老了怎么办?如果无法自理,监狱会给养老吗?

史之铭
2026-08-25 17:13:34
九华山的瓜!这次真的太猛了

九华山的瓜!这次真的太猛了

美第奇效应
2026-08-25 08:05:01
许家印没想到,自己被判刑仅4天,王健林就凭一举动实现口碑暴涨

许家印没想到,自己被判刑仅4天,王健林就凭一举动实现口碑暴涨

春日在捕月
2026-08-26 00:30:31
小县城的工资开始崩塌了。

小县城的工资开始崩塌了。

老陆不老
2026-08-26 08:38:49
宇树科技上市一周市值缩水近2000亿,中签股民:幸亏开盘就全卖了

宇树科技上市一周市值缩水近2000亿,中签股民:幸亏开盘就全卖了

东方豪侠
2026-08-26 14:14:00
2026-08-26 19:12:49
智猩猩
智猩猩
AI 技术内容与服务平台
20文章数 1关注度
往期回顾 全部

科技要闻

DeepSeek被曝前七个月收入4.75亿元

头条要闻

美向全世界发警告 特朗普给多国领导人打电话一一传达

头条要闻

美向全世界发警告 特朗普给多国领导人打电话一一传达

体育要闻

兑现五年之约,含梗量最高的世界冠军诞生

娱乐要闻

包文婧当初担心包贝尔出轨,预言成真

财经要闻

兰世立回应"牛津CEO班被骗":未遇杀猪盘

汽车要闻

硬派增程SUV新选手 北汽泰钽700上市焕新价24.98万起

态度原创

教育
家居
健康
本地
公开课

教育要闻

拉分题,也是失分题,全班失分严重

家居要闻

2026建博会(广州) 公装联探展交流活动

孩子刷短视频成瘾?9大成瘾真相

本地新闻

无印良品竟是桐乡造?这座小城藏着一个刀具帝国

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版