网易首页 > 网易号 > 正文 申请入驻

Qwen3.8-Flash正式发布

0
分享至

本篇文章转载自公众号


昨晚,我们正式发布Qwen3.8-Flash,这是一个多模态 MoE 模型,主模型参数量为125B,额外配备 51B 的 N-gram Embedding,每 token 激活 6B 参数。 它原生支持 262,144 token 上下文,并可通过 YaRN 扩展至 1M token。

Qwen3.8-Flash围绕以下四个方面对模型进行了系统升级,在提升模型能力的同时,进一步优化计算效率、模型容量和训练稳定性:

  • Attention:采用GDN + QSA Hybrid 架构。Gated DeltaNet(GDN)高效压缩历史信息;Qwen Sparse Attention(QSA)通过压缩式轻量 Indexer 在 micro-block 粒度上筛选重要上下文,显著降低长序列 Attention 开销。

  • Residual:引入 Gated Residual(GR),将 Residual Stream 扩展为 4 条分支,并通过动态 Gate 控制信息读写,增强跨层信息传递和训练稳定性。

  • Embedding:引入N-gram Embedding,利用局部上下文进行查表,以很少的额外计算扩展模型容量;Embedding Table 可以卸载到 Host Memory,并通过异步 Prefetch 与模型计算重叠。

  • Optimization:采用Muon Optimizer,围绕正交化精度、Muon 与 AdamW 的参数分工以及融合参数拆分等策略进一步优化,并针对新架构重新拟合 Scaling Law。


相比于 Qwen3.7-Plus,Qwen3.8-Flash显著降低了训练与推理成本,训练开销仅约为前者的 1/9,但在编码和办公任务上却具有更强的能力。

Qwen3.8-Flash现已上线千问AI平台,对外提供API服务,每百万Tokens输入1元,输出3元。今晚,Qwen3.8-Flash还将首发上线“千问办公”

我们同时发布了 Qwen3.8-Flash-Next的开源权重 ,Next新架构将是全新一代Qwen4系列模型的雏形。我们这次提前释出结构上的改动,以便在基于此构建 Qwen4 完整模型家族之前,先让社区对其进行检验。

模型权重将在 Hugging Face 与 ModelScope 发布,默认 1M 上下文并内置官方工具的生产版本,以Qwen3.8-Flash的形式在千问AI平台提供服务。有关 Qwen3.8-Flash-Next 架构设计、训练方法和实验分析的更多技术细节,请参阅 GitHub 仓库中的技术报告。

Qwen3.8-Flash模型体验地址

技术报告:

https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf

技术博客:

https://qwen.ai/blog?id=qwen3.8-flash-next

Hugging Face:

https://huggingface.co/Qwen/Qwen3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921FsyOPe&file=Qwen3.8-Flash-Next

ModelScope:

https://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921XAP2dV&file=Qwen3.8-Flash-Next

千问AI平台:

https://www.qianwenai.com/models/qwen3.8-flash

模型表现

纯文本


多模态


模型结构


01

Attention:

GDN + QSA,高效记忆与精准检索

传统的全局注意力(Full Attention)机制虽然能让模型直接访问所有历史信息,但随着上下文变长,其计算量和键值缓存(KV Cache)的访存成本会急剧上升,成为明显的性能瓶颈。

延续 Qwen3.5 的架构设计,Qwen3.8-Flash采用GDN + AttentionHybrid架构:在每四个网络层中,有三层使用Gated DeltaNet(GDN),负责将历史信息持续压缩并存储在一个固定大小的循环状态中;剩下的一层则保留全局Attention,负责对全局信息进行精确检索。

针对这层全局 Attention,我们进一步引入Qwen Sparse Attention(QSA)。Sparse Attention的核心思路是只关注重要的上下文,从而减少长序列的计算量。然而,现有的方案(如 DSA)通常仍需要一个 token 级别的indexer来定位重要位置;随着上下文不断增长,这个 indexer 本身的计算开销也会逐渐变成不可忽略的负担。

QSA 将这一过程进一步的优化与压缩:它使用轻量级的 indexer 先把序列聚合成micro-block,在 block 级别上估计上下文重要性,然后再选出最相关的区域执行 Attention计算。这种做法不仅减少了实际 Attention 的计算量,还大幅降低了“寻找重要上下文”本身的 indexing 成本。此外,与那些跨层共享索引的方案不同,QSA 在每一层内部独立完成序列压缩,对跨层 Attention 相似性的依赖更小,因此完美契合 GDN 与 Attention 交替出现的 Hybrid 架构。


可以简单理解为:GDN 负责高效“记住”,QSA 负责精准“查找”。

在实际性能表现上,面对 1M token 的超长上下文,QSA 的 Attention Kernel 在 Prefill 和 Decode 阶段分别实现最高7.6×4.9×的加速。在贴近线上高缓存复用场景的实验设定下(Prefix Cache 命中率为90%),Qwen3.8-Flash 在1M 上下文下的 Prefill 吞吐达到 Qwen3.7-Plus 的8.6 倍


02

Gated Residual:

给信息更多传递路径

在传统的 Transformer 架构中,所有网络层都共享同一条Residual Stream来进行信息的读写。随着网络层数的加深,早期特征不断与后续信息混合,重要信息更容易被逐渐稀释。

为了解决这个问题,我们引入了Gated Residual(GR) 机制。它巧妙地融合了两种前沿思路:一方面借鉴了Hyper-Connection将residual stream扩展为多分支的设计;另一方面,又将GatedNorm的逐元素动态门控融入 residual read。通过这种结合,原本单一的residual stream被扩展成了 4 条并行的分支。这使得模型能够根据当前的输入内容,动态且精细地决定从各个分支中读取多少信息,以及向各个分支中写入多少信息。

通俗来讲,可以把它理解为把一条信息通道扩展成多条车道:有些分支负责局部信息传递,有些则可以把早期信息直接保留到很深的网络层。实际分析中也观察到,其中一条branch会自然形成连接第一层 Attention 和大部分中后层的长距离通道。

此外,GR 还对 Hyper-Connection 进行了进一步简化。当信息的读取和写入已经足够灵活时,额外的 branch mixing 操作并不能带来明显的收益,因此可以直接将其省略。同时,归一化后的 Gate 能够有效抑制activation outlier,从而显著提升模型训练的稳定性。Residual State还支持使用 FP8进行存储,这进一步大幅降低了系统的访存开销。

03

N-gram Embedding:

低成本扩展模型容量

受到 Gemma 3n 中 Per-Layer Embedding 和 DeepSeek Engram等工作的启发,我们进一步引入N-gram Embedding,从 Transformer 参数之外的维度扩展模型容量。

普通 Embedding 根据单个 token 查表;N-gram Embedding 则结合当前 token 与前几个 token 组成的局部上下文进行查表,这种方式能够为模型中常见的短语搭配和局部语言模式提供更加丰富和精准的额外表示。

它的核心优势是:可以增加大量参数,同时几乎不增加每个 token 的计算量。

Qwen3.8-Flash 额外引入了51B N-gram Embedding 参数。由于查询位置可以提前确定,这些参数可以存放在 Host Memory 中,通过异步 Prefetch 与模型计算重叠,无需长期占用 GPU 显存。

最终,模型只在前部使用一层 N-gram Embedding,以较低的额外成本增加了一个大规模的 “局部模式记忆库”。

04

Optimization:

架构和优化协同设计

Qwen3.8-Flash 使用 Muon Optimizer训练,并围绕三个关键问题进一步优化 Muon 在大模型训练中的使用方式:正交化精度、Muon 与 AdamW 的参数分工,以及融合参数矩阵的拆分

对于真正作为二维线性映射的参数,例如 Attention、GDN 和 MoE Expert 中的主要权重,我们使用 Muon;Embedding、MoE Router、GR 低秩参数等则继续使用 AdamW。对于工程实现中融合存储的 QKV、SwiGLU 和 GDN Projection,则先按照实际对应的独立线性变换进行拆分,再分别执行正交化。

针对新的模型结构和 Optimizer,我们重新拟合了 Scaling Law。结果显示,模型可以稳定使用更大的 Learning Rate 和 Batch Size,进一步提升收敛效率和大规模并行训练吞吐。

实验还发现,过去大模型训练中常见的Batch Size Warmup 已经不再必要:从小批次 Batch 逐渐增加到目标 Batch 并没有改善最终效果,反而需要额外执行 18.8% 的optimizer steps。因此,在最终训练配置中,我们直接从目标 Batch Size 开始训练。

其它架构优化

此外,其余组件沿用 Qwen3-Next 所确立、并在 Qwen3.5–Qwen3.8 系列中不断打磨的设计。

  • 极致稀疏 MoE:在全局负载均衡下,固定激活专家数量而持续增加专家总参数量,可稳定降低训练 loss。因此 Qwen3.8-Flash-Next 采用较大的专家池,每 token 只路由少量专家,并配合一个共享专家。

  • Multi-Token Prediction:MTP 模块以多步方式训练,保持训练与推理之间的一致性,从而提升实用场景下speculative decoding的接受率,同时也提升主干本身的性能。其中的全注意力层同样被替换为 QSA。

  • 训练稳定性:保留 Zero-Centered RMSNorm 并对 norm weight 施加 weight decay、注意力输出门控机制,以及 MoE router参数初始化的归一化。这些设计使小规模消融结果更为可靠,也有助于大规模训练平稳进行。

Base模型表现

我们将 Qwen3.8-Flash-Next-Base 与 Qwen3.8-27B 及 Qwen3.7-Plus 的 base 模型进行比较。


在 6B 激活参数下,Qwen3.8-Flash-Next-Base 在 14 个 benchmark 中的8 个上取得最优结果,包括 MMLU-Pro、SuperGPQA、BBH、SWEBench-Pretrain、MGSM 与 MMMLU;在 MMLU、MMLU-Redux、GPQA、MATH 与 MultiPL-E 上与 Qwen3.7-Plus-Base 接近。其中 51B 的 N-gram embedding 参数是确定性寻址的,不进入每 token 的矩阵乘预算。

总结

Qwen3.8-Flash-Next 在 Qwen3-Next 所引入的混合架构之上,沿 Attention、Residual、Embedding 与 Optimization 四个方向作了扩展。

QSA在每一层内部将序列压缩为 micro-block,在保持精确检索能力的同时,降低了长上下文下的注意力开销与 indexing 开销。

Gated Residual将残差流扩展为多条并行分支,并以逐元素的动态门控控制读写,在算术开销可忽略的前提下改善跨层信息传递与训练稳定性;残差状态还可以保存为 FP8,进一步降低访存量。

N-gram Embedding以确定性寻址的查表记忆扩展容量,可以在几乎不增加每 token 计算的前提下扩展,并卸载到 host memory。

优化方面,Muon 作为主优化器使用,其中正交化精度、参数分工与融合矩阵拆分是决定性的实现选择,我们也针对新架构重新拟合了 Scaling Law。

和此前发布 Qwen3-Next 时一样,这一次我们仍然选择提前开放这些权重,希望社区能够对这一全新的架构进行测验。我们也将继续对其进行完善,并逐步向 Qwen4 演进。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
佩斯科夫指责欧洲直接参与战争并对抗莫斯科,强调愿意重建与欧洲的关系

佩斯科夫指责欧洲直接参与战争并对抗莫斯科,强调愿意重建与欧洲的关系

山河路口
2026-08-30 20:54:28
大马丁不是救世主!官宣日首秀丢球,蓝军18场英超连续丢球

大马丁不是救世主!官宣日首秀丢球,蓝军18场英超连续丢球

奥拜尔
2026-08-30 21:43:52
昆汀称它“可能是我最喜欢的战争片”,3小时片长却节奏紧凑

昆汀称它“可能是我最喜欢的战争片”,3小时片长却节奏紧凑

时光慢旅人
2026-08-29 09:02:13
特朗普把台湾标了价!特朗普终于把话挑明了:那批140亿美元的对台军售,"是个很好的谈判筹码"

特朗普把台湾标了价!特朗普终于把话挑明了:那批140亿美元的对台军售,"是个很好的谈判筹码"

扶苏聊历史
2026-08-26 16:58:22
演员高露:隐婚14年生下一双儿女,携15岁女儿共同出演《六姊妹》

演员高露:隐婚14年生下一双儿女,携15岁女儿共同出演《六姊妹》

仙味少女心
2026-08-29 18:42:35
CBA猛料!北京男篮基本签约丁威迪,广东续约萨姆纳,山东签约斯图尔曼

CBA猛料!北京男篮基本签约丁威迪,广东续约萨姆纳,山东签约斯图尔曼

中国篮坛快讯
2026-08-29 19:20:48
妻子陪初恋去国外出差后怀孕,回家时我让她先看看客厅新挂的照片

妻子陪初恋去国外出差后怀孕,回家时我让她先看看客厅新挂的照片

千秋文化
2026-08-25 20:42:56
没中国市场后,大量鲜果烂地没人问,开始后悔得罪中国?迟了!

没中国市场后,大量鲜果烂地没人问,开始后悔得罪中国?迟了!

小虎新车推荐员
2026-08-28 04:22:02
美媒急劝特朗普收手:围困不了伊朗,敢动中国,下场是再次惨败

美媒急劝特朗普收手:围困不了伊朗,敢动中国,下场是再次惨败

小聪明说科普
2026-08-29 12:45:41
11岁儿子被泥石流卷走,妈妈毫不犹豫下车去救,8天后从水库捞出

11岁儿子被泥石流卷走,妈妈毫不犹豫下车去救,8天后从水库捞出

丫头舫
2026-07-07 16:16:20
意外发现“饿两天定律”,体重从138斤降到108斤,稳稳瘦下30斤

意外发现“饿两天定律”,体重从138斤降到108斤,稳稳瘦下30斤

解说阿洎
2026-08-19 00:01:42
2026中国足协杯第6轮山东泰山主场迎战上海海港的比赛预告海报

2026中国足协杯第6轮山东泰山主场迎战上海海港的比赛预告海报

林子说事
2026-08-30 17:54:49
加提蓬看中国女排:未来最可怕的非庄宇珊,而是王奥芊等3人

加提蓬看中国女排:未来最可怕的非庄宇珊,而是王奥芊等3人

林子说事
2026-08-30 07:56:04
中国女排升亚洲第一良机!3-1泰国即可,夺冠、奥运资格一举多得

中国女排升亚洲第一良机!3-1泰国即可,夺冠、奥运资格一举多得

乒烧泳球
2026-08-29 23:06:36
一条街的生意,被一个贪婪的房东和一根筋的老板,同时毁了。

一条街的生意,被一个贪婪的房东和一根筋的老板,同时毁了。

放开他让wo来
2026-08-10 21:01:36
吉隆一村民想冲进灾区寻亲 被拦下后崩溃痛哭

吉隆一村民想冲进灾区寻亲 被拦下后崩溃痛哭

看看新闻Knews
2026-08-29 22:27:53
筱梅晒儿时和爷爷来北京照!从小美到大,小宝和妈妈儿时一模一样

筱梅晒儿时和爷爷来北京照!从小美到大,小宝和妈妈儿时一模一样

无处遁形
2026-08-30 18:11:10
尼泊尔红十字会官员:2015年地震失去女儿,此次洪水失去家园,连地基都没了

尼泊尔红十字会官员:2015年地震失去女儿,此次洪水失去家园,连地基都没了

红星新闻
2026-08-30 19:19:08
断尾之后再折翼!乌军击中第二架俄军Tu-95MS战略轰炸机

断尾之后再折翼!乌军击中第二架俄军Tu-95MS战略轰炸机

军迷战情室
2026-08-29 01:08:04
同样是装备精良的部队,为何74师被全歼,11师却能重创华野,结局为何截然不同?

同样是装备精良的部队,为何74师被全歼,11师却能重创华野,结局为何截然不同?

明月清风阁
2026-08-28 17:15:10
2026-08-30 22:12:49
阿里研究院 incentive-icons
阿里研究院
推动商业互联网化
1969文章数 2182关注度
往期回顾 全部

科技要闻

OpenClaw:红过,爱过,散了

头条要闻

男子手碰女子包被冤枉摸臀 监控还清白后女子反怨店长

头条要闻

男子手碰女子包被冤枉摸臀 监控还清白后女子反怨店长

体育要闻

梅西登顶美职联射手榜 任意球双响+1v3炫技

娱乐要闻

梅艳芳母亲覃美金离世,享年102岁

财经要闻

纪念币骗局触碰法律红线!专坑老人!

汽车要闻

巨幕长联屏/天神之眼/云辇-C 方程豹钛9将于四季度上市

态度原创

艺术
教育
手机
本地
公开课

艺术要闻

吴冠中 印尼行带回的热带红,值1150万!

教育要闻

【一周连连看】招录规模收缩,公考三巨头收入“降温”

手机要闻

苹果Siri功能跳票赔17亿 部分iPhone用户能申请现金赔偿

本地新闻

昆明的雨,解锁汪曾祺的浪漫雨季

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版