IT时代网8月26日消息,阿里通义千问团队今晚正式推出 Qwen3.8-Flash,同步放出了 Qwen3.8-Flash-Next 的开源权重。Next 新架构被视作全新一代 Qwen4 系列模型的雏形。
这是一个多模态 MoE 模型,主模型参数达到 125B,额外配备 51B 的 N-gram Embedding,每个 token 激活约 6B 参数。它原生支持 262144 tokens 的上下文,借助 YaRN 还能扩展到 1M tokens。
据介绍,新模型在四个方向做了系统升级。注意力部分采用 GDN 与 QSA 混合架构:GDN 负责高效压缩历史信息,QSA 则通过轻量 Indexer 在 micro-block 粒度筛选重要上下文。面对百万级超长上下文,QSA 的注意力内核在 Prefill 与 Decode 阶段分别带来最高 7.6 倍和 4.9 倍的加速。
残差部分引入 Gated Residual 机制,把残差流扩展为四条并行分支,用动态 Gate 控制信息读写,残差状态支持 FP8 存储,大幅降低访存开销。Embedding 部分引入 51B 参数的 N-gram Embedding,参数可卸载到 Host Memory,通过异步预取与计算重叠,不长期占用显存。优化环节则用上 Muon Optimizer,并重拟合了 Scaling Law。
成本与性能上,相比 Qwen3.7-Plus,Qwen3.8-Flash 的训练成本大约只有前者的九分之一,编码与办公任务却更强。在 6B 激活参数下,Qwen3.8-Flash-Next-Base 在 14 个基准里的 8 个拿到最优,覆盖 MMLU-Pro、SuperGPQA、BBH、SWEBench-Pretrain、MGSM 与 MMMU。
官方透露,Qwen3.8-Flash 即将上线千问 AI 平台提供 API 服务,定价为每百万 tokens 输入 1 元、输出 3 元。模型权重已于北京时间 8 月 26 日 23:00 在 Hugging Face 与 ModelScope 开源,同步放出 FP8 量化版本。Qwen3.8-Flash-Next 默认支持 1M 上下文,并内置官方工具。
![]()
注:本文综合自IT之家等,文中包含AI辅助创作的内容。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.