8月13日,阿里巴巴开源总参数 2.4 万亿、激活参数 95B 的 Qwen3.8-2.4T-A95B,首次将 Qwen-Max 级别能力向开发者全面开放。
同日,众智 FlagOS 社区完成 Day 0 多芯片适配,包括清微智能、英伟达、摩尔线程、华为昇腾、昆仑芯在内的 9 款 AI 芯片,同步获得 BF16、FP8、INT8 等多种精度的开箱即用推理方案。
作为可重构数据流架构代表企业,清微智能是其中唯一全部算子通过 FlagGems 原生实现、完全不依赖 CUDA 算子路径的芯片厂商。
这一事实传递的信号很清晰:在 2.4T 级超大规模 MoE 推理上,可重构架构已经具备与 GPU 同台竞技的软件生态基础。
01.
可重构架构+RAISA
如何承载 2.4T MoE
Qwen3.8-2.4主体结构较Qwen3.5/Qwen3.6 变化不大,真正的挑战来自规模:参数量较 Qwen3.5-397B 提升 6 倍,显存、带宽与系统优化压力同步陡增。
清微智能之所以能快速完成适配,根源在于硬件与软件栈的深度协同——芯片层提供可重构计算能力,软件层通过 RAISA 软件栈承接模型迁移与优化。
目前,清微自研的RAISA 软件栈全面兼容 vLLM、SGLang、Transformers 等主流推理框架,覆盖近千个FlagGems算子和原生算子,模型迁移几乎零门槛。
通过 FlagGems 算子库与 FlagTree 编译器,基于 Triton 编写的算子可直接编译为清微可重构指令,让可重构芯片与 GPU 运行在同一套推理软件栈上。
RAISA 分层架构在三个维度上支撑了可重构芯片的工程化落地:
易用性
深度兼容 Triton生态算子,已累计完成 DeepSeek、Qwen 、混元系列等 200 余个大模型的适配验证,开发者上手成本极低。
可编程性
支持 C/C++ 与 Triton 语言进行定制化算子开发,开发者无需关注底层硬件细节,即可高效实现业务逻辑移植。
性能最大化
编译器全局优化有效隐藏通信与访存延迟,智算集群实测大模型硬件利用率达到行业领先水平。
此次,面对 2.4T 参数的显存与带宽压力,FlagOS 新增统一 INT8 量化支持。FlagOS-Compressor 工具链打通 FP8/BF16 原生权重到 INT8 的压缩路径,FlagGems 同步新增 scaled_int8_quant、triton_scaled_mm 等 INT8 量化推理算子。
对清微而言,W8A8方案将权重和激活从 BF16 压至 INT8,显存占用与访存压力大幅下降,实现3台服务器即可完成 2.4T 模型推理。
在此基础上,清微再围绕量化后的权重规模、单卡显存、卡数、带宽及并行通信方案做全栈优化,确保可重构芯片部署 2.4T 模型时兼顾稳定性、推理速度与能耗效率。
这一路径还回应了一个现实问题:当前,70% 以上的存量 AI 算力并不支持 FP8,INT8 量化与系统优化为存量算力争取了时间,也为国产算力投资提供了可持续的回报路径。
02.
发布即适配
从工程积累到生态验证
这种“发布即适配”的能力,背后是清微智能长期工程积累与 FlagOS 社区规模化验证的自然结果。
目前,RAISA软件栈已覆盖通用语言、多模态、OCR、机器翻译等场景;从 DeepSeek-V4、Hy3 、MiniCPM5-2B,以及本次的Qwen3.8-2.4T,清微均在模型发布当天完成适配与推理部署验证。
FlagOS 社区的规模化趋势同样清晰:自今年 2 月完成 MiniCPM4.5-o 多芯片 Day-0 适配以来,6 个月内已完成来自 7 大头部模型团队、12 款主流开源模型、覆盖 10 款芯片的跨芯 Day 0 适配。
此次Qwen3.8-2.4T 适配,其意义已不止于一款模型落地。它表明,基于 FlagOS 统一软件栈的跨芯适配模式,已从 GPGPU 阵营延伸到可重构数据流这类非GPGPU阵营:硬件适配不再需要“M×N”的逐对组合,而是简化为“M+N”的一次接入。
可重构数据流与GPGPU架构共享同一套推理软件栈,为AI产业打开了异构算力真正走向协同互补的全新空间。
![]()
03.
Qwen3.8-2.4T-A95B
模型介绍
Qwen3.8-2.4T-A95B 是阿里巴巴开源模型系列中规模最大、能力最强的一代,首次将 Qwen-Max 级别模型开放出来,其核心特性为:
● 超大规模 MoE 架构,总参数 2.4T,激活参数 95B,纯文本模型
● 编程、专业工作、科研、长程智能体任务显著提升;支持 reasoning_effort 调节推理深度,preserve_thinking 保留历史推理
●原生 262,144 tokens,可扩展至 1,010,000;提供 BF16 / FP8 权重,兼容 vLLM、SGLang、TokenSpeed 等
Coding Agent 基准测试:
● Terminal Bench 2.1:74.5 → 86.6
● SWE-bench Pro:60.6 → 67.7(接近 Opus 4.8 的 69.2)
● PaperBench:64.8 → 93.0(超过 Opus 4.8 的 80.3)
清微智能 INT8 版本已上线 FlagRelease,开箱即用:
●魔搭:https://modelscope.cn/models/FlagRelease/Qwen3.8-2.4T-A95B-INT8-tsingmicro-FlagOS
●HuggingFace:https://huggingface.co/FlagRelease/Qwen3.8-2.4T-A95B-INT8-tsingmicro-FlagOS
1
2
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.