快科技7月28日消息,日前,日月之暗面开源2.8万亿参数Kimi K3大模型,华为昇腾同步实现0day极速全链路适配。
依托Atlas系列算力硬件、MindSpeed MM训练套件、vLLM Ascend与SGLang推理引擎,完整覆盖模型训练复现、线上推理部署,为万亿级稀疏MoE大模型提供国产算力落地范式。
![]()
Kimi K3是全球首款开源3万亿参数级多模态模型,采用Stable LatentMoE架构,内置896个专家,单次仅激活16个。
搭载KDA混合线性注意力,支持100万token超长上下文,KV Cache压缩75%,长文本解码速度提升6.3倍,原生具备视觉理解能力,擅长长周期编程、深度文献分析、工程设计等复杂智能体任务,扩展效率较前代提升2.5倍。
![]()
该模型存在三大落地难点:KDA算子计算密度低、海量专家易负载失衡、2.8万亿参数带来巨大显存压力,昇腾针对痛点完成全套专项优化。
训练端依托MindSpeed MM套件,在Atlas 800 A3、Atlas 900 A3 SuperPoD完成完整训练复现,采用FSDP+EP混合多维并行,拆分专家参数解决多卡显存溢出;自研GEMM分组矩阵算子批量处理海量专家计算。
基于Triton Ascend编译框架加速线性注意力;通过ChunkLoss分块损失计算大幅降低显存峰值,同时提供一键式环境部署脚本,降低超大模型训练门槛。
![]()
推理侧支持昇腾950超节点全系列精度,原生兼容Kimi K3 MXFP4量化权重,基于vLLM Ascend、SGLang两大开源引擎落地优化。
针对KDA设计Prefill、Decode双融合算子;MC2流水线打通专家路由、跨卡通信、计算回收全流程;支持逐Token动态MXFP8量化、FlashComm1通信优化;SGLang新增DSpark投机推理,将单步生成时延压至50ms以内,完整保留原有引擎调度与接口体系,开发者无需改动业务代码即可迁移。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.