7月27号,月之暗面把Kimi K3的模型权重开源了。
这次它还顺手把支撑K3训练和推理的三套基础设施MoonEP、FlashKDA、AgentEnv一起放了出来。
不只是把模型给你,连怎么造出来、怎么让它跑起来的整套东西都摊开了。
![]()
在此之前月之暗面已有多次开源动作,但将万亿级大模型配套核心训练框架和权重一并对外,在国内开源圈子里十分少见,等于完整公开了Kimi K3从训练到落地的整套技术实现路径。
如果你对万亿参数已经麻木了,那换个说法可能更直观。
K3的参数规模是前代K2.5的3倍,但规模化效率提升了2.5倍。用同样的算力,榨出了2.5倍的智能。
![]()
当被问到不怕技术被学走吗,他们的回答大致是:技术可以被复制,但构建技术体系的组织能力和迭代速度才是真正的护城河。
开源的是K3,真正拉开差距的是做出K4、K5的能力。
![]()
- 技术报告PDF:https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf
- Hugging Face链接:https://huggingface.co/moonshotai/Kimi-K3
01 为什么Infra是K3的隐藏王牌?
在媒体沟通会上,月之暗面副总裁黄震昕说了一段话,可以作为理解这份报告的钥匙:
- 传统大模型遵循算力、数据、参数的缩放定律,但一味堆砌算力早已遇到瓶颈。团队自研的底层技术,能让同等训练数据发挥翻倍效果,把模型训练功耗降低一半。
这种不堆卡、改架构的思路,直接体现在K3的三项开源Infra技术上。
(一)MoonEP
MoE模型的核心挑战之一,是专家并行带来的通信开销。K3拥有896个路由专家,每个Token激活16个。在如此细粒度的MoE架构下,专家之间的通信极易成为训练效率的瓶颈。
MoonEP正是为此而生。
![]()
MoonEP计算、通信与卸载重叠调度
它是一套面向大规模MoE模型的高性能专家并行通信库,核心价值在于即使在不均衡的通信场景下,仍能实现极致效率。
这意味着在万亿参数分布式训练中,跨卡通信的延迟被降到最低,GPU的算力得以充分释放。
月之暗面建议Kimi K3部署在64张以上加速卡组成的超节点环境中,这一要求本身就说明了高速互联和专家并行调度的关键性。
(二)FlashKDA
K3支持100万Token上下文窗口,这背后依赖的是Kimi Delta Attention(KDA)这一架构级创新。
KDA将传统Transformer的O(n²)复杂度降至O(n),使得长文本推理在成本上变得可行。
![]()
KDA Lower-bounded Decay对计算的影响
而FlashKDA是KDA对应的高性能计算算子(Kernel)。官方数据显示,在英伟达H20上,FlashKDA的Prefill速度相比flash-linear-attention基线提升1.72至2.22倍。
简单来说,FlashKDA让KDA的线性复杂度优势在硬件层面真正落地。它可以直接作为flash-linear-attention的替换后端,开发者可以零成本接入这一性能红利。
FlashKDA此前已开源,此次随技术报告一起,其设计思路和实现细节更加透明。
(三)AgentEnv
K3的能力不止于生成文本,更在于执行长时程Agent任务。
官方案例显示,K3在生成一份覆盖推理芯片行业42年历史的研究报告时,完成了2800多次网页搜索、1100多次终端数据调用,处理了超过1.1万页资料。
![]()
RL FLOPs扩展与各领域能力的关系
这种级别的Agent任务需要一个高保真、强隔离的沙箱环境。传统容器沙箱有个致命问题,Agent探索得太激进,会导致内核崩溃甚至死锁。K3后训练阶段要跑成千上万个Agent并行探索,环境稳定性是刚需。
AgentEnv用Firecracker微虚机提供硬件级隔离。
(1)Pause/Resume,暂停时零资源消耗,推理占沙箱98%的寿命,推理期间沙箱可以暂停。
(2)Fork,从当前状态复制新沙箱,做奖励评估时不污染原环境。
(3)Snapshot,定期保存快照,出错后快速回滚。
在K3的整个训练和评估过程中,累计创建了51,219,741个沙箱,跨越1,505,678个镜像。单个沙箱的暂停和恢复延迟分别低至133ms和49ms。
02 Infra之外的组合拳
Infra层保证了训练能跑起来,但真正决定模型能力上限的,是K3的架构设计。
![]()
Kimi K3整体架构概览
(一)混合注意力与信息流动
技术报告显示,K3采用了KDA + Gated MLA的混合结构,比例约为3:1。KDA负责高效处理长上下文,而Gated MLA能动态筛选重要信息。
同时,Attention Residuals技术以不到2%的额外成本,提升约25%的训练效率,在2.8万亿参数的训练中保障了稳定性。
![]()
GLU、SwiGLU和SiTU-GLU的标量响应对比
(二)稀疏MoE与稳定路由
K3采用Stable LatentMoE框架,896个路由专家中每个Token仅激活16个(激活比例约1.8%)。
为在高稀疏度下保持训练稳定,引入了Quantile Balancing等负载均衡机制,根据路由分数量化分位数直接分配专家,减少启发式更新及敏感超参数。
![]()
Quantile Balancing负载均衡示意图
(三)MoonViT-V2视觉编码器
K3具备原生视觉理解能力,为此专门训练了MoonViT-V2视觉编码器,采用Next-Token Prediction的自监督方式从头训练,摆脱了对对比学习预训练的依赖。
![]()
视觉编码器梯度范数对比
在训练效率上,规模化效率提升2.5倍,是架构创新、训练方法和数据配方优化共同作用的结果。
03 K3跻身全球第一梯队
K3在近20个内部评测集及多个公开基准上进行了全面评估,对比基线包括Claude Fable 5、GPT-5.6 Sol、Claude Opus 4.8、GLM-5.2等顶级闭源模型。整体定位是略逊于最强的Claude Fable 5与GPT-5.6 Sol,但稳定优于Claude Opus 4.8、GPT-5.5和GLM-5.2。
![]()
![]()
Kimi K3主要评测结果一览
真实场景下,K3连续48小时自主运行,基于开源EDA工具完成一颗nano推理芯片设计,4mm²内集成1.46M标准单元,仿真吞吐超8,700 tokens/s。
它还独立开发了类Triton编译器MiniTriton,从DSL前端到PTX代码生成的完整工具链。
![]()
MiniTriton编译器性能
在GPU内核优化任务上,K3同样展现出惊人的工程能力。 K3在AttnRes算子上的优化轨迹59.7%的加速比,远超Claude Fable 5的57.1%和GPT-5.5的30.8%。
![]()
GPU kernel 优化(AttnRes)案例研究
另一个值得关注的案例是Camera Repair Management System,一个黑盒系统复制任务。
K3以1.000 的归一化完成率,率先达到终点,Claude Opus 4.8和GPT-5.5分别只能达到0.918 和0.893。
![]()
Camera Repair Management System 完成曲线
API输出定价100元/百万Token(约$15),约为Claude Fable 5($50)的三分之一。不过实际单任务成本差距缩小,AA-Briefcase上K3平均83轮调用,耗时56分钟(约Fable 5的2.5倍)。
![]()
Score vs. 单任务推理成本对比
04 开源Infra比开源权重更有信号
本次Kimi K3开放万亿级模型权重只是表层看点,三套配套自研基础设施同步开源,才是更关键的行业信号。
算力扩张的边际效益不断衰减,月之暗面选择以架构与工程优化突破性能瓶颈KDA优化长文本计算、Quantile Balancing平衡MoE负载,再由MoonEP、FlashKDA、AgentEnv完成全链路工程落地。
市面上多数开源项目仅放出模型文件,完整训练推理底座极少对外公开。这套可完整复现万亿模型训练的工具链,降低了行业自研大模型的工程门槛。
算法与模型总有被追上的一天,可源源不断迭代底层技术、持续推出新一代模型的完整组织能力,才是难以复制的长期壁垒。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.