今天,Kimi K3正式开源了,包括模型权重、技术报告、大模型Infra技术:MoonEP、FlashKDA和AgentEnv等等,下面我带大家来拆解这些代表了当今一流模型水平的硬核技术。
Kimi K3的模型权重已经开放下载,无论是拿来做内部研发,还是直接嵌入终端用户的产品里,都可以自由使用。这种开放程度,在2万亿级别参数模型里,是头一回,Kimi引领了新一轮开源模型的技术发展。另外要说明一下,这三项Infra技术里,FlashKDA之前就已经开源过了,这次是MoonEP和AgentEnv正式加入开源阵营,等于把训练链路上通信、算子、沙箱环境这三块关键拼图一次性补齐了。
首先是模型参数,2.8万亿参数,是K2.5的三倍。什么意思呢?就是同样的算力,能够多产生2.5倍的智能。放在算力紧张的大环境下,这个技术是非常有现实意义的。这背后的支撑是Kimi Delta Attention、Attention Residuals等工程技术的创新。另外K3还具备原生视觉理解能力,并且把上下文窗口拉到了100万token,这个长度足以把数十万字的技术手册整个塞进去还有余量,对处理长文档、长代码库这类场景来说是实打实的刚需。
从技术细节来看,KDA和Gated MLA按3比1混合,专门为了搞定长上下文,还加了块级注意力残差让信息在层与层之间流动更顺畅。相当于给模型装了一条快速通道,减少信息在传递过程中的损耗。
MoE的部分,896个专家里每次只激活16个,稀疏度拉到极致但训练效果稳定。这种“广撒网精准捞”的思路,其实是在效率和效果之间找了个巧妙的平衡点。能在这么高的稀疏度下还稳得住,靠的是SiTU-GLU和Quantile Balancing这两项细节技术在背后撑着,简单理解就是既管住了激活函数的表现,又管住了专家负载的均衡,避免了大规模MoE训练里最常见的,某几个专家累死、大部分专家闲死的问题。
视觉编码器MoonViT-V2,用next-token prediction从零训练,不用对比学习那套流程,效果还能对齐SigLIP基线。这算是给视觉训练提供了一条新路子,少了预训练依赖,流程更干净,优化过程也更稳定,某种程度上也是在给视觉模型是否非要走对比学习,这个问题交出一份答卷。
后训练方面也有不少创新,技术报告里提到,团队在通用推理、通用Agent、编程Agent这三大方向上做了大规模的任务合成,还专门搭了一套支持百万token上下文的强化学习基建,最后拿近20个内部评测集做了完整评估。相当于把:能力怎么练出来、以及练得好不好怎么验证,这两件事都交代清楚了,比单纯秀跑分要实在得多。
Infra层面,MoonEP解决的是超大MoE场景下专家并行通信不均衡的问题,FlashKDA是自研的高性能算子,直接换掉flash-linear-attention能提速两倍左右,AgentEnv则是团队与KVCache.ai合作打造的沙箱系统,支持快照恢复和分叉,方便大规模并行跑Agent任务。对做训练的团队来说,这几件东西基本可以直接上手可用,省去不少重复造轮子的成本。
个人认为,K3开源意义重大,尤其是在中美AI竞争的大背景之下。不仅体现了Kimi硬核的技术实力,也让世界看到中国AI公司的格局。官方在发布里也提到了自己的价值观:开放权重能降低获取智能的门槛,推动创新,还能让用户对数据有更大的控制权、隐私保护和所有权。对于AGI这种影响深远的技术,一个足够开放的生态系统,可能真的比封闭模型更符合时代要求。
期待更多开发者能在K3的基础上构建千行百业的应用,共同谱写属于中国AI的华丽乐章。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.