AI范儿 · 深度长文⏱ 6 分钟
01先说清楚时间线
Kimi K3 如约开源了!
当然,Kimi K3 不是今天发布的。7 月 16 日就在上海亮相了。
7 月 27 日才按承诺把 2.8 万亿参数的权重传上 HuggingFace,同时放出技术报告。
今天不是发布日,是兑现日。
中间这两周吵得很凶。
媒体把它称作又一个 DeepSeek 时刻,7 月 17 日美国半导体板块跟着跌了一波。
又有媒体说特朗普政府在重推对外国开源模型的禁令。近 200 家美国创业公司联名反对,黄仁勋公开表态说美国公司应该被允许用中国模型。
能力这块得说准确。报告摘要第二段自己就承认,整体落后 Claude Fable 5 和 GPT-5.6 Sol(第 1 页)。
![]()
但它综合排名全球第三到第四,和 Opus 4.8、GPT-5.5 同档,还在伯克利的前端编程竞技场登顶,是第一个在权威编程榜上压过所有海外闭源模型的开源模型。
够强,够便宜,权重白送。这三件事叠一起才是引爆点。
02它是个什么东西
2.78 万亿参数,是上一代的两倍多。但每次干活只叫醒其中约一千零四十亿。
它能一口气读一百万 token,差不多是一整套长篇小说的量。图和视频也能直接看,不用外挂一个识图的模块。
文字、图片、视频走的是同一套大脑,不是几个模型拼出来的。
这种养一大堆专家、每次只叫几个来干活的做法,专业上叫 MoE。
Kimi K2 与 K3 关键参数对照 指标 Kimi K2 Kimi K3 层数 61 93 总参数 1.04 万亿 2.78 万亿 每次激活参数 326 亿 1042 亿 训练上下文 12.8 万 100 万
▲ 图:两代模型的规模变化,数据来自报告第 11 页 Table 1
报告的核心叙事很明确。
这两年开源模型都在拼「让模型多想一会儿」,预训练规模却停在 1 万亿这一档上下。
底座一样大,卷的都是推理技巧,结果开源阵营内部越来越像,跟闭源头部越拉越远。
K3 的选择是两条路一起推。
![]()
▲ 图:开源旗舰模型总参数变化图,2025 年 7 月至 2026 年 7 月,K3 以 2.8T 断层第一
这句话听着抽象,看图就明白了。
过去一年,各家开源旗舰的总参数基本都挤在 1 万亿上下那条线附近。
DeepSeek 走到 1.6 万亿算是冒了个头,小米、Thinking Machines、Z.AI(智谱)、MiniMax、阿里全都在 1 万亿以下。
K3 一步跨到 2.8 万亿,把这条线抬高了将近一倍。
不过得说句公道话。图上比的是总参数,不是干活时真正用到的。这些模型每次只叫醒一小部分专家,实际的算力差距,远没有图上看着这么夸张。
03它凭什么又强又便宜?
接下来是架构部分,说句实话过于专业看不太懂,接住 AI 理解了一下,欢迎纠错~
架构上主要做了三个方面的大调整。
一,读长文章的成本被压下来了
以前上下文越长,要一直存着的东西就越多,越占显存。
K3 改成读一段记一段笔记,后面只看笔记,不回头翻原文。笔记本大小是固定的,读一万字和读一百万字占一样多。
所以它敢开一百万 token 的上下文,也敢把价格压到别人的三分之一。
二,层数加深了但信息没糊掉
层数从 61 加到 93。层一多,前面的信息往上传着传着就丢细节,这是行业老问题。
K3 让每一层都能回头去看之前任意一层,而不是只接上一层递过来的那点东西。
换来的是长任务不掉链子。成绩单里那些几百步才做得完的活儿,靠的就是这个。
三,专家养了一大堆,每次只叫几个
896 个专家,每次只叫 16 个干活。总参数 2.78 万亿,实际每次只跑一千零四十亿。
所以「参数巨大」和「跑起来便宜」这两件事,能同时成立。
报告里还有一大堆更细的改动,数值怎么稳住、专家负载怎么算、看图那部分为什么从零开始训。这些我判断不了好坏,只能照抄,就不在这儿凑数了。
能确定的是,这些加起来换来了报告反复强调的那个数字。同样的算力,能换来的能力大约是上一代的 2.5 倍。
上面这三块在报告里分别叫 Hybrid Attention、Attention Residuals 和 Stable LatentMoE,看图那部分叫 MoonViT-V2,都在第 2 章。
04力气花在工程上
报告一半以上篇幅在讲怎么训,不是讲模型。
这部分反而最有价值。
训练和评测全程,一共开了5100 多万个虚拟沙箱,跑在 150 万个镜像上(报告第 22 页)。
一个沙箱就是一台被隔离的小电脑。写代码、跑命令、搞崩了再重开。
为什么要这么多。
因为他们不是喂题目对答案,是把模型扔进真实环境里干活。
有模拟 Gmail、Notion、Slack 的长程助理任务,一次能跨好几个模拟工作日。
有只给目标不给步骤的自主执行任务。还有 GPU 代码优化任务,配了反作弊系统专抓偷懒。
撑住这套训练的,还有三样他们自己造的工具,这次一并介绍了。(在Kimi 官方公众号里)
1让上千个专家之间传数据不打架,谁忙谁闲都能把卡跑满。
2把记笔记那部分的底层代码重写了一遍,在英伟达 H20 上比通用方案快 1.72 到 2.22 倍。
3那套沙箱系统,跟 KVCache.ai 一起做的。暂停一个 133 毫秒,恢复 49 毫秒。
为什么在意那 133 毫秒。
因为模型在等自己想完的时候,沙箱最多有 98% 的时间是纯闲着的,能冻住就是省钱。
这三样在报告里分别叫 MoonEP、FlashKDA 和 AgentENV。FlashKDA 之前就开源了,另外两个随这次权重一起放出。
05成绩单
![]()
▲ 图:主要评测结果,蓝条是 K3。完整数据在报告第 27 页 Table 2
赢的地方,是写代码(ProgramBench、SWE-Marathon 第一)和替人跑腿干活(MCPMark-Verified、AutomationBench、τ³-Banking)。
联网搜索、多步查资料、调用外部工具、法律文档、文档识别,好几项拿了第一。
输的地方,是研究员级别的硬核推理,明显掉队。
HLE-Full 和 CritPt 这两项,落后 Fable 5 和 GPT-5.6 Sol 一大截。CritPt 甚至连 GPT-5.5 都不如。
长链条的办公协作(MIRA Bench 和 Agent Behavior Bench)和复杂的电脑操作(OSWorld 2.0 落后 Fable 5 将近八个点),也不如头部那两家。
最有说服力的是价格。
联网搜索榜(BrowserComp)它拿第一,每个任务约 2 美元。分数比它低的对手花两倍。最贵那家在最高档位上,报告原话是贵一个数量级。
写代码榜它比第一名低四分(Code Bench),价格是对方的 38%。档位从最高调到次高,就追平了另一个头部模型的满血成绩,成本只要三分之一。
![]()
▲ 图:横轴是每个任务花多少钱,纵轴是分数,星号是 K3。报告第 32 页
不是因为它最强,是因为它够强、够便宜、还能搬回自己家。
06安全评测这一节
找漏洞这一档,它在几十个系统里翻出数百个候选漏洞,人工复核约七成属实,其中 16 个此前没人知道。两个 Linux 内核的例子被安全专家确认了。
做成完整攻击这一档,36 道题它做出 14 道,对照的开源模型(GLM 5.2)做出 8 道。这套题估算人类专家要 540 小时。
但水分也挤干净了。
14 道里 10 道来自简单那一类,难的那类两边都有四分之三没做出来。
英美两国的官方 AI 安全机构联合评估,结论一致。
它强于其他开源模型,但离头部闭源模型仍有明显差距,41 个任务里完整打通的是 0 个(报告第 31 页)。
还有一句值得单拎出来。几家头部闭源模型会直接拒绝这类任务,根本没法对照,只能排除在测试之外。
07最后一章最好看
倒数第二章全是实际案例,比跑分更能说明模型走到哪了。
它优化底层加速代码,一个模块(AttnRes))从 283 毫秒压到 114 毫秒。
报告顺带提了一句,开发后期,一个早期版本的Kimi K3 已经在承担团队大部分的代码优化工作。
![]()
▲ 图:横轴是耗时,纵轴是提速幅度。各模型优化同一段底层代码的提速曲线,报告第 33 页
它从零写了一个编译器(MiniTriton)),测试里跑赢了业界的标准工具。还用这个自己写的编译器,从头训出来一个小模型,训练曲线跟标准框架几乎重合。
它复现了天体物理里一组普适关系。
读二十多篇论文,评估三百多个方程,挑出已发表公式里的错误,写三千多行代码。用时两小时,人类研究员通常要一到两周。
它做了一支动效讲解视频,讲的是它自己的架构。
它还设计了一颗芯片。
4 平方毫米,时序收敛到 100 兆赫兹,仿真解码吞吐超过 8700 tokens 每秒,代码已开源(报告第 33 页)。
一次48 小时的自主运行,中间没人插手。
那个编译器在报告里叫 MiniTriton,芯片那个代码库叫 nano-kpu,地址都在第 33 页。
08容易被忽略的细节
一是披露短板的密度不常见。摘要第二段就承认打不过谁,评测章节反复标注哪些榜没跑完、数据引自哪、截止到哪天。
在当下这个环境里,这种写法本身就是表态。
二是内部评测表的脚注里,老实记了对照模型的拒答和降级次数。这种信息同类报告一般不写。
![]()
▲ 图:贡献者名单的最后一行是Kimi K3。报告第 42 页
三是最后那份一千多人的贡献者名单,排到最后一行,写的是 Kimi K3。
参考资料
Kimi K3 官方博客
https://www.kimi.com/blog/kimi-k3
月之暗面开放日公告,三项工程的介绍出自这里
https://mp.weixin.qq.com/s/tryHe81IyM6nr0fBPDz72g
Kimi K3 技术报告,全文引用的页码都以这份为准
https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf
权重开出来了,你会自己部署一套吗评论区聊聊,你更看重能力、价格,还是数据不出门觉得有用 → 点个❤️在看转给还不知道的朋友点个赞 告诉我你看完了关注「AI范儿」,下次更新第一时间收到
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.