出品 | 网易智能
作者 | 小小
编辑 | 王凤枝
7月27日,在首秀11天后,这家中国AI初创公司将Kimi K3的完整模型权重上传至Hugging Face。
![]()
这批总规模约1.56TB的权重文件,很快在开发者社区引发关注,并在短时间内登上平台趋势榜首。不过,权重免费不等于零成本:有人指出想让这个2.8万亿参数模型跑起来,至少需要200万元硬件投入;若要提供商业API服务,门槛则在1500万元左右。
但这次交付的意义仍然远超一次普通的权重释放。
从模型权重到底层算子,从训练沙盒到一份详尽的47页技术报告,月之暗面把构建和训练K3所需的大量工程能力摆上了台面;与此同时,一份精心设计的许可证,也为这场开放划定了商业边界。
![]()
热闹的社区狂欢背后,月之暗面试图回答一个更大的问题:开放权重模型,如何在扩大生态的同时,找到可持续的商业回报?
这既是一场技术开放实验,也是一次商业模式探索。
01不是只给"鱼",连"渔具"也一并打包
对于熟悉K3首次亮相的人来说,参数规模(总参数2.8万亿,激活参数1040亿)和跑分已经不是新闻。
此次发布的真正增量,在于月之暗面选择了"给鱼又给渔"的开放策略。它不仅交付了模型权重本身,还将训练和部署这个庞大模型所需的三项核心基础设施(MoonEP、FlashKDA和AgentENV)一并开放,并附上一份47页技术报告。这在当前开放模型生态中并不常见。
![]()
首先,核心交付是完整的模型权重文件,包含K3的文本和视觉编码器(MoonViT-V2)的相关参数。拥有足够算力的团队可以自行部署并研究这一模型。
但真正让业界关注的,是随权重一同发布的技术报告。这份报告并非简单展示性能成绩,而是披露了K3从架构设计、训练策略到数据处理的一系列技术细节。
全栈开发者 @TypicalBryan735评论说,放弃注意力内核、MoE通信库和代理沙盒基础设施,同时开放权重,这才是真正推进开放模型生态的方式。
![]()
除了权重文件,月之暗面还开放了三项基础设施技术,分别解决通信、算子优化和智能体训练环境问题,对应了训练和部署超大规模混合专家模型时的几个关键瓶颈。
MoonEP瞄准的是混合专家模型训练中常见的"负载不均"问题。K3内部有896个路由专家,每处理一个token,系统只激活其中16个专家。这种设计能够扩大模型规模,同时控制实际计算量,但也带来新的挑战:不同专家的调用频率不同,可能导致部分GPU负载过高,另一部分资源闲置。
传统方案通常需要额外的数据交换和调度机制。MoonEP通过优化专家分配和通信方式,提升不同计算节点之间的负载均衡效率,减少训练过程中的通信浪费。
![]()
在训练超大规模MoE模型时,MoonEP有望提高计算资源利用率,并降低训练成本。
如果说MoonEP解决的是算力调度问题,FlashKDA则聚焦于计算效率。
Kimi Delta Attention(KDA)是K3处理百万token长上下文的重要技术之一,但其计算方式也带来了新的工程挑战。KDA具有"块内并行、块间串行"的特点:块内计算可以并发,但不同计算块之间的信息状态需要连续传递。如果按照传统方式处理,GPU会在计算和状态传递之间产生等待。
FlashKDA是月之暗面针对KDA设计的高性能算子库。它将计算过程拆分成不同流水线,让块内计算和状态传递能够更高效地并行执行。这就像厨房里,一个厨师负责炒菜,另一个厨师负责传菜,而不是同一个人炒完一道菜再端出去。
在英伟达H20芯片测试中,FlashKDA的预填充速度相比相关基线方案提升明显。更重要的是,FlashKDA已经成为相关开源项目可选的后端方案之一,它的价值并不局限于K3本身。
专注AI工具构建的开发者 @Andrii38324276指出,仅开放权重只能让开发者运行模型,而开放底层内核,才真正让社区有机会理解和改进训练效率。
![]()
第三项基础设施AgentENV,展示了K3训练中的另一个关键环节:如何为AI智能体提供稳定、可规模化的试错环境。
K3强化学习训练需要智能体在接近真实工作的环境中反复执行任务,例如读写文件、运行代码、调用工具。早期方案采用容器搭建沙盒环境,但团队发现,智能体的一些非预期操作可能导致系统崩溃,隔离能力并不足够。
于是,AgentENV采用了Firecracker microVM作为底层环境。这种轻量级虚拟机技术能够提供更强隔离能力,让智能体拥有类似独立计算环境的空间进行试错。为了支持大规模训练,AgentENV还优化了沙箱创建、暂停和恢复流程。
月之暗面披露,在K3训练和评估过程中,这套系统创建了超过5121万个沙箱,覆盖150多万个镜像。 此次开放,意味着开发者不仅可以获得一个模型,也可以参考一套经过大规模验证的智能体训练基础设施。
这三项基础设施的开放,让K3与许多只开放权重的模型有所区别。
过去,开放模型通常意味着开发者"可以使用"模型,但训练和优化模型背后的工程能力,仍然掌握在少数实验室手中。月之暗面此次交出的,不只是模型本身,还包括一部分支撑模型训练和部署的工具链。
对于开发者而言,这意味着他们获得的不只是一个可调用的模型,也是一套可以进一步研究、修改和复用的工程资源。
02开放新范式:营收挂钩许可证,在开放与商业之间走钢丝
K3的发布,也让"开放权重"和传统意义上的"开源"之间的区别再次成为焦点。
随模型权重一同发布的Kimi K3许可证,因其独特的商业限制条款,迅速成为讨论中心。
这份许可证的大部分内容接近宽松开源许可,允许用户使用、修改、分发甚至基于模型开发产品。但它附加了两个关键条件。
第一,经营模型即服务(Model as a Service)业务,且自身及关联方年营收超过2000万美元的公司,需要另行签订商业协议。
第二,如果任何商业产品或服务的月活跃用户超过1亿,或者月收入超过2000万美元,则需要在界面显著位置展示"Kimi K3"标识。
这两项限制不适用于企业内部自用,也不适用于通过月之暗面官方产品或认证合作伙伴访问模型的场景。也就是说,这套许可证主要针对的是达到一定商业规模、并直接向第三方提供模型推理或微调服务的企业。普通企业内部使用模型,或者将模型能力嵌入自身产品功能的部分场景,并不一定触发额外商业协议。
正如Interconnected Capital的Kevin Xu所指出的,这种做法让人联想到MongoDB等公司为防止云厂商直接转售其成果而采用的定制许可证。
![]()
过去,一些开源软件公司曾面临类似问题:代码开放后,云服务商可以直接基于这些成果提供商业服务,而原始开发者却难以获得对应收益。K3许可证的思路,本质上是在开放生态和商业回报之间寻找一个平衡点。
开发者对此总体持积极态度,但也有不同声音。
AI研究者内森·兰伯特(Nathan Lambert)总结道,这份许可证受到MIT许可启发,但加入了明显的商业限制。因此,从严格定义来看,它更接近"开放权重"而非传统意义上的"开源"。
X用户 @peterom则持更务实的观点。他认为,资本主义和开放生态并不一定矛盾,Kimi这种模式可能是一种新的平衡方式。他预测,未来几年可能会出现多家开放模型公司实现大规模商业收入,而"开放模型无法赚钱"的观点也会逐渐被重新审视。
![]()
不过,这条精心设计的商业边界,也让K3进入了另一个更复杂的讨论领域:监管。
出口管制专家、前拜登政府官员彼得·哈雷尔(Peter Harrell)曾分析,单纯下载和使用开放权重模型,可能被视为受保护的信息传播,美国政府直接干预的法律基础并不明确。
但K3许可证改变了一部分情况:当一个大型云服务商希望将K3模型能力作为商业服务提供时,它需要与月之暗面建立明确商业关系。 一个原本只是"下载模型"的行为,可能转变为商业交易。而商业交易,也意味着更明确的监管边界。
如果美国商务部未来依据相关规则限制某些交易,或者将月之暗面列入制裁名单,这类商业协议可能成为监管关注的对象。
这也构成了K3开放策略中的一个微妙矛盾:开放可以扩大生态,但商业化会带来新的监管关系。当月之暗面希望在保持开放属性的同时获得更多商业回报时,它需要面对一个新的平衡问题:有营收,就意味着更容易进入监管视野。
03开放了,然后呢?从200万到1500万的部署账单
如果说许可证解决的是"谁可以免费使用、谁需要付费"的商业问题,那么接下来面对的是另一个更加现实的问题:即使拿到了免费权重,K3到底有多少人真正跑得起来?
模型权重可以免费下载,但这1.56TB文件一旦落地,就立刻变成了一道昂贵的硬件门槛。
小红书博主"平凡v97"根据公开方案,对K3部署成本进行了估算,并将其分成两个层级。
第一个层级,是"让模型运行起来"。AMD此前公布的验证方案提供了一个参考:8张MI355X,每张拥有288GB显存,总显存约2.3TB。按照当前硬件价格估算,这套配置的服务器成本约为170万至240万元。如果进一步考虑服务器、散热、机房和运维成本,总投入可能超过200万元。
但这解决的只是"能运行"。
如果目标是提供商业API服务,要求会完全不同。商业部署需要考虑多用户并发、百万token上下文处理、稳定响应延迟、故障切换以及长期运行成本。
因此,月之暗面在技术文档中建议,生产环境采用64张以上加速卡组成的部署方案。按照类似硬件规模估算,商业级集群投入可能达到1400万至1900万元。
也就是说:200万元,可能让模型跑起来;1500万元左右,才接近商业化服务的起点。
![]()
也有外国网友吐槽:“你只需要每月3万5000美元的GPU预算,或一次性50万美元投资,就能避开Kimi K3的99美元/月订阅。”
![]()
不过,开放权重的意义,也正在于它允许不同玩家探索不同路径。
Ning团队展示了一套更偏极客路线的方案:80张RTX 5090消费级显卡(大概需要200万元人民币)组成10个节点,每个节点8张卡,总显存达到2.56TB。这套方案没有采用AI服务器常见的HBM高带宽显存,也没有使用NVLink、InfiniBand等高端互联设备,而是依靠消费级显卡和普通网络完成运行。
![]()
测试结果显示,K3在这套系统上实现了约20 tok/s的单流推理速度。虽然距离大型商业服务仍有差距,但它证明:一个2.8万亿参数模型,并非只能存在于少数大型数据中心。
这两条路径的并存,正是开放权重生态的价值所在。一端,是官方推荐的数百万甚至上千万元级数据中心部署;另一端,是开发者基于现有硬件不断尝试的社区方案。
开放权重并不意味着所有人都能低成本运行前沿模型。但它确实让"如何运行模型"这个问题,有了更多探索空间。
而这也进一步引出下一个问题:K3为什么能够在如此庞大的规模下,仍保持接近前沿模型的效率?
04架构红利:K3如何把规模变成效率
答案在于K3的架构设计,它在多个层面降低了单位计算的成本。
从Kimi K2到K3,模型总参数规模扩大到近3倍。月之暗面表示,新架构、训练方法和数据配方共同提升了模型的整体扩展效率,约为上一代的2.5倍。
需要注意的是,这里的"2.5倍"是月之暗面对整体扩展效率的描述,并不等同于训练速度提升2.5倍,也不是某一项技术单独带来的收益,而是多个优化共同作用后的综合结果。
这些优化主要来自KDA、Attention Residuals以及Stable LatentMoE等架构设计。
KDA:解决百万Token上下文的效率问题
长上下文一直是大模型扩展中的核心挑战。传统Transformer注意力机制的计算成本,会随着序列长度增加而快速增长。当上下文窗口扩大到百万token级别时,如何控制计算成本,就成为模型能否继续扩展的关键。
K3的核心注意力机制KDA(前文已介绍其工程实现FlashKDA)在架构层面的价值在于:它通过递归方式处理长程依赖,避免了传统注意力机制随序列长度平方级增长的计算开销。同时,K3结合Gated MLA等机制,在效率和信息保留之间进行平衡。
月之暗面表示,KDA能够显著提升百万token上下文场景下的推理效率。
Attention Residuals:让深层网络保持信息流动
传统残差连接主要负责将上一层的信息传递到下一层。但随着模型深度增加,如何避免有效信息逐渐衰减,成为大型模型训练中的重要问题。
Attention Residuals允许模型根据当前任务需要,从不同深度的表示中主动检索信息。它不再依赖固定的信息传递路径,而是让模型拥有更灵活的信息调用方式。对于深层网络而言,这有助于提高信息利用效率。
Stable LatentMoE:解决专家模型的调度难题
K3采用混合专家架构(MoE)。模型总共有896个专家,但每个token只激活其中16个。这种设计能够让模型拥有更大的参数规模,同时控制实际计算成本。
但MoE架构也带来了新的问题:如果部分专家被大量调用,对应计算资源会出现过载;而其他专家可能长期处于低利用状态。
K3采用"分位数均衡"(Quantile Balancing)方法优化专家路由。它并不是不断人工调整冷门专家权重,而是根据路由分数分布确定专家分配边界,从而减少对启发式更新规则和敏感平衡参数的依赖。
原生多模态与视觉能力
在视觉能力方面,K3采用MoonViT-V2视觉编码器。
月之暗面表示,K3没有沿用部分模型常见的视觉预训练路径,而是探索通过下一token预测任务训练视觉编码器。这种方式让模型能够在统一架构下处理文本和视觉信息。
这些架构设计最终反映在模型表现上。
在月之暗面公布的基准测试中,K3在BrowseComp等智能体任务评测中表现突出,并在AutomationBench测试中取得最高成绩。在SpreadsheetBench 2中,K3也以微弱优势领先。
在推理能力测试中,K3在GPQA Diamond中获得93.5%的成绩,与GPT-5.6 Sol的最高成绩接近。在更贴近真实软件开发任务的FrontierSWE测试中,K3取得81.2%的成绩,高于GPT-5.6 Sol公布的71.3%。
![]()
![]()
第三方评测机构Artificial Analysis的Intelligence Index显示,K3获得57.1分,进入全球前列。该榜单中,K3超过Claude Opus 4.8(max)和GPT-5.5(xhigh),排名位于Claude Fable 5和GPT-5.6 Sol之后。
需要注意的是,不同模型评测时使用的配置、工具链和测试方式并不完全一致,因此这些成绩更适合说明K3已经进入全球前沿竞争范围,而不能简单理解为全面超过所有闭源模型。
在WebDev Arena前端代码竞技场中,K3以1678分排名第一,超过Claude Fable 5。这也是目前开放权重模型在该类竞技场中取得的重要突破。
![]()
更具冲击力的是成本。K3 API价格低于部分顶级闭源模型,同时推理时只激活部分参数,并通过MoE架构、低精度量化和KDA机制降低运行成本。
一位测试者指出,在智能体工作流中,K3的表现接近Claude Fable 5,但成本显著降低。
![]()
这也是开放模型对闭源模型形成挑战的关键:它不一定首先赢在绝对能力,而可能赢在"能力、成本和可获得性"的综合平衡。
05中国开放模型的新信号:从性能竞争到生态竞争
K3的发布,已经不只是一次模型升级。
它同时展示了一个此前开放模型较少呈现的组合:接近全球前沿模型的性能、完整的工程工具链,以及明确的商业授权规则。
过去几年,中国AI公司的竞争重点更多集中在模型能力本身:谁的参数更多,谁的跑分更高,谁的价格更低。而K3此次展示出的变化在于:竞争开始从"模型能力"延伸到"围绕模型建立的生态"。
过去,开放模型通常意味着开发者可以下载权重、进行微调或者开发应用。但模型训练背后的工程能力(例如超大规模MoE训练、推理优化、智能体训练环境)往往仍然掌握在少数大型AI实验室手中。
K3此次开放的不同之处,在于它同时提供了一部分支撑模型训练和部署的基础设施:MoonEP解决MoE训练通信问题,FlashKDA提供针对KDA架构的优化实现,AgentENV提供智能体训练环境。
这些工具是否会形成长期生态,还需要时间验证。但至少,它让开发者获得的不只是一个模型,而是一套可以继续研究和改造的工程资源。
Hugging Face首席执行官Clement Delangue也注意到了社区反应。他表示,K3发布后很快登上Hugging Face趋势榜首,社区反响非常强烈。
![]()
风险投资机构Air Street的Nathan Benaich则认为,当前AI竞争环境正在发生变化。美国长期占据开放模型生态优势,而中国公司正在快速缩小差距。
![]()
不过,K3是否意味着中国开放模型生态已经完成质变,目前仍然需要更多观察。
真正的生态形成,需要开发者持续采用、第三方应用出现、工具链被广泛复用、商业模式得到验证。这些都不是一次模型发布能够立即证明的。
Kimi K3的权重现在已经公开。任何拥有足够算力的团队,都可以下载、研究和修改它。
但从下载到部署,需要数百万元级别的硬件投入;从部署到商业服务,需要稳定的基础设施和运营能力;从商业服务到规模化竞争,还需要面对许可证、市场环境以及政策因素。
这也是K3最有意思的地方:它把AI产业链中此前分散的问题,同时摆到了台面上。
模型可以开放。但算力不会免费。工程能力不会自动复制。商业价值也不会凭空产生。
月之暗面试图探索的,并不是简单回答"AI应该开源还是闭源"。它更像是在回答另一个问题:当越来越多前沿模型走向开放,创造这些模型的公司,如何在生态扩散和商业回报之间找到新的平衡?
K3给出了一个新的尝试。
但这个答案,最终仍需要市场和时间验证。
