网易首页 > 网易号 > 正文 申请入驻

大模型重回参数竞赛:2万亿成标配,3万亿是下一站?

0
分享至



记者 郑晨烨

7月29日,一则关于大模型公司北京月之暗面科技有限公司(下称“月之暗面”)的融资消息在业内迅速传开——月之暗面已完成新一轮超35亿美元融资,投后估值升至350亿美元,Pre-IPO轮也已启动,投前估值达到500亿美元。

这意味着,相较2025年底C轮融资时的估值43亿美元,月之暗面在半年多的时间里估值增长超过10倍,这一速度在全球AI创业公司中也不多见。记者就上述融资信息向月之暗面方面发送了求证邮件,截至发稿未获回复。

推动这轮估值跃升的核心催化剂是月之暗面7月16日发布的旗舰模型Kimi K3,该模型的参数规模达到约2.8万亿(精确值为2.78万亿),是目前全球参数量最大的开源模型。

7月19日,月之暗面发布公告,宣布暂停C端(个人用户)新用户订阅,将全部算力投入保障已有用户的服务。7月27日晚间,月之暗面进一步公开了Kimi K3的模型权重和一份47页的技术报告,对模型架构和训练方法做了全面披露。

Kimi K3的发布只是“中国大模型集体转向大参数”的一个切面:阿里7月19日发布的旗舰模型Qwen3.8 Max,参数量约2.4万亿;百度1月上线的文心5.0,参数量同样达到2.4万亿;DeepSeek 4月发布的V4-Pro,参数量为1.6万亿。另据记者了解,MiniMax(00100.HK)下一代模型的参数量也将超过2万亿。

2025年,DeepSeek R1的发布曾让行业一度转向更小参数、更低成本的路线,“Scaling Law(规模法则,即模型性能随参数规模和算力增加而可预测地提升的经验规律)是否已经失效”成为贯穿全年的热议话题。

但仅一年之后,“参数竞赛”再次启动,中国头部大模型厂商开始集体冲击2万亿以上参数。

参数跃升

Kimi K3的参数跃升幅度在行业内并不常见。

和上一代相比,Kimi K3的总参数从1.04万亿增至2.78万亿,增长了167%;激活参数从326亿增至1042亿,增长220%;上下文窗口从128K(K 代表千)扩展至100万词元(Token,AI模型处理文本的基本计量单位),扩大了近8倍。

月之暗面团队在7月27日发布的Kimi K3技术报告中指出,过去一年,开源模型在推理阶段的强化学习上进展很快,但预训练基座的参数规模停滞在1万亿左右。

大模型的训练分为两个阶段——预训练阶段,模型在海量数据上学习语言、知识和推理模式,形成底层能力,参数规模和数据质量决定了这层能力的上限;后训练阶段,研发团队通过强化学习(用奖励信号引导模型改进推理策略)、思维链(让模型把推理过程拆解成多个步骤逐步推导)等方法,在底层能力之上做精细打磨。

过去一年,行业把主要精力放在了后训练上——DeepSeek R1证明了强化学习可以在较小参数的模型上取得很好的效果,国内外厂商纷纷跟进。但Kimi K3技术报告提出的问题是,后训练的优化空间受制于预训练基座的容量,基座的能力边界决定了后训练的上限。

早在今年3月的中关村论坛上,月之暗面创始人杨植麟就公开阐述过类似的判断。他认为,做大模型本质上是把更多的能源转化成智能,规模化绝非暴力增加算力投入,而是关于转化效率的竞赛。他在演讲中拆解了三个提升效率的维度:提升词元效率,从有限的存量数据中挖掘更多智能;优化长上下文架构,以低损耗完成长时间复杂任务;引入Agent集群(多个AI智能体并行协作)模式,通过协作扩展模型执行复杂任务的边界。

华南一家大型券商的半导体分析师告诉经济观察报,参数竞赛重启还有外部推力——2026年6月下旬起,以Claude为代表的海外头部模型开始限制国内模型对其API(应用程序编程接口)的访问,这意味着蒸馏(用大模型的输出来训练小模型)作为过去两年国内模型缩短差距的重要路径,正在变得越来越窄。

在他看来,大模型的发展可以划分为三个阶段:第一阶段从2023年初到2024年第三季度,以预训练参数竞赛为主;第二阶段从2024年下半年开始,行业转向后训练的强化学习和推理优化;2026年正在进入第三阶段,模型能力从单体智能升级为系统编排,AI开始向智能体(Agent)的形态演进。

他认为,第三阶段并没有取代前两个阶段,参数量的持续增长仍然是关键变量。中国大模型的追赶将主要依赖三条路径:训练范式与海外对齐,构建自有的数据反哺循环,持续扩大预训练基座的参数规模。

深圳一家互联网游戏企业的产品经理告诉记者,对使用者来说,参数规模的直接体感是模型“能处理复杂的任务”。

据其介绍,他所在的团队从今年年初开始把AI编程工具接入日常开发流程。在一个完整的编程任务中,模型需要读取整个项目的上下文,连续调用编译、测试、调试等工具,执行多轮自我修正,单次会话消耗的词元量是传统对话场景的很多倍。这类长程任务对模型底层能力的要求,和简单的一问一答完全不在一个量级上。

由此,“模型能连续工作多久”正在成为衡量模型能力的新指标。

规模法则

2.8万亿参数规模巨大,但Ki-mi K3的每次推理并不需要动用全部参数。

根据技术报告,Kimi K3采用了MoE架构(Mixture of Ex-perts,混合专家系统)。这种架构的核心思路是把模型参数分成多个功能模块,称为“专家”。在处理每一个输入时,路由系统只激活与当前任务最相关的一小部分专家,其余专家不参与计算。

Kimi K3拥有896个专家模块,每次推理只激活其中16个,稀疏度达到56倍,实际参与计算的激活参数约1040亿。换言之,一个2.8万亿参数的模型,单次推理的算力消耗大致相当于一个千亿参数级别的稠密模型(即每次运算都调用全部参数的传统模型)。

MoE架构解决的是“参数量大但推理成本可控”的问题。在此基础上,月之暗面还需要解决两个难题:长上下文场景下的计算开销,以及信息在深层网络中的逐层衰减。

根据Kimi K3技术报告,月之暗面分别为此开发了两项底层架构。

第一项是KDA(KimiDeltaAtten-tion,混合线性注意力机制)。传统Transformer架构(当前主流大模型普遍采用的底层技术框架)在处理长上下文时,需要维护一个缓存,这个缓存的体积随输入长度线性增长。100万词元的上下文意味着庞大的显存占用和计算开销,KDA的做法是,把这个不断膨胀的缓存压缩成固定大小的矩阵状态,使百万级上下文的计算开销大幅下降。

第二项是注意力残差(AttentionResiduals)。在传统的深层网络中,信息从底层逐层向上传递,每经过一层都会有部分信息衰减或丢失。注意力残差的做法是,让每一层都能选择性地回看前序所有层的输出,跳过逐层传递的限制。根据KimiK3技术报告,这项改进的额外成本约为2%,但显著缓解了信息在深层网络中的衰减问题。

MoE、KDA和注意力残差三项技术叠加之后,KimiK3相比K2的整体扩展效率提升了约2.5倍,即同样的算力投入下KimiK3能达到更好的模型表现。

效率的提升也直接反映在了使用成本上。

根据公开的API定价,KimiK3的输入价格为每百万词元人民币20元,输出价格为100元。折合美元计算,KimiK3的输出单价约为14美元/百万词元,低于GPT-5.6Sol的30美元和ClaudeFable5的50美元。KimiK3在第三方评测中的单任务平均成本约0.94美元,与GPT-5.6Sol基本相当,约为ClaudeOpus4.8的一半。

在“用更少的算力产出更多的智能”这个方向上,端侧模型厂商走得似乎更快一些。

面壁智能CEO李大海在接受经济观察报采访时提到了一组对照数据:面壁的端侧模型用10亿到20亿的参数量,已经达到了两年前GPT-4o(Ope-nAI于2024年发布的旗舰多模态模型,参数量在数百B级别)的水平,相当于实现了近百倍的压缩。面壁联合创始人、总裁雷升涛将这个方向称为“知识密度定律”,即大约每3.5个月端侧模型的能力密度翻一倍。

云端模型在扩大参数规模,端侧模型在压缩参数规模,底层逻辑一致,都在提升每单位算力的智能产出。

在李大海看来,云端编程、长程A-gent等场景的爆发已经开始,端侧虽然还没有迎来类似的商业爆发,但模型能力的提升一直在发生。两年前,达到GPT-4o水平需要数百亿参数量级的模型,如今面壁用10亿到20亿参数量级的端侧模型就能做到。云端在做大,端侧在做小,但驱动两者进步的底层规律是同一个——投入更多的算力和更好的架构,就能换来更强的模型能力。“没有爆发不代表没有Scal-ingLaw”,他说。

野村证券7月27日发布的研报指出,3万亿参数被行业视为中国大模型的下一个里程碑,但模型竞争力将越来越依赖架构效率、后训练优化和长程任务表现。

产业链传导

参数竞赛重启的同时,头部模型厂商的商业化也在加速。

公开信息显示,月之暗面的ARR(年度经常性收入)在6月中旬突破3亿美元,API收入占比超过七成。

月之暗面企业业务负责人黄震昕在6月的一次公开活动中提到,自今年1月KimiK2.5发布以来,Kimi海外付费用户数增长了4倍,产品进入200多个国家和地区。互联网、金融、制造、教育、医疗等行业已成为Kimi重要的企业客户来源。

KimiK3发布带来的需求激增也让算力紧缺浮出水面。公开信息显示,KimiK3的部署需要一台8卡B300服务器,训练需要万卡级集群。多位接受采访的业内人士提到,智算中心的大部分算力已被头部大厂锁定,独立模型公司获取算力的能力相对滞后,即便遇到KimiK3这样的需求爆发也难以及时补充。

李大海从端侧的角度提供了观察。他用八个字概括端侧和云端的分工关系——端侧主内,云端主外。端侧掌握用户的私有数据和即时需求,数据不出设备,负责隐私敏感的本地推理;云端接入外部世界的信息和服务,处理对模型能力要求更高的开放性任务。他认为,随着云端模型参数规模持续做大,端侧和云端协同的格局会长期共存。

上述券商半导体分析师告诉记者,国内大模型竞争已经形成两个梯队:阿里和DeepSeek在模型能力和业务覆盖上位居前列,腾讯、字节、智谱、月之暗面紧随其后。竞争焦点也正在从底层模型能力转向AgentOS(智能体操作系统,即模型之上负责任务编排、工具调用和长程执行的系统层)的综合能力。

在国内竞争格局高速变动的同时,海外市场正在成为中国头部大模型厂商争夺的另一个增量来源。

野村在前述研报中提到,DeepSeek截至6月的ARR约为5.2亿美元,其中海外市场贡献了约47%到48%。不过,采用者以个人开发者和中小团队为主,大型企业的渗透率仍然有限。而且,在实际的开发流程中,不少海外开发者已经形成了分层调用的习惯,使用ClaudeCode、Codex等海外模型做架构设计和复杂推理,再切换到DeepSeek等国产模型做持续的代码生成和执行。也就是说,国产模型率先拿下的,是词元消耗最密集的执行环节。

华东一家大型公募机构的研究员告诉记者,词元的整体成本在持续下降,预计年降幅在三成到五成。值得注意的是,Agent链路中等复杂度的任务,单次调用消耗的词元量是传统对话场景的二十多倍,超复杂任务的单次消耗达到百万词元级别。成本下降正在激发更多复杂任务的需求,整体利润由增量市场驱动。“做大参数”对算力产业链的影响也已经开始传导到芯片层面。

聆思科技是一家由科大讯飞体系孵化的端侧AI推理芯片公司,已累计出货超过1.5亿颗芯片,7月刚完成近5亿元B轮融资,首颗端侧大模型推理芯片Nebula系列计划于年底流片。

聆思科技市场副总裁韩超阳告诉经济观察报,端侧推理市场的规模未来将比云端大出不止一个数量级。他同时强调,算力利用率比绝对算力峰值更关键,一颗标称200T(每秒200万亿次运算)算力但利用率只有百分之十几的芯片,和一颗100T算力利用率达到七成的芯片,实际产出完全不同。

但当前端侧芯片在推理性能和功耗上仍无法满足需求,在他看来整个市场仍处于萌芽阶段。

聆思科技副总裁徐燕松提到,芯片公司和算法公司未来可能不再独立存在,芯片设计必须比算法迭代更前置地投入研发,“芯片的研发周期通常在两到三年,必须提前判断两三年后模型架构的走向,否则芯片推出时就已经落伍了”。

这也意味着,参数竞赛重启的影响不会停留在模型层面,它正在沿着产业链上游的芯片设计和算力基础设施传导。

在上述公募机构研究员看来,大模型向行业场景的渗透可以分为三个阶段:第一阶段是AI编程代理,对应全球约3000万软件开发者和部分外包采购市场,核心规模约7000亿美元;第二阶段是流程性AI代理,面向客服、财务、行政等约3.7亿白领办公人群,薪酬池规模超过1万亿美元;第三阶段及之后将延伸至金融、医疗、法律等专业领域,市场体量达到3万亿至4万亿美元以上。

他认为,目前仅处于第一个阶段的初期。按照上述框架来看,当前围绕AI编程场景的词元消耗量爆发,距离真正的规模化渗透还很远。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
房贷余额暴减7163亿,一场无声的楼市逃亡

房贷余额暴减7163亿,一场无声的楼市逃亡

谢晖说房
2026-08-01 21:24:32
村上春树新作,三天就被AI译出,林少华有话要说

村上春树新作,三天就被AI译出,林少华有话要说

中国新闻周刊
2026-08-02 18:42:02
LAB测试丨底盘巅峰实测,800V主动悬架到底强在哪?

LAB测试丨底盘巅峰实测,800V主动悬架到底强在哪?

Autolab
2026-07-30 19:10:01
每次发泄完,为什么你更恨那个人了?一个被科学拆穿的150年谎言 | 思想实验

每次发泄完,为什么你更恨那个人了?一个被科学拆穿的150年谎言 | 思想实验

一刻talks丨硬科技新商业
2026-08-01 19:39:41
青岛海牛危险了!德比战丢球,彭欣力教科书反越位,郑智不留情面

青岛海牛危险了!德比战丢球,彭欣力教科书反越位,郑智不留情面

奥拜尔
2026-08-02 18:49:45
硬刚小米!华为新车官宣:8月5日,正式开订!

硬刚小米!华为新车官宣:8月5日,正式开订!

科技堡垒
2026-08-02 11:15:47
乌克兰不停手,第14个“野莓”仓库被击中,损失该谁来赔偿?

乌克兰不停手,第14个“野莓”仓库被击中,损失该谁来赔偿?

山河路口
2026-08-02 18:14:16
施南生逝世20天,徐克林青霞关系紧张,叶倩文人品引争议

施南生逝世20天,徐克林青霞关系紧张,叶倩文人品引争议

舊事別提
2026-08-02 17:47:10
比亚迪员工怒斥食堂太黑心,垃圾饭菜15元,质问老板百年之后不怕下地狱吗?评论区一片吐槽!

比亚迪员工怒斥食堂太黑心,垃圾饭菜15元,质问老板百年之后不怕下地狱吗?评论区一片吐槽!

谭谈社会
2026-08-01 19:58:36
湖南双胞胎哥哥用弟弟高考成绩一路读到博士,借名买房翻脸后弟弟一封信让学历全作废

湖南双胞胎哥哥用弟弟高考成绩一路读到博士,借名买房翻脸后弟弟一封信让学历全作废

听心堂
2026-08-01 19:03:53
四周年和它的王炸超级IP宇宙

四周年和它的王炸超级IP宇宙

游娱fan
2026-07-27 22:59:10
6万难民抢滩登陆西班牙!57人惨死边境,警察看傻眼军队救场,欧洲炸锅

6万难民抢滩登陆西班牙!57人惨死边境,警察看傻眼军队救场,欧洲炸锅

可达鸭面面观
2026-08-01 14:37:27
登山公司称10人探险队全部遇难,此前中使馆证实失踪者中含1名中国公民

登山公司称10人探险队全部遇难,此前中使馆证实失踪者中含1名中国公民

澎湃新闻
2026-08-02 10:32:28
女子揭秘“饿两天定律”,体重狂掉33斤,瘦到100斤

女子揭秘“饿两天定律”,体重狂掉33斤,瘦到100斤

解说阿洎
2026-08-02 14:28:56
22岁女孩失联案最新进展:手机最后定位曝光了,这地方真不简单!

22岁女孩失联案最新进展:手机最后定位曝光了,这地方真不简单!

社会日日鲜
2026-08-02 09:01:17
天呐!华为把我投诉了!

天呐!华为把我投诉了!

麦杰逊
2026-08-01 22:29:32
彻底反转!婚外胚胎案丈夫反击,漂亮三姐正脸曝光,细节太讽刺

彻底反转!婚外胚胎案丈夫反击,漂亮三姐正脸曝光,细节太讽刺

宝哥精彩赛事
2026-08-02 09:56:38
亲人遇交通事故受伤,5次住院治疗后家属坚持出院,结果出院次日死亡,家属未做尸检便将其遗体火化,保险公司:死因不明拒赔……法院判了

亲人遇交通事故受伤,5次住院治疗后家属坚持出院,结果出院次日死亡,家属未做尸检便将其遗体火化,保险公司:死因不明拒赔……法院判了

都市快报橙柿互动
2026-08-02 12:19:17
拿下国际赛事一等奖 这对从小上央视的“双生”姐妹花相隔山海各自绽放|闪闪发光的TA

拿下国际赛事一等奖 这对从小上央视的“双生”姐妹花相隔山海各自绽放|闪闪发光的TA

封面新闻
2026-08-02 19:26:33
再往前,就打下来!菲律宾军机低飞闯黄岩岛空域,逼到四十千米

再往前,就打下来!菲律宾军机低飞闯黄岩岛空域,逼到四十千米

叶葉夜
2026-08-02 16:29:14
2026-08-02 21:40:49
经济观察报 incentive-icons
经济观察报
经济观察报是专注于财经新闻与经济分析的全国性综合财经类媒体。聚焦商道、商技和商机。
115819文章数 1607206关注度
往期回顾 全部

财经要闻

长鑫科技四万亿市值背后的资本与周期

头条要闻

女子花10万请明星带货仅卖1单 3公司"坑位费"收2600万

头条要闻

女子花10万请明星带货仅卖1单 3公司"坑位费"收2600万

体育要闻

常规赛MVP可以衡量常规赛成就吗?

娱乐要闻

徐克和多位港星送别施南生

科技要闻

零跑月销10万破纪录!比亚迪奇瑞海外卖爆

汽车要闻

历史性里程碑时刻 零跑7月交付达101267台

态度原创

房产
家居
亲子
手机
公开课

房产要闻

1700亿砸下!信息量巨大!海南甩出又一个超级规划!

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

远嫁韩国13年!暑假带6岁双胞胎回中国,抱住父母那一刻泪崩了

手机要闻

炸锅了!骁龙8E6新机起步6千起步,普通人还换得起旗舰手机吗?

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版