网易首页 > 网易号 > 正文 申请入驻

阿里、字节、DeepSeek豪赌10万亿参数模型:一场停不下来的烧钱游戏

0
分享至



来源| Tech星球

| 任雪芸

9月22日的云栖大会上,阿里重新将大模型的“大参数”路线摆上台面。

阿里CEO吴泳铭现场披露,阿里正准备训练参数规模介于5万亿至10万亿之间的新一代人工智能模型。

随后,阿里ATH事业群Token Foundry Qwen LLM项目负责人刘大一恒也在现场提到,Scaling(缩放定律)是迈向超级人工智能(ASI)的关键路径,未来Qwen4.5、Qwen5的参数规模计划迈向5万亿到10万亿。

同一天,另一则消息在行业流传:据The Information报道,DeepSeek目前正在训练一个约2万亿参数的新模型;DeepSeek创始人梁文锋还在近期一场投资者会议上表示,公司下一步计划继续把模型推到8万亿参数。

时间再往前推两个月,8月,英国《金融时报》援引知情人士称,字节跳动正在训练一个最高可达10万亿参数的大模型。

参数,可以通俗理解为大模型的“脑容量”,即模型推理计算时调用的经验权重总量。那10万亿是什么概念?对比2025 年引爆行业的DeepSeek-R1,其当时的参数量仅6710亿,不足10万亿的十五分之一。

从阿里到DeepSeek,再到字节,国产大模型公司集体重拾参数“越大越好”的信仰。

但规模竞赛的另一面:参数越大,投入的资源和成本就越高,而智能并不会同倍增长。模型扩大之后,数据必须跟着扩大,而且不只是数量,质量也得提高。当所有人都在堆参数,真正的分水岭就变成了算力效率,即单位算力能换回多少智能。

阿里、DeepSeek、字节下场豪赌10万亿参数

在已发布的模型里,国产阵营的顶点是月之暗面7月推出的Kimi K3,总参数2.8万亿,是全球首个开源的3万亿级别模型。阿里当前旗舰Qwen 3.8-Max约2.4万亿,DeepSeek现役V4-Pro为1.6万亿。

如果将视线转到海外,闭源阵营的参数规模更高。业内估计,Anthropic的Mythos 5约8万亿参数,Fable 5约5万亿。

也就是说,国产已发布模型的参数顶点,距离海外估计的头部水平,还差着一到两倍的身位。而若以10万亿为靶心,各家现役旗舰普遍还要再放大约5倍。

那么问题来了,参数越大,真的越好吗?

支撑“越大越好”这个观点的逻辑指向Scaling Law(缩放定律),指的是在模型、数据、算力三者同步放大时,模型能力会随之提升。

过去几年,从千亿到万亿,每一次参数跃升,都伴随着能力肉眼可见的跳跃。理论上来讲,参数越大的确意味着性能越高。

而这也是刘大一恒把Scaling说成是阿里实现ASI关键路径的底气。

但Scaling Law并不是无限有效的。它需要有前提保证,在参数变大的同时,数据量和算力也得同比例跟上,而且是“高质量数据”。

到了万亿级别,单纯堆参数,边际回报明显递减。所以,从现实角度来看,一个所谓的10万亿参数的模型,如果喂不进等量的高质量语料,能力不会同倍提升。

还存在的变量是,数据、训练方法、架构,以及推理时的算法。

比如Kimi K3总参数2.8万亿,但用了MoE(混合专家)架构,896个专家每次只激活16个,实际激活参数仅约1040亿。也就是说,名义上是2.8万亿,真正干活时动用的远没有这么多。

放到实际使用中,参数大也不等于“好用”。

一方面,模型越大,推理越慢,用户等待的时间肉眼可见地拉长。另一方面,推理成本随之水涨船高,最终会转嫁到价格上,即便只是几千亿乃至两三万亿参数的旗舰模型,用户的实际使用成本也已经相当高。

所以绕开“好不好用”,回到竞赛本身:参数规模决定的是能力上限,而上限决定排位。

这正是阿里、字节、DeepSeek明知边际递减、成本高企,仍要冲向5万亿到10万亿的原因,大参数争的不是当下体验,而是下一代模型的入场券。

10万亿的账单:大模型烧钱,谁扛得住?

超级模型固然能触碰更高的智能,但更大的底座,意味着更多的训练与部署资源。大模型烧钱,已是各家大厂心照不宣的共识。

海外,微软、谷歌、Meta、亚马逊四家的资本开支,2026年指引已飙至约7200亿—7450亿美元。

国内市场同样激进:阿里2026年Q2单季资本开支677亿元,同比大增75%,自由现金流由正 738 亿元骤转为负466亿元;字节2026年资本开支上限最高可达700亿美元,约为上一年三倍,2027年还可能再冲1000亿美元。

钱花在哪?最直接的一笔,是基础设施。

OpenAI训练GPT-4时,算力需求以千亿Token计,成千上万张GPU要在高速互联的集群中协同运转数周乃至数月,那时GPT-4的参数量只有2万亿。

而10万亿参数的预训练,需要的GPU数量与时长还要再上数十个台阶,意味着数万张高端GPU连续跑数月,电费、集群运维、芯片采购,每一项都是天文数字。

单从数据中心的投入来看,云栖大会上,吴泳铭宣布阿里云到2032年运营的全球数据中心规模将超过20GW;高盛此前估算,阿里目前已上线容量约3—4GW。这意味着,未来六年要新增约16—17GW,规模扩大到目前的5倍以上。

参照英伟达黄仁勋曾在财报电话会中透露的信息,建设1GW算力的成本约为500亿—600亿美元 —— 按此推算,阿里未来六年新增的16—17GW,总建设投入可能达8000亿至1万亿美元量级。

其次是推理成本。模型训练完不是结束,而是开始。参数越大,每次生成回答调用的算力越多;当模型部署到千万用户的日常调用中,推理侧的电费与算力开销,往往比训练更持久、更烧钱。

还有一笔容易被忽视的隐形账单:数据。模型扩大,训练数据必须同步扩大,且不只是数量,质量也必须提高。当前行业共识是,高质量、经过精细清洗和标注的数据,比裸算力更稀缺。

三笔账单摆在面前,玩家们扛得住吗?

现金流已经给出了预警。过去5个季度,阿里自由现金流有4个季度为负。最新一个季度资本开支高达677亿元。账上约4745亿元现金及流动投资尚可托底,上月又通过港股配售募资约800亿港元用于AI基础设施。

但面对万亿美元级的算力投入,这点弹药远远不够,持续的外部融资几乎不可避免。

字节的情况如出一辙。据The Information报道,字节跳动今年上半年净利润同比下降个位数百分比,至约200亿美元。它是国内科技巨头中AI资本开支最大的公司,2025年AI相关投入达1500亿元,2026年进一步增至2000亿元。

缺口之下,字节近期完成了约300亿美元的银团贷款,规模为科技公司史上最大,部分资金预计将投入持续扩大的AI基础设施。

一场停不下来的军备竞赛:从Flash到10万亿参数

云栖大会前不到一个月,阿里刚把Qwen3.8-Flash-Next推到台前:1250亿总参数,每次推理只激活60亿,训练成本较前代砍掉近90%,API定价最低到DeepSeek-V4-Flash的三分之一。

同一天,智谱的GLM-5.3-Flash也挂上开源榜,3200亿总参数、激活180亿。

那两周,行业喊的是“成本革命”:模型竞赛的胜负手,比的是谁更省、谁更快、谁能在高频调用里把单位成本压到最低。

一个月后,云栖又把“大”字推回C位,两种打法开始共存。

从模型本身来看,Flash这类模型,优化的是“高频、实时、成本敏感”的场景,用户要的是又快又便宜,所以把激活参数压到极小。

而大参数模型,优化的则是最难、最杂、要覆盖最广的场景,要的是最硬的推理、最长的Agent链路、最广的能力覆盖。

让这两种打法能共存、甚至能来回切换的,是MoE架构(Mixture of Experts,混合专家架构),把模型拆成众多“专家”,每次推理只唤醒其中一部分。它最核心的贡献,是把总参数和实际调用参数彻底解耦,总参数可以继续膨胀,撑住能力上限;单次计算量却被按住,不随总规模同比变重。

对大模型厂商而言,MoE撬动的是成本结构本身:训练成本可控,推理按激活参数计费,等于用同一套底座,同时押注小而快与大而强两条路线。

Flash与大参数最终都在回答同一个问题,怎么让每一分钱,产出更多的智能。

不过,大参数尚且是个期许,10万亿还只是PPT上的数字。现役国产旗舰的顶点,仍是2.8万亿,等模型真落地,牌桌可能已经洗过一轮。那时10万亿不再是终点,而是新的起跑线。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
中国队或1天夺47金!乒羽冲4金 网友:日本人听中国国歌快会唱了

中国队或1天夺47金!乒羽冲4金 网友:日本人听中国国歌快会唱了

念洲
2026-09-24 06:46:54
55岁刀郎再陷争议:四川网红称自己才是真刀郎,现在是冒名顶替

55岁刀郎再陷争议:四川网红称自己才是真刀郎,现在是冒名顶替

小武侃风云
2026-09-23 15:55:55
尼克斯卫冕隐患!唐斯续约谈判陷入停滞:最多可签4年2.73亿美元

尼克斯卫冕隐患!唐斯续约谈判陷入停滞:最多可签4年2.73亿美元

罗说NBA
2026-09-24 06:06:48
斯马特炮轰湖人报价毫无诚意:很多球员打得远不如我 却拿到更好合同

斯马特炮轰湖人报价毫无诚意:很多球员打得远不如我 却拿到更好合同

罗说NBA
2026-09-24 06:11:02
五个省级政府领导班子调整:两人任省政府党组书记,两名公安厅厅长任副省长

五个省级政府领导班子调整:两人任省政府党组书记,两名公安厅厅长任副省长

上观新闻
2026-09-24 06:16:02
【中国经济向新向优向强】新质生产力成为发展重要引擎

【中国经济向新向优向强】新质生产力成为发展重要引擎

中国经济网
2026-09-24 07:36:04
导演冯小刚回应此前言论风波,坦言:“我很对不起投资方,现在这样有担当的投资方越来越少了”

导演冯小刚回应此前言论风波,坦言:“我很对不起投资方,现在这样有担当的投资方越来越少了”

韩小娱
2026-09-24 06:17:06
五常变六常?欧洲4国力挺印度入常,俄也支持扩员,中方态度明确

五常变六常?欧洲4国力挺印度入常,俄也支持扩员,中方态度明确

共工之锚
2026-09-24 00:09:47
普京终于摊牌:俄乌战争最大搅局者不是美国,而是这个跟俄罗斯斗了200年的老冤家

普京终于摊牌:俄乌战争最大搅局者不是美国,而是这个跟俄罗斯斗了200年的老冤家

z千年历史老号
2026-09-23 17:17:11
当技术兑现为销量,比亚迪迎来“三冠王”时刻

当技术兑现为销量,比亚迪迎来“三冠王”时刻

BT财经
2026-02-06 23:39:49
大批AI短剧一夜清零!无数创作者惨遭翻车:不是限流,是正式清退

大批AI短剧一夜清零!无数创作者惨遭翻车:不是限流,是正式清退

升子山的她视界
2026-09-23 23:17:18
价格太夸张了,小米正式发布 18 Pro/18 Pro Max!

价格太夸张了,小米正式发布 18 Pro/18 Pro Max!

XCiOS俱乐部
2026-09-23 20:44:19
辛迪·克劳馥与兰迪·格伯在儿子普雷斯利去世后首次现身其住所

辛迪·克劳馥与兰迪·格伯在儿子普雷斯利去世后首次现身其住所

赴一场山海啊
2026-09-24 06:43:03
不想死也不行?加拿大83岁祖母被“强制安乐死”,家属称她曾哭着明确拒绝

不想死也不行?加拿大83岁祖母被“强制安乐死”,家属称她曾哭着明确拒绝

全球吃瓜现场
2026-09-22 20:28:18
梁言顺辞去安徽省人大常委会主任职务

梁言顺辞去安徽省人大常委会主任职务

澎湃新闻
2026-09-24 00:52:03
肺癌女性中,98%从不吸烟,钟南山团队回应

肺癌女性中,98%从不吸烟,钟南山团队回应

中国新闻周刊
2026-09-23 22:12:04
冯小刚回应《抓特务》亏本,称对不起投资方,这一票房在院线算什么水平?票房失利只因网暴吗?

冯小刚回应《抓特务》亏本,称对不起投资方,这一票房在院线算什么水平?票房失利只因网暴吗?

之乎者也小鱼儿
2026-09-24 09:32:01
红果短剧掀了所有人的桌子

红果短剧掀了所有人的桌子

巨潮WAVE
2026-09-23 12:49:22
上海一餐厅9瓶矿泉水收621元,回应:明码标价且提供免费温水,餐厅以商务宴请为主,“喝白酒的基本都会点”

上海一餐厅9瓶矿泉水收621元,回应:明码标价且提供免费温水,餐厅以商务宴请为主,“喝白酒的基本都会点”

大风新闻
2026-09-23 20:01:03
狗吃了会死!北理工女助教称女性权益课程具备“巧克力属性”被紧急叫停,网友质疑其读的是80万的水硕

狗吃了会死!北理工女助教称女性权益课程具备“巧克力属性”被紧急叫停,网友质疑其读的是80万的水硕

火山詩话
2026-09-24 06:30:08
2026-09-24 10:08:49
Tech星球 incentive-icons
Tech星球
聚焦互联网前沿科技和新商业
2857文章数 26688关注度
往期回顾 全部

科技要闻

Claude在DNA里挖出新发现!大佬张锋点赞

头条要闻

外媒:特朗普接机史无前例 表现对中国领导人极大尊重

头条要闻

外媒:特朗普接机史无前例 表现对中国领导人极大尊重

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

冯小刚回应《抓特务》亏本

财经要闻

美债收益率起飞!美联储10月还要加息?

汽车要闻

补能下半场看AI 吉利智充重新定义“可持续的快”

态度原创

房产
家居
数码
亲子
旅游

房产要闻

楼市变天!三亚第一个"接住"新政的楼盘出现了

家居要闻

2026建博会(广州) 公装联探展交流活动

数码要闻

英特尔Nova Lake-S藏不住了!LGA 1954插槽零件提前偷跑:售价108元

亲子要闻

妈妈“游戏魔法”:让害怕打针的小女孩打针不哭啦

旅游要闻

中秋国庆游海南,入岛轮渡消费券来了

无障碍浏览 进入关怀版