网易首页 > 网易号 > 正文 申请入驻

8万亿,梁文锋也开始卷“超大”

0
分享至



DeepSeek也加入参数大竞赛了。

据The Information报道,DeepSeek目前正在训练一个约2万亿参数的新模型;梁文锋还在近期一场投资者会议上表示,公司下一步计划继续把模型推到8万亿参数。



放在一年前,8万亿还是个难以想象的数字。

但现在,Kimi K3已经做到2.8万亿参数;字节正在预训练一个最高可能达到10万亿参数的新模型;阿里也公开表示,下一代模型将向5万亿到10万亿参数推进。Anthropic并不公开模型参数,但FT此前援引业内估计称,其最新旗舰Mythos 5大约就在8万亿参数左右。

大模型兜了一圈,又开始比谁更大。

只是这一次,大家卷的参数,已经不是上一轮Scaling里的那种参数了。

A

DeepSeek今年4月发布V4-Pro时,官方披露的规模是1.6万亿总参数、490亿激活参数。

8万亿的后续规划,相当于V4-Pro的5倍。

这事儿放在DeepSeek身上其实挺反常,毕竟DeepSeek去年给整个AI行业留下最深的印象,并不在参数上。

它曾一度让AI行业重新讨论,也许前沿模型不需要无限烧GPU。

2024年底发布V3时,DeepSeek特意把训练账单摆到了台面上:6710亿总参数、每个Token激活370亿参数,完整训练消耗278.8万H800 GPU小时。按照每GPU小时2美元计算,官方给出的训练成本只有557.6万美元。



这个数字,以及背后代表的效率,成了DeepSeek后来最重要的标签之一。

DeepSeek没有OpenAI、Anthropic那样充裕的先进GPU供应;公司过去也长期依赖梁文锋旗下幻方量化自我输血,不接受外部融资。它的条件决定了它的路线——既然钱和算力有限,就尽可能从架构、训练和推理效率里抠性能。

但现在,条件变了。

DeepSeek今年6月刚完成成立以来首轮外部融资,募资约74亿美元;目前第二轮约500亿元人民币(约75亿美元)的融资已经进入最后敲定阶段,对应估值约5000亿元人民币。如果本次融资顺利完成,DeepSeek几个月内累计外部融资将接近150亿美元、约1000亿元人民币。



与此同时,DeepSeek已聘请中信证券筹备科创板IPO,新增资本明确将用于算力基础设施、模型开发和人才投入;9月21日,原高瓴创投合伙人严文韬正式加入DeepSeek并出任CFO,结束了公司成立三年来CFO一直空缺的状态。

以前的DeepSeek,是在有限的钱和算力里尽可能把模型做好;现在融资、上市都在往前推,手里的钱多了,算力也能跟着往上堆。

有条件以后,DeepSeek也开始大胆卷参数了。

这和追求效率其实并不冲突,效率高了,同样的钱能把规模做得更大。

B

最近两个月,前沿模型的总参数规模正在明显往上抬。

把这轮竞赛重新推到聚光灯下的,是月之暗面。今年7月,Kimi K3做到了2.8万亿总参数、1040亿激活参数。K3至今仍是已经正式发布、参数规模最大的开放权重模型。

它不只是大。官方评测里,K3的GPQA Diamond达到93.5,Terminal-Bench 2.1达到88.3,已经和同期GPT-5.6 Sol、Claude Fable 5打得很近。规模做到了数万亿,性能也做到了第一梯队。

8月,字节被曝要做个更大的。

8月6日,《晚点 LatePost》率先披露,字节正在讨论训练一个超过5万亿参数的新模型,由Seed Foundation负责人项亮主导。据报道,字节内部似乎认为,与其在现有尺寸上继续追赶,不如一次把参数规模推到同行数倍。

一天后,8月7日,FT援引知情人士报道称,字节正在预训练的新模型规模最高可能达到10万亿参数;路透社跟进时,还拿它与Anthropic最前沿的Mythos相比——后者虽然从未公开参数规模,但业内估计已经达到约8万亿。字节的新模型如果做到10T,将超过Mythos目前流传的规模。



现在,5T以上的超大参数量又开始反复出现在前沿模型的讨论里。

今天,阿里CEO吴泳铭公开宣布,下一代模型计划做到5万亿到10万亿参数;DeepSeek则在训练2T模型的同时,把后续目标放到了8T。可以理解为,头部实验室重新把更大的总参数规模当成了冲击能力上限的一条重要路线。

就连不公开参数的美国闭源模型也逃不开外界的审视,Anthropic的Mythos被外界估到8T;OpenAI从GPT-4时代起就不再公开模型规模,但社区流传着Astra达到了10T级MoE的说法。

参数量从未失去吸引力,如同游戏面板上的战力值——人们知道它不能代表全部,但它永远是最直观、最有压迫感的那个数字。

大模型行业其实有段时间不太爱谈参数。

这两年,蒸馏、小模型、MoE、强化学习和推理时计算轮番上阵,比起炫耀自己有几千亿、几万亿参数,模型厂商更愿意讲性能、成本和效率。单纯把模型做大,很容易显得有钱没地方烧。

时至今日,参数量被重新抬了上来,又一次成为了前沿模型的“排面”。

不过,今天的5T、8T、10T,和上一轮Scaling里的“参数越多,模型越大”,已经不是同一回事了。

C

参数量能重新上桌,最直接的原因是超大模型的主流架构变了。

过去的大模型,主流还是Dense架构,参数规模和计算量基本绑在一起。简单说,就是模型里有多少参数,每次计算基本都得一起上。参数越多,能力上限往往越高,但训练和推理成本也跟着往上涨。

现在,越来越多超大模型用的是MoE,Mixture of Experts,混合专家架构。

它更像一家养了很多专家的公司,模型可以拥有几百、几千个专家,但每次任务只挑其中一小部分上班。比如Kimi K3有2.8T总参数,但每个Token只激活104B,大约3.7%;DeepSeek V4-Pro有1.6T总参数,每个Token只激活49B,大约3%。

所以今天说一个模型有5T、8T甚至10T参数,并不意味着它每生成一个Token都要跑完这10T参数。

模型能装多少,和每次要算多少,变成了两个不同的数字。

参数可以理解成模型用来承载知识、模式和能力的空间。总参数越大,模型理论上就有更大的空间去学习更多、更复杂的分布;MoE又允许它只在需要的时候调用其中一部分。

于是,模型可以继续增加总参数的容量,而不需要让每一次计算都同比变重。

依然拿K3举例,它把总参数做到2.8T,规模约是K2.5的3倍,但896个专家里,每个Token只激活16个。月之暗面称,靠更稀疏的MoE和一系列架构优化,K3的整体Scaling效率相比K2提升了约2.5倍。

而Agent时代,恰好又把这种“容量”重新推到了竞争中心。

过去衡量一个Chatbot,能力往往是一项一项测的。数学看数学,代码看代码,问答看知识。模型在几个关键Benchmark上把峰值做高,就足以证明自己很强。

但Agent把这些能力串进了同一条任务链。一个真实的长任务,可能从搜索资料开始,中间读网页、看图片、写代码、调用终端,再遇到报错、修改方案、调用别的工具,甚至把子任务分给其他Agent。

OpenAI今年9月发布Agents API时,就把长时间运行、上下文管理、工具使用和子Agent协调直接列成了Agent的核心基础设施,并强调Agent需要可靠运行数小时甚至数天。



一次问答里,某项能力偶尔失手可能只丢一道题;几十步、上百步的Agent任务里,任何一个薄弱环节都可能中断整条链路。任务越长,对能力覆盖面和稳定性的要求就越高。前沿竞争因此开始出现明显的“木桶效应”。

METR现在甚至直接用“任务时间跨度”衡量Agent能力,因为任务越长,对模型持续完成一连串不同操作的要求越高。

Chatbot时代更容易看到能力峰值,Agent时代开始越来越看能力覆盖面。

这时候,更大的参数容量就有了新的价值。任务越长,模型越不能偏科;Agent能做的事情越多,底座需要覆盖的能力就越广。

MoE打开了容量继续扩张的空间,Agent则把容量的价值进一步放大。于是,模型厂商一边拼命提高效率,一边又重新把参数往5T、8T、10T推。

省下来的算力并没有让Scaling消失,反而给Scaling腾出了新的空间。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
《兰香如故》播出过半,最失败的两个选角出来了,太让人出戏

《兰香如故》播出过半,最失败的两个选角出来了,太让人出戏

清川逐影
2026-09-22 16:12:36
香港人气女星卫诗雅自曝嘴唇缝50针,医美老公担心留疤痕,每晚亲自检查!

香港人气女星卫诗雅自曝嘴唇缝50针,医美老公担心留疤痕,每晚亲自检查!

我爱追港剧
2026-09-23 00:59:54
白人女子在首尔商场辱华!被中国姑娘“暴击”,却让韩国人破防了

白人女子在首尔商场辱华!被中国姑娘“暴击”,却让韩国人破防了

凡知
2026-09-23 11:46:50
严查、重查、倒查,全都一查到底?这把“利剑”,究竟护着咱们啥

严查、重查、倒查,全都一查到底?这把“利剑”,究竟护着咱们啥

一口娱乐
2026-09-22 00:33:06
不是龚翔宇,也不是王奥芊!赛后日本主帅亲口承认:真拦不住她

不是龚翔宇,也不是王奥芊!赛后日本主帅亲口承认:真拦不住她

江启
2026-09-23 07:37:46
你爱吃番茄吗?两项研究实锤:每天吃约200g番茄,能在不大幅度减重的情况下,显著减少肝脏脂肪含量,改善脂肪肝

你爱吃番茄吗?两项研究实锤:每天吃约200g番茄,能在不大幅度减重的情况下,显著减少肝脏脂肪含量,改善脂肪肝

梅斯医学
2026-09-18 07:54:24
中秋前夕,全国月饼市场断崖式下滑,“月饼卖不动”登顶热搜第1,月饼促销潮已经提前开启,折扣普遍在6至9折

中秋前夕,全国月饼市场断崖式下滑,“月饼卖不动”登顶热搜第1,月饼促销潮已经提前开启,折扣普遍在6至9折

大风新闻
2026-09-22 16:56:09
银行闹大了!陕西男子为妻子患癌急需用钱买药,查账时钱“消失”

银行闹大了!陕西男子为妻子患癌急需用钱买药,查账时钱“消失”

别人都叫我阿腈
2026-09-23 01:15:00
俄方:泽连斯基的声明自相矛盾

俄方:泽连斯基的声明自相矛盾

参考消息
2026-09-23 13:29:26
亚运会:国乒有惊无险!栋曼组合3-1进8强,林诗栋拒绝再输泰国选手

亚运会:国乒有惊无险!栋曼组合3-1进8强,林诗栋拒绝再输泰国选手

全言作品
2026-09-23 13:12:55
CCTV5今日直播:临时调整!国乒男团避免爆冷,女团vs朝鲜有压力

CCTV5今日直播:临时调整!国乒男团避免爆冷,女团vs朝鲜有压力

许礆很机智
2026-09-23 06:10:50
远嫁巴基斯坦的广西女教师易菲自曝近况:无收入、无自由、如今被婆家殴打

远嫁巴基斯坦的广西女教师易菲自曝近况:无收入、无自由、如今被婆家殴打

小徐讲八卦
2026-09-21 09:39:54
32万所空置小学,正在被酒店疯抢

32万所空置小学,正在被酒店疯抢

钛媒体APP
2026-09-22 11:06:09
火箭媒体日:杜兰特不认同乌度卡削减自己时间 自信他在场球队才最强

火箭媒体日:杜兰特不认同乌度卡削减自己时间 自信他在场球队才最强

罗说NBA
2026-09-23 06:10:53
五部委都在催央国企付款,可谁来付款给国企?

五部委都在催央国企付款,可谁来付款给国企?

坠入二次元的海洋
2026-09-22 13:22:57
碰到硬茬了!离职前一天被罚500元,东莞一员工申请仲裁,工厂在开庭才拿出劳动合同疑造假,当事人申请笔迹鉴定

碰到硬茬了!离职前一天被罚500元,东莞一员工申请仲裁,工厂在开庭才拿出劳动合同疑造假,当事人申请笔迹鉴定

火山詩话
2026-09-22 08:50:42
官方:咪咕转播国足vs马尔代夫,CCTV5将在25日22:35录播

官方:咪咕转播国足vs马尔代夫,CCTV5将在25日22:35录播

懂球帝
2026-09-23 12:35:08
大V:3架枭龙战机被胡塞武装击毁!

大V:3架枭龙战机被胡塞武装击毁!

烽火观天下
2026-09-22 11:39:14
张又侠刘振立案再有后续,解放军报刊发重要社论,军中反腐零容忍

张又侠刘振立案再有后续,解放军报刊发重要社论,军中反腐零容忍

李遝手工制作
2026-09-23 10:13:59
不给钱就卖到园区会所?22岁哈尔滨女孩王然,这次怕是凶多吉少了

不给钱就卖到园区会所?22岁哈尔滨女孩王然,这次怕是凶多吉少了

皮蛋儿电影
2026-09-22 11:20:47
2026-09-23 14:07:00
字母榜 incentive-icons
字母榜
让未来不止于大。
2801文章数 8093关注度
往期回顾 全部

科技要闻

一夜三款新模型,AI价格战再升级

头条要闻

女子酒后被送入酒店房间 深夜赤足跑出房间从7楼坠亡

头条要闻

女子酒后被送入酒店房间 深夜赤足跑出房间从7楼坠亡

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

梅启明被彻底除名遗产清零

财经要闻

全市场都在卷自营

汽车要闻

5.1米的启境GX7,底盘凭什么又稳又舒服?

态度原创

游戏
时尚
数码
亲子
房产

双人合作影游《新世界:暗影成双》双端今日上线

消失的天后,带病复出,先赚10个亿

数码要闻

索尼头戴式耳机WH-CH730N / WH-CH530国行上架,定价999 / 449元

亲子要闻

71岁的成龙自曝患“小儿多动症”?一个“停不下来”的功夫之王,替千万成年人问出了那句最难开口的话

房产要闻

楼市变天!三亚第一个"接住"新政的楼盘出现了

无障碍浏览 进入关怀版