网易首页 > 网易号 > 正文 申请入驻

OpenAI塌房!Scaling law原作曝bug,万亿算力全白烧

0
分享至


新智元报道


【新智元导读】DeepMind研究员深夜爆料:OpenAI的Scaling Law原始论文竟有致命bug!全球AI白白烧掉万亿算力,GPT-3其实严重「虚胖」。

OpenAI误导了整个AI圈好几年!

过去五年,整个AI行业都被Scaling Law推着往前冲。

奥特曼坚信AGI的底气就来自这条曲线。

现在,有人站出来说:这条曲线,一开始就错了。

不是事后诸葛。说这话的,是当年就在OpenAI做大模型优化的研究员Diogo Almeida

刚刚,他发出一篇博客,标题冷得发指——《Scaling Laws, Honestly》。

开头一句直接把话说死:最初那版scaling law是错的,因为存在一个bug。


传送门:https://www.completeskeptic.com/p/scaling-laws-honestly

DeepMind那位以扩散模型封神的Sander Dieleman,转头就在推特上把它顶了上去,说这是一段有意思的LLM往事:

原始scaling law因为一个bug而错了,大概率害得业界在一堆「体量过大、训练不足」的模型上,白白烧掉了海量算力。


一个bug,烧掉两年。

当bug被撕开,我们看到的,不仅是算力的黑洞,更是一条被语言本身重塑的、远比想象中更深刻的智能边界。

Scaling Law竟是LLM版「地心说」

2020年,OpenAI给出结论:在固定的算力预算下,你应该优先把模型做大,而不是拿更多数据去喂它。

用公式说,最优参数量正比于算力的0.73次方——参数,是那个更该猛冲的变量。


这句话,直接定义了GPT-3那一代的长相。堆参数。往死里堆。1750亿。

它告诉全世界的开发者:别问,问就是堆参数;只要你把模型做得足够大,神迹就会发生。

两年后,DeepMind甩出Chinchilla,把这个结论掀了个底朝天:模型和数据,应该差不多同等重要地一起放大,大约每个参数配20个token才划算。


他们训了一个700亿参数的Chinchilla,喂了1.4万亿token——体量不到GPT-3的一半,数据是它的四倍多。

结果,同样的算力预算,全面反超2800亿参数、却只喂了3000亿token的Gopher。

翻译成人话:同样一笔钱,一个把它养成了"虚胖"的壮汉,一个把它练成了精瘦的拳手。

拖更三年,北大校友翁荔深入探讨了后续研究中对两者差异的主流解释,即差异在于他们计算参数总数的方式。


而这还没完。就连「正确」的那个Chinchilla,自己也不干净。

2024年,Besiroglu等人把Chinchilla原文的数据点扒出来重跑,发现它自己那套拟合里也藏着bug:

优化器里的loss尺度设得过高,把Huber损失按样本求了平均、而不是求和,导致拟合过早终止。


纠正bug的论文,自己带着另一个bug。

到这儿,那句被无数人挂在嘴边的「第一性原理」,忽然有点站不住了。

所谓Scaling Law,从来就不是牛顿三定律那种铁打的物理规律,它只是一条经验拟合出来的曲线。


Diogo Almeida认为真相并非如此,不是方法不一样,「是最初那版scaling law本身有个bug。」

OpenAI三招骗了全球AI同行?

要制造一个让全球AI集体相信的谎言,只需要三步。

第一步:囚禁数据。

OpenAI论文给所有模型——不管它是还在学习走路的孩子(小模型),还是已经长成巨人的模型,喂了完全相同的「饭量」。大约130B tokens数据。

小模型因此被「喂饱」甚至「撑到」,而真正需要海量数据来填满其容量的大模型,却在同一token预算下严重营养不良。



Chinchilla论文后来一针见血地指出:他们对所有模型使用了「对所有模型使用了固定的训练Token数和学习率调度方案。」(fixed number of training tokens and learning rate schedule)。


这就像让幼儿园小朋友和博士生用同一张试卷、同一时间考试,然后宣称「成绩只与天赋有关」。

第二步:掩耳盗铃的LR衰减。

他们使用了余弦学习率衰减(Cosine Decay),让学习率在训练接近终点时平滑地趋近于零。


训练快到预设的终点时,学习率被人为地一点点摁到零,模型的进步自然就「平」下来了。

曲线一走平,看上去就像:这模型已经学到头了,再喂也没用了。

研究者们于是得出结论:「加数据没用了,模型已经饱和。」

这不是模型的极限,这是学习率把模型的成长之路人为掐断。它制造出一种完美的假象:性能已经到达天花板,再加数据也无用。

可我们现在知道,那些大模型根本没到头。

第三步:权威的傲慢。

第三步,也是最阴的一步:论文里写了一句,结果「基本不受学习率曲线影响」(largely independent of learning rate schedule)。


虽然包括当时在OpenAI的Diogo Almeida的不少人都隐约感觉到不对劲,但在固定token上限下,这个结论技术上正确。

可它偏偏不适用于scaling law真正想描述的那个「数据无限」的理想世界。

他们把有限条件下的局部真理,当成了普适的宇宙法则。

三步叠在一起,你就得到了一条既错、又极难debug的定律。

连Diogo自己都承认:当年他也在OpenAI做优化,也没看出这个bug——那条学习率曲线看着太像是「精心设定」的了,谁会去怀疑呢。

GPU被白白浪费

算力错配严重

受OpenAI错误公式的指引,AI行业进入了「大力出奇迹」的时代。

意味着在过去的几年里,全球最聪明的头脑、最稀缺的算力,都浪费在了无效的规模扩张上。

这不仅仅是钱的问题,这是在通往AGI(通用人工智能)的生死时速中,人类因学习率设置,集体在错误的跑道上狂奔了数千公里。

如果说Bug的发现让人心痛,那么随后引出的深度反思则让人不寒而栗。

研究者Adam Zachary Wasserman指出了一个被所有人忽略的盲点:即便公式修正了,目前的Scaling Law也只是「英语Scaling Law」。


他做了一个反直觉的实验:用同样的架构、同样的算力训练模型。

结果发现,法语模型达到某种语法能力的效率,竟然比英语模型高出50到100倍


为什么?因为英语是一种「形态贫乏」的语言。

它太依赖分布规律,需要模型在海量数据中去猜词义;而像法语、中文这种形态丰富或结构严密的语言,在词汇本身就带有大量明确信息。


这意味着,我们现在所有的算力配比方案,都是基于一种最「吃数据」、最低效的语言制定的。

当你以为你在探索「通用智能」的物理定律时,你其实只是在测量「英语这门语言有多浪费算力」。

这就像是你试图通过研究一头猪的胃口来制定全宇宙生物的营养标准——这不仅是偏见,更是认知的局限。

我们本可以用更小的模型、更多的优质数据,实现更强的性能。

我们本可以节省下数以万计的H100运行时的电力和热量。

我们本可以提前两年进入「高效AI」时代。

参考资料:

https://www.completeskeptic.com/p/scaling-laws-honestly

https://lilianweng.github.io/posts/2026-06-24-scaling-laws/

编辑:大卫




特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
日媒发布全球AI大模型实力调查报告:Kimi K3第六

日媒发布全球AI大模型实力调查报告:Kimi K3第六

CNMO科技
2026-08-24 12:12:04
恒大数百万烂尾业主:为什么很少看见激烈闹事,他们去哪了

恒大数百万烂尾业主:为什么很少看见激烈闹事,他们去哪了

网络易不易
2026-08-24 13:00:21
这就是赤裸裸的现实!工商银行已经到了最危险的时候?

这就是赤裸裸的现实!工商银行已经到了最危险的时候?

财经保探长
2026-08-23 21:43:55
世界最长寿在世者迎来117岁生日

世界最长寿在世者迎来117岁生日

参考消息
2026-08-25 12:30:08
日本啤酒上的辛口是什么意思?

日本啤酒上的辛口是什么意思?

日本通
2026-08-11 15:06:27
特朗普提了个大胆想法,干脆对中国再加7.5%关税?中方不吃压力

特朗普提了个大胆想法,干脆对中国再加7.5%关税?中方不吃压力

江启
2026-08-26 12:10:12
50岁林心如突然官宣!热搜炸了:这俩,终于不装了……

50岁林心如突然官宣!热搜炸了:这俩,终于不装了……

In风尚
2026-08-25 06:04:28
热搜上令人窒息的“母女吃牛肉面一幕”,精神穷人可怕的三观

热搜上令人窒息的“母女吃牛肉面一幕”,精神穷人可怕的三观

蝴蝶花雨话教育
2026-08-18 09:57:05
中国空军太丢脸:预警机被骑脸,歼20团灭,为何却让14亿人叫好?

中国空军太丢脸:预警机被骑脸,歼20团灭,为何却让14亿人叫好?

鹤羽说个事
2026-08-11 11:45:47
“曝包贝尔出轨”冲上热搜!情况比较复杂......

“曝包贝尔出轨”冲上热搜!情况比较复杂......

东莞好生活
2026-08-26 16:28:24
2亿60后集体退场,为何说中国再也不会有这代人?

2亿60后集体退场,为何说中国再也不会有这代人?

小怪吃美食
2026-08-25 04:44:10
宇树机器人踢掉5岁女童4颗牙仍未达成赔偿协议,“机器人又在哪里闯祸”

宇树机器人踢掉5岁女童4颗牙仍未达成赔偿协议,“机器人又在哪里闯祸”

Vista氢商业
2026-08-26 16:19:40
“扶老人被索赔”店主将捐出部分受捐款,其子称收到老人家属1.9万元返还款说法不实

“扶老人被索赔”店主将捐出部分受捐款,其子称收到老人家属1.9万元返还款说法不实

新京报
2026-08-26 14:42:53
经典名作《魔法门之英雄无敌3》原版登陆Steam

经典名作《魔法门之英雄无敌3》原版登陆Steam

3DM游戏
2026-08-26 16:11:59
宣传画大国朝鲜 海量画作里的金日成领袖形象

宣传画大国朝鲜 海量画作里的金日成领袖形象

那些看得见的老照片
2026-08-18 17:00:03
王健林能跑掉,不是因为聪明,是因为他的东西卖得掉

王健林能跑掉,不是因为聪明,是因为他的东西卖得掉

王二哥老搞笑
2026-08-26 02:25:31
顶级牛散大调仓!章建平又入1股,重仓算力清退资源!葛卫东加仓芯片

顶级牛散大调仓!章建平又入1股,重仓算力清退资源!葛卫东加仓芯片

证券时报
2026-08-26 10:46:04
郑丽文要被换掉?根据台媒披露,国民党本土派正在酝酿在2026年底,换掉郑丽文,推出一位与2028参选人一致的国民党主席,并且并不姓卢!

郑丽文要被换掉?根据台媒披露,国民党本土派正在酝酿在2026年底,换掉郑丽文,推出一位与2028参选人一致的国民党主席,并且并不姓卢!

扶苏聊历史
2026-08-25 16:44:27
为了这次地震,冥界准备了整整五十年?

为了这次地震,冥界准备了整整五十年?

神奇故事
2026-08-25 23:18:13
破防!美媒晒科比生前最后一张公开照,一句“明天再拍”,成终生遗憾

破防!美媒晒科比生前最后一张公开照,一句“明天再拍”,成终生遗憾

情感大头说说
2026-08-26 11:14:22
2026-08-26 17:03:00
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16030文章数 67018关注度
往期回顾 全部

科技要闻

2026新一代AI深圳创业创新大赛颁奖典礼

头条要闻

多人植入"戒酒芯片"19人完全戒酒 患者:喝酒的感觉没了

头条要闻

多人植入"戒酒芯片"19人完全戒酒 患者:喝酒的感觉没了

体育要闻

B费当选PFA最佳球员 曼联近16年首人

娱乐要闻

包文婧当初担心包贝尔出轨,预言成真

财经要闻

宗馥莉汽水铺销售遇冷

汽车要闻

220万台交付 GL8陆尊/至境世家发布限时焕新置换价

态度原创

艺术
数码
时尚
家居
本地

艺术要闻

阿列克谢・安东诺夫:让花朵在画布上呼吸的人

数码要闻

华为召开鸿蒙智家技术沟通会,多款智能家居新品亮相

夏天衣服不用买贵的,看看这几款针织短袖,舒适百搭又显得温柔

家居要闻

2026建博会(广州) 公装联探展交流活动

本地新闻

无印良品竟是桐乡造?这座小城藏着一个刀具帝国

无障碍浏览 进入关怀版