网易首页 > 网易号 > 正文 申请入驻

伯克利神作背刺OpenAI:持续学习才是真神!

0
分享至


新智元报道


【新智元导读】伯克利等发布FST框架:通过快慢分层解决大模型持续学习死局。

AI工程师Dan McAteer大胆预言,2026年持续学习(continual learning)即将爆发!

通过记忆/上下文快速适应+权重缓慢调整的分层机制,模型保留可塑性避免灾难性遗忘,这一突破远超推理变革1000倍。


这是最近的伯克利等机构的AI实验给他的勇气。

他们让同一个大语言模型连续学三个任务:

先学需要多跳检索的事实核验HoVer;再学代码推理CodeIO;最后学物理题Physics。

每个任务训200步就切换,模拟真实世界里「任务在不断变化」的学习场景。

用主流的强化学习(RL)范式训练,模型在第一关HoVer上学会了。到了第二关CodeIO完全卡住。学不动。

换上他们提出的新框架FST(Learning,Fast and Slow),同一个模型,三关都能学会。


这是AI行业过去两年集体押注的某个方向,第一次显露出它的天花板。


标题:Learning, Fast and Slow: Towards LLMs That Adapt Continually

预印本:https://arxiv.org/abs/2605.12484

项目主页:https://gepa-ai.github.io/gepa/blog/2026/05/11/learning-fast-and-slow/

如果我们集体押注的那条路,正在让模型变成「会做题但学不会新东西的天才」,那我们押的到底是AI,还是一只越来越精致的鹦鹉?

「推理」成了AI圈的全部叙事

过去两年,几乎所有头部实验室都在做同一件事:让模型想得更深。

OpenAI的o系列、DeepSeek的R1、Claude的思考模式这些产品形态各异,但内核都是一个共识:推理能力是AI的下一关


这个共识强到什么程度?

强到你今天去一线投资人那里,如果不能讲清楚自己怎么「做推理」(reasoning),连第一轮的门都进不去。

强到我们已经忘了去问:推理,到底是什么?

打一个比方,一个学生能把任何一道高考题想得无比深,推理链条无懈可击,逻辑结构滴水不漏。

但有一个前提,他从初中毕业那天起,就没再学过任何新知识。所有的知识储备,都停留在他16岁那年的状态。

你愿意把他的能力,称为「智能」吗?

这个比方可不是修辞。这是当前最先进LLM的真实处境。

GPT-5、Claude、Gemini等所有这些你今天能用上的模型,它们在每一次新对话开始时,都是一个昨天毕业、今天醒来、忘了一切的天才。

它们可以在一道题上推理得越来越深,但只要对话框一关,记忆就会清空,回到出厂设置般的「天才状态」。

它们是在推理的巨石上反复攀爬的数字西西弗斯——爬得越来越高,起点却永远是山脚。

问题是,为什么我们一直没察觉?

在AI历史上失败了30年,大家不敢再期待

为什么GPT不会从你和它的对话里学到任何东西?为什么你昨天教它的东西,今天打开一个新对话,它就完全不记得?

这是一堵30年没人推倒的墙。

AI领域的「持续学习」(Continual Learning),研究怎么让模型像人一样,不断「温故知新,吐故纳新」。

这个问题从1990年代就在被研究,然后在三个老对手面前反复失败:

第一个对手叫「首因偏差」(primacy bias),早期数据会主导模型最终的策略。

模型学会的第一件事,会顽固地塑造它后面学所有事情的方式。

第二个对手叫「损失函数弹性」(loss of plasticity),即模型每多学一个任务,可塑性就降低一分。

到某个临界点,它就再也学不会任何新东西了。

第三个对手最有名,叫「灾难性遗忘」(catastrophic forgetting)——你教模型学新任务,它的旧能力「啪」地一下塌掉。

教它做数学题,它就忘了怎么写代码。教它写代码,它就忘了怎么对话。


这三个问题,在小模型时代就存在。

到了大模型时代,它们没有变小,只是变得不那么醒目。

因为我们干脆放弃了让模型「持续学习」,只在训练时灌一次知识,部署后就冻结。

我们今天用的所有LLM,本质上都是冻结的天才

聪明,但不能再聪明。强大,但活在一个永恒的当下。

这就是为什么大模型时代,持续学习一直是个「听上去很美但谁也不敢碰」的话题。

试过的人都被这堵墙撞回来过。


但最近,这堵墙被一组研究者推了一道缝——他们没有发明新算法,他们做了一件更根本的事:重新分工

让模型像大脑一样,快慢分层

这是Databricks工程力+伯克利系统派+经典ML学派绑在一起的项目

作者豪华,值得一看:Matei Zaharia(Databricks联合创始人,Apache Spark作者)、Joseph Gonzalez(伯克利,vLLM作者之一)、Inderjit Dhillon(UT Austin与Google,ML领域元老级人物)——以及一群伯克利的博士。


当这三股力量同时押注一个方向,你就该认真看一眼。

他们提出的框架叫FST(Fast-Slow Training,快慢训练)。核心思想极其朴素:

不要让一组参数同时承担两个矛盾职能。

传统RL训练里,模型只有一组参数。

它既要「快速适应当前任务的特殊性」,又要「保留通用的推理能力」。

这两件事天然冲突:前者要漂移,后者要稳定

FST的做法是:把这两件事分到两套「权重」上

两者交替更新——每隔一段时间用RL调一下慢权重,同时用一个叫GEPA的prompt优化器自动演化快权重。

你的大脑,正是这样运作的。


在博客里,GEPA团队直接引用了「互补学习系统」理论(Complementary Learning Systems):

你的海马体,是大脑的「快权重」,它在几分钟内就能记住今天下午开会时同事说的那句话;

你的新皮层,是「慢权重」,它用几个月甚至几年的时间,慢慢把这些细节里真正值得纳入长期结构的东西沉淀下来。


新记忆,从来没有直接写进大脑长期结构。

它先在海马体里「暂存」,在睡眠中被反复回放,最终只有极小一部分被慢慢渗透进新皮层——剩下的,你忘了。

FST第一次让大模型拥有了这种分层结构。

数字也很漂亮。


FST在CodeIO任务上达到RL同等性能,只用了1/3的训练步数——数据效率3倍

在匹配准确率的情况下,FST训出来的模型与基础模型的KL散度(衡量分布偏移)比RL低70%——遗忘减少70%

最关键的是可塑性测试:训完Math任务后,再训HoVer-hard,RL训过的模型几乎完全学不动新任务(可塑性塌缩到近0),FST训过的模型,几乎恢复到基础模型水平继续学。


这是数量级跃迁

当然,FST不是一个完美的算法。GEPA和CISPO可以被任何其他的prompt优化器和RL算法替换,它的工程实现还很初步。

重要的不是FST这个具体方法能不能跑通——重要的是它提出的"快慢分工"作为一种范式语言,第一次让持续学习从空想变成可工程化的方向

还没形成的共识

共识正在形成,但还没形成。

这才是真实状态。

业界给的时间表是另一套。

Ilya Sutskever认为:超级智能应被重新定义为持续学习器,而非已完成的AGI。

他估算continual learning还要5到20年。

Ilya一向比业界共识慢,但每次保守判断都比业界更精准。5到20年的区间意味着,即使是 Ilya 也承认这件事会被解决,分歧只在节奏。

Karpathy更微妙。

在他看来,continual learning是真问题,用现有路径解决还不够。他的怀疑停在执行层面,方向层面没有反对。

但事情已经动了。

推理时代是2024年开局、2026 年收尾。

持续学习时代是2026年开局,下一轮博弈不会等到2027年。

参考资料:

https://arxiv.org/pdf/2605.12484

https://gepa-ai.github.io/gepa/blog/2026/05/11/learning-fast-and-slow/

https://x.com/daniel_mac8/status/2055975372345274519

编辑:KingHZ David

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
官至国务院副总理,薄一波为何没当上政治局委员?

官至国务院副总理,薄一波为何没当上政治局委员?

娱乐的宅急便
2026-09-17 12:52:46
这三个国家不欢迎中国人,满脸都是嫌弃,却总有国人上赶着去

这三个国家不欢迎中国人,满脸都是嫌弃,却总有国人上赶着去

墨兰史书
2026-09-18 03:30:06
警报拉响!日本内阁大换血,极右翼正式入阁,扩军野心藏不住了

警报拉响!日本内阁大换血,极右翼正式入阁,扩军野心藏不住了

战友老邓
2026-09-17 14:07:33
裤衩开叉10厘米!被网暴5年!铁三女神夺亚军又被骂,裁判:合规

裤衩开叉10厘米!被网暴5年!铁三女神夺亚军又被骂,裁判:合规

番外行
2026-06-07 15:53:29
史上最强“灭霸级”减肥药杀到:最高减重50%,黑市已彻底疯了?

史上最强“灭霸级”减肥药杀到:最高减重50%,黑市已彻底疯了?

徐德文科学频道
2026-09-17 13:37:13
3年5550万美元!萨迪克・贝成功续约鹈鹕:曾单场51分+10记三分

3年5550万美元!萨迪克・贝成功续约鹈鹕:曾单场51分+10记三分

罗说NBA
2026-09-18 06:39:05
中央定调!三类人员不允许弹性延迟退休,只能到龄退休或提前退休

中央定调!三类人员不允许弹性延迟退休,只能到龄退休或提前退休

职场资深秘书
2026-09-17 15:41:43
帮菲律宾赌博集团写代码,非法获利1216万余元,黄某等人被判处有期徒刑5年6个月至6个月不等

帮菲律宾赌博集团写代码,非法获利1216万余元,黄某等人被判处有期徒刑5年6个月至6个月不等

每日经济新闻
2026-09-17 21:33:53
理想i9“掀桌价”36.98万元上市 引i8车主集体破防

理想i9“掀桌价”36.98万元上市 引i8车主集体破防

TechWeb
2026-09-17 10:24:04
《交锋》大结局:马憩辞职,和林看山正式接头,应邀朱应甲家中做客

《交锋》大结局:马憩辞职,和林看山正式接头,应邀朱应甲家中做客

肆季娱乐
2026-09-18 09:20:59
58岁白岩松不再隐瞒,坦白和敬一丹的真实关系,难怪缺席追悼会

58岁白岩松不再隐瞒,坦白和敬一丹的真实关系,难怪缺席追悼会

可乐谈情感
2026-09-18 00:16:13
日本亚运会,真是丢人丢到全世界了,还没有正式开幕,就已经遭到了多国代表团以及国际舆论的广泛批评

日本亚运会,真是丢人丢到全世界了,还没有正式开幕,就已经遭到了多国代表团以及国际舆论的广泛批评

扶苏聊历史
2026-09-17 17:25:16
美国军火商不装了:如果中国歼-35真装了涡扇19,将是F-35的噩梦

美国军火商不装了:如果中国歼-35真装了涡扇19,将是F-35的噩梦

不甜的李子
2026-09-18 07:42:11
省人大常委会关于接受赵俊民同志辞职的决定

省人大常委会关于接受赵俊民同志辞职的决定

云南网络广播电视台
2026-09-18 11:20:59
王尔晴搀扶着爸爸王梓木,父女俩眼睛红肿,悲伤走出八宝山殡仪馆

王尔晴搀扶着爸爸王梓木,父女俩眼睛红肿,悲伤走出八宝山殡仪馆

可乐谈情感
2026-09-18 00:19:23
重磅:美国众议院通过格雷厄姆对俄制裁法案!加征100%关税

重磅:美国众议院通过格雷厄姆对俄制裁法案!加征100%关税

项鹏飞
2026-09-17 18:44:26
16位明星挤爆舞池,首轮就淘汰两人,她第一个出局

16位明星挤爆舞池,首轮就淘汰两人,她第一个出局

浅遇时光
2026-09-17 10:33:40
44岁年薪85万高管,失业后收破烂为生,住月租500元城中村,如今他怎么样了?

44岁年薪85万高管,失业后收破烂为生,住月租500元城中村,如今他怎么样了?

德鲁克博雅管理
2026-09-17 17:23:05
何华任中国地质大学(北京)党委副书记、纪委书记(正局级)

何华任中国地质大学(北京)党委副书记、纪委书记(正局级)

澎湃新闻
2026-09-18 12:54:26
一年两次来华?确定特朗普会来深圳APEC,但住宿安排他说了不算

一年两次来华?确定特朗普会来深圳APEC,但住宿安排他说了不算

井普独白
2026-09-17 15:35:11
2026-09-18 13:15:00
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16216文章数 67073关注度
往期回顾 全部

科技要闻

苹果店外黄牛蹲守:18 Pro Max加价500

头条要闻

特朗普考虑大规模打击伊朗 媒体:美大致有两种选择

头条要闻

特朗普考虑大规模打击伊朗 媒体:美大致有两种选择

体育要闻

一个角色球员,靠什么在NBA征战17年

娱乐要闻

敬一丹逝世 央视送别,女儿成“心病”

财经要闻

中国汽车:尾大不掉,必须出清

汽车要闻

小鹏G9L限时售23.18万 旗舰级的配置/诱人的价格

态度原创

时尚
手机
艺术
公开课
军事航空

上岸的张家齐,想赚一个小目标

手机要闻

苹果18Pro系列开售 ProMax溢价最高破千元 Pro遭拒收

艺术要闻

韦启美 81岁时画的这幅瓶花,28.75万!

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

中方反对在安理会强推恢复对伊朗制裁

无障碍浏览 进入关怀版