网易首页 > 网易号 > 正文 申请入驻

强化学习之父Sutton最新访谈:合成数据是巨大错误,大模型只完成了四分之一的智能

0
分享至

来源:市场资讯

(来源:DeepTech深科技)


当前,大模型主要通过预训练和后训练获得能力,上线后参数通常不再更新,只能借助上下文、知识库或重新训练适应变化。如何让 AI 在部署后持续学习,正成为行业需要突破的基础问题。

8 月 18 日,红杉资本旗下播客《Training Data》发布了一期围绕 AI 持续学习的对谈,受访者为强化学习奠基人、2024 年图灵奖得主 Rich Sutton。此外,参与访谈的嘉宾还有 Sutton 的前学生、Oak Lab 联合创始人 Khurram Javed,对谈由红杉资本合伙人 Sonya Huang 和 Alfred Lin 主持。

访谈从 Sutton 2019 年发表的《苦涩的教训》谈起,延伸至合成数据、世界模型和持续学习,并讨论智能体如何从真实经验中形成抽象概念。Sutton 认为,部署后便停止改变的模型,还称不上完整的智能系统。大模型虽是重要突破,却主要解决了语言能力,只覆盖智能的一部分。

基于这一判断,Sutton 正将持续学习推进为一条完整的技术路线。就在上个月,他与 Khurram Javed 创立 AI 初创公司 Oak Lab,并提出以经验学习、时间抽象和规划为核心的 OaK 架构,希望智能体能从连续经历中实时学习,不断更新认知并改进决策。

“止步不前”的智能

在今天,大模型看起来无所不知,却有一个容易被忽略的特点:它们的大部分能力都在上线前形成,经过预训练和后训练后,模型参数便基本固定。此后即使每天接触大量用户和新信息,也不会像人一样把这些经历转化为新的长期能力。


图|访谈现场(来源:YouTube)

Sutton 认为,这种静态范式混淆了知识与学习的边界。尽管模型可以记住一段对话,也可以借助外部知识库回答最新问题,但这些都不等于真正的学习。

这是因为上下文只是暂时改变模型当前能够看到的信息,模型内部的知识结构并未随之更新。另外,当对话结束或窗口被清空后,这些信息也可能随之消失。

这一区别在产品端并不明显。一个 AI 助手可以根据用户反馈修改答案,甚至借助记忆功能表现得越来越了解用户,给人一种“它正在学习”的感觉。但如果模型权重没有变化,那么它只是利用当前提供的信息完成推理,并没有形成可以长期保留的新认识。

不过,让模型继续更新参数,也没有想象中简单。Khurram Javed 等人在《Nature》发表的研究显示,标准深度学习模型在接连学习新任务时,吸收新知识的能力会逐渐下降。研究人员将这种现象称为“可塑性损失”,也就是模型训练得越久,反而越难学会新的东西。

为解决这一问题,现有训练方式往往会采用大量混合数据。Khurram Javed 解释,现有训练通常借助大批量数据,减弱单个样本对原有能力的冲击。但随着真实经验不断增多,而智能体需要保存并反复训练全部历史数据,计算和存储成本将答复增加。

合成数据因此被不少研究者视为一种解决方案。既然高质量的人类数据有限,就让模型自动生成题目、回答或模拟环境,再用这些内容训练下一代模型。

不过,Sutton 在访谈中将这种路径称为一个“巨大的错误”。在他看来,它扩大了数据规模,却没有改变 AI 依赖外部数据生产者的基本方式。

Sutton 指出,任何模拟环境都只能保留现实的一部分,许多因素很难被完整写入模拟器。合成的世界可以很大,但它仍然由有限规则构成,与现实的复杂程度存在差距。

在访谈中,Sutton 又以自动驾驶为例。企业可以让车辆在模拟环境中行驶数十亿公里,再由工程师根据真实路测调整系统。他认为,更合理的路径应当是让车辆直接从驾驶经验中发现预测偏差、修正环境模型,并将新的认识用于下一次决策。

这也是 Sutton 重提“苦涩的教训”的原因。他认为,能够利用更多计算资源、从数据中自主发现规律的通用方法,最终将胜过植入大量专家知识的系统。例如,AlphaGo Zero 未使用人类棋谱训练,仅凭自我对弈便击败此前的 AlphaGo。

大语言模型在一定程度上延续了这条路线。尽管它没有依靠专家逐条编写规则,而是从大规模文本和计算中学习语言结构。但 Sutton 认为,互联网文本终究是由人类整理出来的有限知识,如果模型始终依赖更多文本和人工反馈,它的进步仍会受到人类数据供给能力的限制。

不过,Sutton 也明确表示,他并不主张抛弃已有知识。而问题在于,当前模型常常把这些知识固定在部署前的参数中,此后只负责调用,很少用新的经历检验和修正它们。

他预测,当前大模型可能只覆盖了智能的四分之一,剩余部分还包括感知、行动、规划,以及在长期经验中持续改变自身的能力。缺少这些环节,模型即使再博学,也只能停留在上线时的状态。

Oak Lab 要实现持续学习

Sutton 团队认为,实现真正的持续学习,核心在于解决深度学习中的灾难性遗忘问题。朴素的单样本权重更新会快速覆盖原有知识,让模型失去之前积累的能力,这也是过去持续学习难以落地的核心障碍。

为解决这一问题,他们提出两个关键的技术方向:第一个方向是“步长优化”,通过为不同参数设置不同的更新速度,已经承载稳定知识的参数变化较慢,需要学习新内容的部分则可以更快调整。第二个是“生成与检验”,即不断提出新的内部特征或神经单元,再检验它们是否有助于模型学习。

基于上述思路,团队提出“持续反向传播”算法,相关成果此前已于《Nature》发表。这种算法在标准反向传播的基础上,持续加入少量随机初始化的新单元,再由反向传播检验其价值。Sutton 认为,如果将这一机制与步长优化结合,有望形成新一代持续深度学习算法。

不过,这类算法不能直接套用在已经训练好的静态模型上,而要用它们从头训练新的基础模型。模型在积累知识的同时,也会学习今后应当如何更新自身,从而有望在吸收新知识时减少对原有能力的破坏。

持续深度学习只是第一步,更长远的目标是让模型自主构建抽象与世界模型。Sutton 认为,当前的 AI 系统要么使用人类预设的规则模型,要么只能做低层级的时序预测,目前还无法自主生成高层抽象并基于抽象进行规划推理。

Sutton 团队最大的野心,是构建覆盖从微观细节到宏观决策的全谱系知识系统。真正的心智应该可以持续更新,同时始终保持内在的自洽与连贯,不会因为持续学习陷入混乱。


图|Oak Lab首页(来源:公司官网)

这也正是 Oak Lab 的核心使命。这家成立于 2026 年 7 月的初创公司,目标是在五到十年内打造出万亿参数规模、运行功耗仅 20 瓦的持续学习心智模型。

20 瓦大致和人类大脑的功耗水平相当,这意味着智能的提升不再单纯依赖算力堆砌,而是通过算法效率的飞跃实现。

针对这一目标,Sutton 按照摩尔定律作出估算:如果计算效率每 18 个月提高一倍,10 年大约可以带来两个数量级的提升。这意味着,假如现在能以约 2,000 瓦实现相应规模,未来将可能将功耗降至 20 瓦。

不过,最终形态不会是一个无所不能的单一心智。由于没有任何单个系统可以学完所有知识,同一种基础架构会衍生出大量不同的实例。按照两人的设想,同一种基础架构会产生多个智能体,它们因所处环境和自身经历不同,形成各自的知识与能力。

谈到公司的未来,Khurram Javed 表示,Oak Lab 初期不会追求快速扩张。新范式需要团队成员对研究方向形成高度共识,因此公司将从小规模团队起步,再逐步扩充至数个核心小组,以保持研究效率和方向一致。

参考资料:

1.https://www.youtube.com/watch?v=xH7U7w9Qzlo

2.https://oaklab.ai/mission

运营/排版:何晨龙

注:封面/首图由 AI 辅助生成

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
黄晓明陈冠希同框,旁边32岁陈梦却成全场最佳:不医美不打针,运动员的气血感赢麻了

黄晓明陈冠希同框,旁边32岁陈梦却成全场最佳:不医美不打针,运动员的气血感赢麻了

阿废冷眼观察所
2026-08-22 15:35:59
国羽世锦赛战报:韩悦阻击安洗莹失败!王祉怡PK世界第1,男双孤军奋战!

国羽世锦赛战报:韩悦阻击安洗莹失败!王祉怡PK世界第1,男双孤军奋战!

刘姚尧的文字城堡
2026-08-21 20:37:29
评浙江出台最严饭局禁令

评浙江出台最严饭局禁令

阿莱美食汇
2026-08-22 01:06:24
蒙古女网红带多人强闯中资企业石油勘探营地,不但破坏财物,还侮辱中方员工

蒙古女网红带多人强闯中资企业石油勘探营地,不但破坏财物,还侮辱中方员工

西楼知趣杂谈
2026-08-22 17:22:54
51亿深埋垃圾场!8000枚比特币,被女友扔掉后,男子坚持寻找12年

51亿深埋垃圾场!8000枚比特币,被女友扔掉后,男子坚持寻找12年

皮皮电影
2026-08-22 12:50:17
牡丹花下死?汪峰将森林北踢出局,这次终于彻底印证葛荟婕的评价

牡丹花下死?汪峰将森林北踢出局,这次终于彻底印证葛荟婕的评价

历史的烟火
2026-08-14 15:48:04
从巅峰到全面崩溃,森林北败得毫无悬念,汪峰惯用伎俩:先结账后抽身,这算盘打得妙

从巅峰到全面崩溃,森林北败得毫无悬念,汪峰惯用伎俩:先结账后抽身,这算盘打得妙

阿废冷眼观察所
2026-08-22 02:19:54
不再保持中立,东盟多国集体表态,大军直奔台东,台海叙事已破产

不再保持中立,东盟多国集体表态,大军直奔台东,台海叙事已破产

凡知
2026-08-22 01:54:22
突发:台北地检署再出手,知名统派青年侯汉廷遭起诉

突发:台北地检署再出手,知名统派青年侯汉廷遭起诉

海峡导报社
2026-08-22 10:34:10
人民日报今天刊发“钟才文”重磅专论,对比去年国庆八连评,释放四个关键信号!

人民日报今天刊发“钟才文”重磅专论,对比去年国庆八连评,释放四个关键信号!

识局Insight
2026-08-22 13:42:21
邓亚萍点名孙颖莎,说的何止是戴首饰

邓亚萍点名孙颖莎,说的何止是戴首饰

阿废冷眼观察所
2026-08-22 16:34:59
聚焦皖北振兴!安徽召开推进会,上海市副市长、江苏省副省长、浙江省副省长参会

聚焦皖北振兴!安徽召开推进会,上海市副市长、江苏省副省长、浙江省副省长参会

政知新媒体
2026-08-22 00:16:30
聚焦“投资于人”数看财政清单里的民生温度

聚焦“投资于人”数看财政清单里的民生温度

人民网
2026-08-22 09:07:54
唐家兄弟纷争持续发酵!城步一中163班的高中同学留言力挺弟弟,网友怒斥:弟弟是典型的损人不利己

唐家兄弟纷争持续发酵!城步一中163班的高中同学留言力挺弟弟,网友怒斥:弟弟是典型的损人不利己

火山詩话
2026-08-21 07:16:07
1969年中苏冲突,朝鲜企图跨过鸭绿江,毛主席:一招搞定!

1969年中苏冲突,朝鲜企图跨过鸭绿江,毛主席:一招搞定!

小莜读史
2026-04-04 21:56:55
也门胡塞遭重创:200精锐命丧,面临生存危机?

也门胡塞遭重创:200精锐命丧,面临生存危机?

高博新视野
2026-08-20 19:21:34
特朗普不敢对中方做的事,美财长做了,马斯克:这下麻烦大了

特朗普不敢对中方做的事,美财长做了,马斯克:这下麻烦大了

风雨与阳光
2026-08-21 20:47:05
试拍:大批歼-16降落巴基斯坦

试拍:大批歼-16降落巴基斯坦

烽火观天下
2026-08-22 12:09:12
宏远速递!新主帅抵达球队宿舍,广东与广州打热身赛,黄明依或被退货

宏远速递!新主帅抵达球队宿舍,广东与广州打热身赛,黄明依或被退货

多特体育说
2026-08-22 16:25:31
普京不想再打!俄军打下来的领土,足够给1亿俄罗斯人1个交待了!

普京不想再打!俄军打下来的领土,足够给1亿俄罗斯人1个交待了!

福建睿平
2026-08-22 08:37:57
2026-08-22 19:44:49
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4513348文章数 9343关注度
往期回顾 全部

科技要闻

苹果裁员200人:Vision Pro砍游戏团队

头条要闻

美国人均负债11.76万美元 特朗普放话称考虑出兵干预

头条要闻

美国人均负债11.76万美元 特朗普放话称考虑出兵干预

体育要闻

枪手赚翻!4000万新援揭幕战8分钟策动2球

娱乐要闻

《空枪》预测票房缩水,手握王炸都没赢

财经要闻

蔡昉解读经济:扩大消费需求的政策思考

汽车要闻

2026成都车展的顶流选手 硬派方盒子享界 G9

态度原创

亲子
时尚
健康
旅游
军事航空

亲子要闻

宝蓝把房间放满凯蒂猫的玩偶,布置成公主房,太漂亮了。

秋天最流行的4组叠穿公式,怎么搭都时髦!

“矫正神器”真能治好脊柱侧弯吗?

旅游要闻

辰山植物园解锁睡莲多样美学,七大展区上万株睡莲打造夏日限定花事盛宴 | 附攻略

军事要闻

披露林肯号航母内幕的美国军报多人被炒

无障碍浏览 进入关怀版