来源:蒙格斯智库
![]()
图源:pexels
在二〇二五年七月上海举行的“世界人工智能大会”上,美国计算机科学家、图灵奖得主理查德•萨顿却出人意料地宣称:“人类数据时代已近结束,经验时代即将来临。”如何理解?
这句话是“强化学习之父”、图灵奖得主理查德·萨顿对AI发展范式切换的核心判断,本质是宣告大模型当前依赖“人类存量知识”的路线即将触顶,AI将转向“自主交互生成经验”的新路线。可以从三个层面理解:
![]()
什么是“人类数据时代”,为什么走到了尽头
我们当前所处的阶段,AI的核心训练原料是人类生成的存量数据:互联网文本、书籍、代码、人工标注内容,大模型的本质是把人类已经创造出来的知识、语言、逻辑“搬运”到参数里,再通过人类反馈微调对齐。
这个范式已经触及两个硬边界:
数据存量见顶:高质量的公开人类语料已经被主流大模型基本消耗完毕,新增数据的边际价值急剧下降,继续堆参数、堆数据的收益越来越低,也就是行业普遍观察到的“规模壁垒”;
能力天花板明确:基于人类数据训练的AI,本质是“复刻人类已有认知”,它无法产生真正超出人类知识边界的新发现,也做不到像人一样在环境里持续学习、终身进化,训练完成后就是静态的。
萨顿的判断是:靠“吃人类存量知识”这条路,已经走到了末期。
![]()
“经验时代”的核心:AI自己生成数据,自己进化
萨顿所说的“经验”,不是人类的经验,而是AI智能体通过与环境主动交互,自己产生的第一手数据,包含三个核心信号:观察(看到什么)、行动(做了什么)、奖励(结果好坏),这正是强化学习的底层逻辑。
和人类数据时代的本质区别是:
数据不再是有限的人类存量,而是AI在自我博弈、与现实/虚拟环境交互中无限生成的。AI越强,能探索的场景越多,生成的高质量经验数据就越多,不会枯竭;
学习不再是“模仿人类答案”,而是“在试错中总结规律”,就像AlphaGo自我对弈走出人类从未想过的棋步、AlphaProof自己推导出新的数学定理,AI可以产生人类没有的新知识;
智能不再是训练完成后就固定的静态模型,而是可以持续学习、终身进化的动态智能体。
这也是萨顿一贯“痛苦教训(Bitter Lesson)”观点的延续:AI领域最终胜出的方法,是依赖大规模学习、大规模算力的路线,而不是依赖人类手工注入知识、手工设计规则的路线。
![]()
现实定位:是长期趋势,不是即时替代
需要明确的是,这不是说大模型立刻就会被淘汰,而是AI的核心增长动力正在切换:
当前行业已经在往这个方向走:AI智能体、世界模型、强化学习对齐、合成数据,本质都是在摆脱对纯人类文本数据的依赖;
但真正的“经验时代”还在早期,通用智能体的持续学习、现实世界交互的安全性、经验数据的质量控制,都还没有完全解决。
萨顿的判断更像是一个路线宣言:下一个阶段的AI,比拼的不再是谁能拿到更多人类语料,而是谁能让AI在真实环境里更高效地自主探索、自主学习。
特别声明:以上内容仅代表作者本人的观点或立场,不代表新浪财经头条的观点或立场。如因作品内容、版权或其他问题需要与新浪财经头条联系的,请于上述内容发布后的30天内进行。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.