网易首页 > 网易号 > 正文 申请入驻

AI大牛卡帕西盛赞DeepSeek!对着论文夸了半小时,称其思维能力“难以置信”

0
分享至

智东西2月12日消息,近日,OpenAI联合创始人、前特斯拉AI总监、知名计算机科学家李飞飞的爱徒安德烈·卡帕西(Andrej Karpathy)在YouTube上发布一则3.5小时的超长免费课程,向普通观众做了一次全面的大模型科普。其中,他花费近半个小时时间,以最近爆火的DeepSeek-R1为例,详解了背后强化学习技术路径的巨大潜力。


卡帕西认为,在大模型训练体系中,预训练、监督微调和强化学习是其中的三个主要阶段,而“强化学习是一切调整到位的环节”。虽然强化学习的本质并不复杂,即“试错学习”,但在如何选择出最佳的解决方案、提示词分布等问题上还有许多细节尚未明晰,仅停留于各大AI实验室内部,缺乏统一标准,解决这些问题并不容易。

因此,DeepSeek-R1研究论文的主要贡献便是:“它首次公开讨论了强化学习在大语言模型的应用,并分享了这项技术是如何让模型涌现出推理能力”。R1在强化学习过程中涌现出的思维能力,被卡帕西称为“最令人难以置信的成效”。

未来,如果我们继续在大模型领域对强化学习路径进行Scaling,就有望让大模型也能解锁像AlphaGo“第37步棋”那样的“神之一手”,创造出人类从未设想过的思考方式,比如用一门全新的语言进行思考。

不过,这一切实现的前提是,我们需要创造足够大、足够多样的问题集,让模型能自由地探索解决方案。

以下内容是对卡帕西课程中涉及DeepSeek与强化学习内容的总结提炼,完整视频链接及课程材料已附于文末。

一、DeepSeek-R1验证强化学习魔力,卡帕西称其“非常可靠”

强化学习的基本工作方式是让模型在可验证的问题上(如数学、代码)等领域不断试错,并根据答案的正误去激励那些得出正确答案的行为,最终引导模型实现能力提升。卡帕西称:“强化学习是一切调整到位的环节。”

当前主流的大语言模型训练体系主要包含三个阶段:预训练、监督微调(SFT)和强化学习(RL)。预训练相当于通读所有教科书的基础知识,构建知识图谱;SFT就像是模仿专家解题模板,学习规范化的解题流程;而RL则是通过海量练习题自主探索解题策略。

其中,前两个阶段的预训练和SFT已发展成熟,被行业广泛采用。而最具突破性的RL仍处于早期发展阶段。虽然OpenAI等公司内部也有进行尝试,但从未对外界直接披露。

在卡帕西看来,DeepSeek-R1论文的重要意义,正是在于它是第一篇公开讨论强化学习在大语言模型应用的论文,并分享了这项技术是如何让模型涌现出推理能力。这篇论文激发了AI界使用RL训练大语言模型的兴趣,并提供了许多研究结果和技术细节。

DeepSeek在R1论文中分享了R1-Zero在AIME竞赛数学问题上的准确性提升过程。卡帕西分析道,AIME数学题本身的难度并不是特别高,但是R1-Zero一开始的表现并不理想。随着强化学习的步骤越来越多,模型的准确性持续上升,因为它在这类问题上进行了大量的试错。


比正确率提升还令人惊喜的是,模型在这一过程中打磨出了一套独特的解决方式。在优化的后期,模型倾向于使用更长的回答(也就是更多的token)来获得更高的准确性。

R1在RL的过程中涌现出了所谓的“aha moment”,这意味着它已经发现,尝试更多想法,从不同角度尝试、回溯、重构问题,是能够明显提升准确率的。


R1所做的事情其实与人类解决数学问题的模式类似。但这一解决方案并不靠模仿人类,也不是靠硬编码,而是完全自然涌现的。R1重新发现了人脑的思维过程,自学了思维链(CoT)。在卡帕西看来,这是RL运用于大语言模型时,最令人难以置信的成效。

OpenAI的员工先前的公开言论显示,OpenAI的o1、o3 mini等模型都使用了RL技术。卡帕西称就性能而言,这些模型和DeepSeek-R1大致相当,DeepSeek-R1是一款非常可靠的思考模型。

不过,并不是所有的模型都适合使用思考模型进行处理,依照卡帕西的个人经验,他大约80%-90%的查询依旧是由GPT-4o完成的,当他遇到非常困难的代码和数学问题时,才会使用思考模型。

二、强化学习潜力早有端倪,有望彻底改变思考的形态

RL是一种极其强大的学习方式,这一发现对AI领域来说并不新鲜。AI界已经在一个领域见证了这一点,那就是围棋。DeepMind开发的AlphaGo,通过自博弈和强化学习,突破了人类棋手的实力上限。

当我们研究AlphaGo的论文时,可以发现一张与DeepSeek论文中极为类似的图表。这张图表显示,随着强化学习时间长度的不断增加,强化学习模型(蓝色实线)在围棋上的得分也越来越高,最终超过蓝色虚线所表示的李世石的得分。而紫色实现所代表的监督学习模型在逼近人类棋手得分后,未能实现超越。


监督学习模型本是上是在模仿人类专业棋手,但如果只是试图模仿他们,虽然能在一段时间里实现能力提升,但最终会达到一个瓶颈,永远无法从根本上超越人类玩家。

但在强化学习的过程中,模型的力量要大得多。在围棋的强化学习中,系统会广泛尝试那些在经验上和统计学意义上能赢得比赛的棋步。

AlphaGo会与自己对弈,并使用强化学习来创建推演。系统在学习过程中自主尝试了很多棋步,最终那些制胜的策略会被加强。强化学习不会受到人类表现的限制,它甚至可以超越像李世石这样的顶级玩家。

理论上,强化学习可以持续运行,但由于成本原因,DeepMind团队选择在某些时候停止,但这一案例充分展示了强化学习的潜力。而通过DeepSeek-R1,我们才开始看到强化学习在大语言模型的推理问题上更为泛化的潜力。

强化学习还让AlphaGo能够提出更为新颖的制胜方法——这便是有名的“第37步”。在AlphaGo战胜李世石的比赛中,它下了一步极为罕见的棋,人类棋手走出这样一步棋的概率仅为万分之一。

但事后看来,这是一步制胜的妙棋。AlphaGo在强化学习的过程中,发现了一种人类未知的下棋策略。

未来,如果我们继续在大语言模型领域对强化学习路径进行Scaling,或许也有可能解锁那些让人类摸不着头脑的解决方案。卡帕西认为,这有可能包括发现人类无法发现的类比,全新的思考策略,甚至是发明一种更加适合思考的语言。

从原则上来讲,强化学习系统的行为的条条框框要少很多,它会尝试做任何能实现目标的事情,也会逐渐偏离其原始训练数据中的语言(如英语)。但实现这些的前提是,我们需要为模型创造足够大的问题集,让模型能够不断优化和完善其解决问题的策略。这正是目前许多大语言模型研究的前沿议题。

三、多模态AI与语言模型无本质区别,测试时训练将成为前沿方向

卡帕西还在课程中预言了未来将会出现的几大AI趋势。

首先是多模态AI。由于音频、图片、视频等内容对AI模型来说没有本质区别,都可以被token化,因此只要采取大语言模型的训练逻辑和演进路线,便能提升模型在相关领域的表现。

其次是agents。目前,大部分AI模型还是在执行人类安排的任务,没有自行规划长链条任务并执行的能力还是其中的重要一环。

此外,测试时训练(test-time training)将会成为AI研究的前沿。在先前的训练模式中,训练后的参数就不会再变化了,这意味着模型停止了学习,它们唯一学到的新东西就是在上下文窗口中的内容。

但在未来,随着多模态任务让输入token量呈现指数级增长,一味提升上下文窗口的容量将无法满足模型性能提升的需求。测试时训练能让模型根据新数据微调其参数,让其更擅长特定问题的解答。测试时训练有望提升AI能力的重要方向之一。

结语:DeepSeek的突破性成就广受认可

强化学习作为上一个世代AI能力突破的重要方向,由DeepSeek在生成式AI时代再度发扬光大。然而,有不少海外竞争对手质疑、贬低DeepSeek的成就和原创性。

但在不少像卡帕西这样专注于技术本身的广大AI开发者看来,DeepSeek获得的种种开源突破,对整个AI界未来的发展来说是有利而无害的,他们也乐见DeepSeek创造出更多令人意想不到的惊喜。

完整视频:https://www.youtube.com/watch?v=7xTGNNLPyMI&t

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
反转!奎因签证被卡去不了俄罗斯了,宏远球迷狂喜:天意不可违啊,赶紧续约

反转!奎因签证被卡去不了俄罗斯了,宏远球迷狂喜:天意不可违啊,赶紧续约

海阔山遥YAO
2026-08-01 10:35:54
消费者称在闲鱼卖电脑“钱货两空”,买方:申请退款退货后,卖方一直拒收电脑只能召回;平台回应

消费者称在闲鱼卖电脑“钱货两空”,买方:申请退款退货后,卖方一直拒收电脑只能召回;平台回应

山西经济日报
2026-07-31 11:41:37
和周星驰联手不到48小时,张柏芝被高调示爱,谢霆锋彻底翻篇

和周星驰联手不到48小时,张柏芝被高调示爱,谢霆锋彻底翻篇

陈錈爱体育
2026-08-01 15:54:55
他睡过董卿又甩了,娶小20岁嫩妻躺平大理,如今62岁成人生赢家

他睡过董卿又甩了,娶小20岁嫩妻躺平大理,如今62岁成人生赢家

观察者小海风
2026-07-31 12:15:53
日本长崎、广岛市长发声

日本长崎、广岛市长发声

上观新闻
2026-07-31 22:13:53
关系硬,孙雨轩暗示泰山队代理主帅上面有人,2018年就进顶级教练班,普通国脚根本没资格报名

关系硬,孙雨轩暗示泰山队代理主帅上面有人,2018年就进顶级教练班,普通国脚根本没资格报名

体坛风之子
2026-08-01 05:00:09
设计建国后奇葩养老金方案,“成为老鼠钻风箱几头受气的名人”

设计建国后奇葩养老金方案,“成为老鼠钻风箱几头受气的名人”

辉哥说动漫
2026-08-01 09:33:14
男子忘关窗户,出差半个多月回家发现,阳台上的10万元钞票经过大雨反复浸泡叠加暴晒,粘连在一起无法分开……最终兑换出8.2万元

男子忘关窗户,出差半个多月回家发现,阳台上的10万元钞票经过大雨反复浸泡叠加暴晒,粘连在一起无法分开……最终兑换出8.2万元

上海约饭局
2026-08-01 18:39:10
苏醒宣布今后不再参加陌生人真人秀,批恋综变“宫斗剧”、指压板游戏十几年不换,顺带吐槽综艺付费套路,网友:真敢把心里话往外说

苏醒宣布今后不再参加陌生人真人秀,批恋综变“宫斗剧”、指压板游戏十几年不换,顺带吐槽综艺付费套路,网友:真敢把心里话往外说

鲁中晨报
2026-08-01 16:30:02
3-2!天津让2追3,10分钟进3球绝杀云南,迎来4连胜脱离降级区

3-2!天津让2追3,10分钟进3球绝杀云南,迎来4连胜脱离降级区

小金体坛大视野
2026-08-01 21:13:13
多家新势力车企7月销量公布

多家新势力车企7月销量公布

中新经纬
2026-08-01 11:37:19
全国知名专家举报材料寄给200多人,阻止他人当选院士!

全国知名专家举报材料寄给200多人,阻止他人当选院士!

听心堂
2026-08-01 09:18:00
被某手机厂商恶意投诉了!

被某手机厂商恶意投诉了!

胖胖说他不胖
2026-07-31 11:50:12
又打中了!伊朗,上演逆天翻盘!

又打中了!伊朗,上演逆天翻盘!

大嘴说天下
2026-07-31 19:53:49
内斗最在行!易中天:东野圭吾别走!郭松民:你不舍,即刻追随去

内斗最在行!易中天:东野圭吾别走!郭松民:你不舍,即刻追随去

瑜说还休
2026-07-31 13:08:14
男性“黄金体重”已公布!不是140斤,而是这个数,越接近越健康

男性“黄金体重”已公布!不是140斤,而是这个数,越接近越健康

周哥一影视
2026-07-24 14:00:45
交友不慎!霉霉痛下决心切割布莱克,也不给闺蜜女儿当干妈了,10年友情走到尽头

交友不慎!霉霉痛下决心切割布莱克,也不给闺蜜女儿当干妈了,10年友情走到尽头

世界王室那些事
2026-08-01 00:50:03
半场1-0!山东泰山率先发难,取得梦幻开局,裁判半场吹掉2球

半场1-0!山东泰山率先发难,取得梦幻开局,裁判半场吹掉2球

汪星人哟
2026-08-01 20:30:20
越来越多有钱人宁愿买两套房,和父母门对门住,也要搬离别墅!

越来越多有钱人宁愿买两套房,和父母门对门住,也要搬离别墅!

职场资深秘书
2026-08-01 21:32:07
3岁男童上幼儿园1个月被劝退,校长怒怼:我们是老师,不是保姆

3岁男童上幼儿园1个月被劝退,校长怒怼:我们是老师,不是保姆

大果小果妈妈
2026-08-01 13:34:47
2026-08-01 22:08:49
智东西 incentive-icons
智东西
智东西,AI产业新媒体,专注报道人工智能的前沿技术发展,和技术应用带来的千行百业产业变革。
12364文章数 117144关注度
往期回顾 全部

科技要闻

特斯拉拆不掉中国制造

头条要闻

31岁网文作者剖腹产次日突发重病 成"半植物人"近半年

头条要闻

31岁网文作者剖腹产次日突发重病 成"半植物人"近半年

体育要闻

蔡崇信夫妇决定离婚!结束30年婚姻

娱乐要闻

韩路批董宇辉“又当又立”?

财经要闻

长鑫科技四万亿市值背后的资本与周期

汽车要闻

限时17.99万元 全新一代天工08 670 Max正式上市

态度原创

数码
亲子
本地
手机
公开课

数码要闻

AMD Radeon RX 9050首测出炉:能效比突出、整机功耗比RTX 5050低35W

亲子要闻

娃5岁迟迟不会说话,家人放弃治疗,那日指着保姆说句全家愣住了

本地新闻

神仙也“蓉”漂,哪吒与八仙,皆是成都出品!

手机要闻

165帧拉满游戏体验!一加ChinaJoy 2026打造沉浸式枪神乐园

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版