网易首页 > 网易号 > 正文 申请入驻

斯坦福大模型推理课免费了,谷歌推理团队创始人主讲

0
分享至

闻乐 发自 凹非寺
量子位 | 公众号 QbitAI

干货来了!

如何理解大模型推理能力?现在有来自谷歌DeepMind推理负责人Denny Zhou的分享了。

就是那位和清华姚班马腾宇等人证明了只要思维链足够长,Transformer就能解决任何问题的Google Brain推理团队创建者。

Denny Zhou围绕大模型推理过程和方法,在斯坦福大学CS25上讲了一堂“LLM推理”课。

让我们也来跟着大神学习一下。

有推理过程的答案会让模型更自信

首先,什么是大模型推理呢?

其实就是大语言模型在给出最终答案前的中间思考步骤

比如问

“artificial intelligence”每个单词的最后一个字母连起来是什么?

有推理过程的回答会先分别找出“artificial”的最后一个字母是“l”,“intelligence”的最后一个字母是“e”,再把它们拼接成“le”;而没有推理的就直接给出“le”这个结果。

这种推理过程和人类的思维过程无关,而关键在于生成了大量的中间内容。

那为什么中间思考步骤很重要呢?

一个原因是它可以让复杂问题变得可解

简单来说,对于能用布尔电路解决的问题,假设电路规模是T,哪怕是固定大小的Transformer模型,生成O(T)个中间步骤就能搞定。

但如果跳过中间步骤,直接让模型输出最终答案,要么需要极深的模型层数(增加计算成本),要么根本无法解决。

Denny Zhou和马腾宇等人的著作《Chain of Thought Empowers Transformers to Solve Inherently Serial Problems》提到如果给Transformer引入思维链,就能大大提高模型推理能力。

这篇论文说明了只要引入思维链,那么无需扩展模型的规模就能让Transformer变得强大到能解决任何问题。

理论上来说,只要有足够的CoT步骤,Transformer就可以模拟多项式大小电路可以执行的任何计算,从而缩小了Transformer与图灵机之间的差距。

另一方面是中间步骤可以提升答案的准确性和可靠性

没有推理步骤时,模型可能靠“瞎猜”给出答案。

例如问:

我有3个苹果,爸爸比我多2个,一共多少个?”

直接输出的答案可能是错误的“5个”;

但有推理步骤的回答就是“爸爸有3+2=5个,总共3+5=8个”),答案更可能正确。

这是因为推理步骤迫使模型有理有据地推导,尤其是对需要逻辑链条的问题(如数学、因果分析),减少了随机猜测的概率。

就像做数学题一样,一步步推导可比瞎蒙准确率高多了。

并且,对于有推理过程的答案会让模型更有信心

Denny Zhou还强调预训练模型即使没有经过任何微调,也具备推理能力

只不过,基于推理的输出通常不会出现在输出分布的优先级部分,因此无法通过贪婪解码(选择概率最高的输出)输出。

那么我们如何让它输出推理后的答案呢?

一种方法是提示

既然模型对于有推理过程的答案更有信心,那么我们可以通过思维链提示或者加上提示词来让模型进行推理。

比如思维链提示,你可以给它一个带步骤的例子,给它打个样。或者你可以告诉它:让我们一步步想。

不过,Denny Zhou和Xuezhi Wang在《Chain-of-Thought Reasoning Without Prompting》一文中提出其实不用这些提示,只要改变模型的解码方式,就能让预训练的语言模型展现出推理能力。

原来模型在生成答案时,通常只用最可能的那个词(贪心解码),但如果看看排在后面的几个可能的词(top-k替代词),会发现里面藏着一步步推理的路径。

而且当有这种推理路径时,模型对答案的信心也更高。

于是他们提出了CoT-decoding方法,就是从这些top-k的解码路径中,选出那些有推理过程且模型信心高的路径,这样能让模型在各种推理任务上表现得更好,甚至能接近经过指令微调的模型效果

不过,另一种方法就是监督微调(SFT)

监督微调就是用人类写的带步骤的题和答案训练模型,让模型学着生成类似的步骤。

但这种方法有个问题是泛化性不太好,换个新场景可能就不灵了,而且模型做大了也没用。

于是,研究人员对监督微调进行了改进,一种是自我改进,让模型自己生成步骤和答案,然后用正确的那些训练自己,有点像学生自己做题纠错。

另一种是强化学习微调,反复让模型生成答案,多练正确的,少练错误的。这里面,能判断答案对不对的“验证器”很重要。

现在,强化学习微调已成为了引出推理的最强大的方法。

并且,Denny Zhou认为扩展强化学习应该专注于生成长响应,也就是《Chain of Thought Empowers Transformers to Solve Inherently Serial Problems》这篇文章中的观点。

另外,进一步的重大改进是聚合和检索的方法

LLM是概率模型,其解码时追求的是在给定问题下推理和最终答案的联合概率最大,而我们想要的是给定问题下最终答案的概率最大,两者并不一致。

于是有了以下改进方法:

  • 边缘化和自一致性:生成多个回答,选择出现最频繁的答案。
  • 通用自一致性:让LLM自己选择最一致的答案,适用于非唯一答案的问题,比如“哪些国家的人比墨西哥人喝咖啡少”。
  • 检索+推理:结合检索和推理的方法,先回忆相关问题,再解决当前问题。比如计算正方形面积的问题,先回忆两点间距离公式,再计算边长,进而得到面积。

最后,Denny Zhou总结了提升LLM推理能力的要点

  • 推理比不推理好
  • 强化学习微调比监督微调好
  • 聚合多个答案比单个答案好
  • 检索+推理比仅推理好

并指出未来的突破方向是解决非唯一可验证答案的任务,以及构建实际应用而非仅解决基准测试问题。

Denny Zhou介绍

Denny Zhou是中科院博士,2017年加入Google前在微软担任了11年的高级研究员。

他创立并领导了Google Brain中的推理团队,Google Brain现已成为Google DeepMind的一部分。

他的研究目标是通过构建具备推理能力的大型语言模型解决人工通用智能(AGI)问题,核心方向包括思维链、自洽性、任务分解、零样本学习、组合泛化及大语言模型理论等,追求实现完美泛化。

在2022年,他荣获谷歌研究技术影响力奖、2022年WSDM时间考验奖等。

近年来,他多次受邀在耶鲁大学、哈佛大学、斯坦福大学等多所高校和机构进行主题为语言模型推理的演讲。

这次Denny Zhou在斯坦福大学CS25课程上用的课件已附在文末~

完整版pdf:https://dennyzhou.github.io/LLM-Reasoning-Stanford-CS-25.pdf


[1]https://x.com/denny_zhou/status/1948499173986201915
[2]https://dennyzhou.github.io/

— 完 —

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
贵州晴隆通报:“把抗战公路圈起来收费”的说法,与事实有出入,即日起二十四道拐观景台、展览馆景区免费开放

贵州晴隆通报:“把抗战公路圈起来收费”的说法,与事实有出入,即日起二十四道拐观景台、展览馆景区免费开放

政知新媒体
2026-10-04 16:08:54
抖音网红表妹李KK塌房,彻底玩完

抖音网红表妹李KK塌房,彻底玩完

新浪财经
2026-06-23 00:08:03
吴曦带领U23国足拿到铜牌!直言点球大战开始前,他眼睛是湿润的

吴曦带领U23国足拿到铜牌!直言点球大战开始前,他眼睛是湿润的

懂个球
2026-10-04 23:59:03
北京楼市:回龙观已经疯狂了!

北京楼市:回龙观已经疯狂了!

阿离家居
2026-10-04 00:52:27
奶浆开袋即食,却宣称手工现做!一组照片实拍野人先生后厨,实锤预制底料引热议,网友:冰淇淋店应该拉一头活奶牛来挤牛奶吗?

奶浆开袋即食,却宣称手工现做!一组照片实拍野人先生后厨,实锤预制底料引热议,网友:冰淇淋店应该拉一头活奶牛来挤牛奶吗?

火山詩话
2026-10-04 10:30:16
为什么碰瓷大妈能把讹诈演成“促销大戏”?

为什么碰瓷大妈能把讹诈演成“促销大戏”?

小眼睛小世界
2026-10-05 07:23:00
德赫亚发布社媒:德约科维奇是史上最佳运动员?

德赫亚发布社媒:德约科维奇是史上最佳运动员?

懂球帝
2026-10-04 22:17:18
中国篮协这套班子看着不对劲!扒开几个人的履历,心里五味杂陈

中国篮协这套班子看着不对劲!扒开几个人的履历,心里五味杂陈

爱情的滋味我也想尝尝
2026-10-05 03:46:02
最长30天!多地婚假延长(附一览表)

最长30天!多地婚假延长(附一览表)

黄河新闻网吕梁
2026-10-03 16:12:38
撒贝宁一家回武汉,抱着7岁儿子,女儿争宠也要抱,儿女都好黏他

撒贝宁一家回武汉,抱着7岁儿子,女儿争宠也要抱,儿女都好黏他

柒佰娱
2026-10-04 15:04:31
研究证实:人体强壮的秘密,根本不是肌肉!而是这几样东西

研究证实:人体强壮的秘密,根本不是肌肉!而是这几样东西

解说阿洎
2026-10-04 11:31:28
55岁钟丽缇机场生图翻车,网友辣评像比目鱼

55岁钟丽缇机场生图翻车,网友辣评像比目鱼

东方不败然多多
2026-10-05 06:23:20
日媒开始担心中国不邀请高市早苗参加深圳APEC会议!

日媒开始担心中国不邀请高市早苗参加深圳APEC会议!

经点星娱
2026-10-03 20:46:56
35页PPT疯传:洛阳女子1女谈3男,每天卡时间,都已谈婚论嫁

35页PPT疯传:洛阳女子1女谈3男,每天卡时间,都已谈婚论嫁

烈史
2026-05-30 13:23:41
中国一个很可怕的现象:父母在倾尽所有积攒,孩子在心安理得享受

中国一个很可怕的现象:父母在倾尽所有积攒,孩子在心安理得享受

户外阿毽
2026-10-04 00:49:46
为什么平陆运河国庆爆火?说它只是普通河的人,却被人潮狠狠打脸

为什么平陆运河国庆爆火?说它只是普通河的人,却被人潮狠狠打脸

刘哥谈体育
2026-10-05 00:14:47
女子被日本高管持刀胁迫,性侵40分钟经过曝光,事后承认吃药了

女子被日本高管持刀胁迫,性侵40分钟经过曝光,事后承认吃药了

水泥土的搞笑
2026-10-02 09:23:34
伊朗副总统:当初选择日本车就好了,中国车质量差价格高

伊朗副总统:当初选择日本车就好了,中国车质量差价格高

贱议你读史
2026-09-02 21:21:39
2-1逆转挪威!坎塞洛对轰世界波,葡萄牙豪取4连胜

2-1逆转挪威!坎塞洛对轰世界波,葡萄牙豪取4连胜

7号观察室
2026-10-05 06:32:52
法国总统终于看到,自己犯下3个致命失误,但现在后悔已经晚了

法国总统终于看到,自己犯下3个致命失误,但现在后悔已经晚了

近史谈
2026-10-04 18:25:07
2026-10-05 07:55:00
量子位 incentive-icons
量子位
追踪人工智能动态
13436文章数 176576关注度
往期回顾 全部

科技要闻

苹果确认:iPhone 18 Pro Max有问题

头条要闻

名校"7人轮奸案"震惊全美 女方曾称同意与2人发生关系

头条要闻

名校"7人轮奸案"震惊全美 女方曾称同意与2人发生关系

体育要闻

32胜0负!德约2-1逆转头号种子兹维列夫 第7次晋级中网四强

娱乐要闻

高晓松悄悄复出:官媒没给他留体面

财经要闻

OpenAI前安全部门员工:公司文化已崩坏

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

教育
本地
手机
房产
军事航空

教育要闻

Do you have the time不是问你有没有空,千万别会错意啦!

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

手机要闻

iPhone18 Pro:首销破百万,国产旗舰首销总和不到人一半!

房产要闻

保利大爆发,冲到榜一!海南楼市前三季度,热销榜出炉!

军事要闻

驻冲绳美军士兵抢劫杀人 日本向美国提出抗议

无障碍浏览 进入关怀版