网易首页 > 网易号 > 正文 申请入驻

AlphaGo核心作者:十年了,LLM还没学到那场棋局「神之一手」的精华

0
分享至

2016 年 3 月,首尔四季酒店。

人机大战第二局进行到中途,AlphaGo 把一颗黑子落在了第五线上。现场解说一时语塞,有人怀疑程序出了 bug,因为在职业棋手的常识里,这手棋近乎于白送。



后来的故事大家都知道了。AlphaGo 不仅赢下了那一局,还以 4:1 的总比分击败了李世石。赛后李世石说了一段被反复引用的话:「我原以为 AlphaGo 只是基于概率计算的机器。但看到那一手,我改变了想法。AlphaGo 一定有创造力。」

那就是著名的第 37 手。

十年过去,当年亲手造出 AlphaGo 的人却站出来说了一句:那一手棋所依赖的能力,今天的 AI 恰恰没有。



说这话的人是 Thore Graepel,AlphaGo 的核心作者之一,长期从事机器学习研究。最近他做了一个颇耐人寻味的决定 —— 离开 Google DeepMind,去创业做一件他认为更要紧的事:给机器装上真正的推理能力。



那个辛辣的观点出自他最近发布在 MIT Technology Review 上的一篇文章,文章标题非常直接,就叫「别被骗了 ——LLMs 不会推理」。看完这篇文章,图灵奖得主 Yann LeCun 表示赞赏,强调「真正的推理必须涉及搜索,LLM 不具备这一能力」。



Thore Graepel 为什么这么说?我们一起来看看这篇文章写了什么。

第 37 手不是「灵光一闪」,而是推理的产物

很多人对第 37 手的叙事是「机器直觉的神话时刻」——AI 电光石火之间,看到了人类千年棋谱之外的妙手。Graepel 说,这是大家对 AlphaGo 最大的误解。



要理解这一点,得先拆开 AlphaGo 的内部构造。它由两套系统组成:一套是策略网络(policy network),通过学习海量人类棋谱,来预测「高手在这一局面会怎么下」,这是直觉的部分。另一套是搜索机制,它不关心某手棋「看起来像不像人下的」,而是显式地构建一棵包含数千个分支的博弈树,逐一推演每个候选落点通向的未来。

关键在于:在策略网络眼里,第 37 手平平无奇 —— 职业人类棋手下出这一手的概率大约只有万分之一。如果只听直觉的,这一手根本不会被选中。是搜索机制在深算之后发现,这手「不像话」的棋通向一个更好的终局。

Graepel 借用了卡尼曼那个著名的框架来解释这件事。人类的思考分为两种模式:系统 1 快、凭直觉、毫不费力;系统 2 慢、一步步来、审慎权衡。AlphaGo 恰好是这两种模式在机器上的罕见合体:神经网络提供「这手棋有戏」「这个局面要赢」的直觉,搜索机制负责把这些直觉放到未来的攻防变化里去检验。缺了任何一半都不行:光有直觉,永远走不出第 37 手;光有暴力搜索,也根本筛不动围棋那天文数字般的可能性。

这里还有一个常被忽略的对比。1997 年深蓝击败卡斯帕罗夫,靠的是人类硬编码的规则,每秒评估 2 亿个棋局位置,向前看六到八步。而围棋的复杂度完全是另一个量级,一颗子的价值取决于几十个回合之后厚势与实地的消长,哪怕只算所有变化的一小部分,超级计算机也得算上几十亿年。所以 AlphaGo 必须学会「一眼看清局势」,甚至创造人类从未想过的下法。它不是靠算力碾压赢的,这一点至关重要。

大语言模型:一个被练到极致的系统 1

再来看今天的 AI。

大语言模型的工作原理,归根到底是一遍又一遍地预测下一个 token。这本质上就是系统 1 在运转:快速、联想式、在几乎所有人类写过的领域里都能完成令人惊艳的模式补全,但它没有「想一想再回答」这个环节。

ChatGPT 横空出世后不久,业界就意识到光有语言流畅度撑不起真正的用处。补救方案大家都很熟悉了:让模型别急着回答,先生成中间步骤,把问题拆开、把中间结果带下去 —— 也就是思维链(chain of thought)。

思维链的提升是实打实的,尤其在数学和代码上。但 Graepel 指出了一个容易被兴奋情绪掩盖的事实:这些中间推理步骤,仍然是同一个「预测下一个 token」的过程,只是在给出最终答案前多迭代了一会儿而已。 它并没有像 AlphaGo 的搜索那样,引入一个真正独立的推理机制。直觉被拉长了,但并没有因此变成审慎。

他进一步列出三个短板,说明聊天机器人做的事为什么够不上「科学家所承认的那种推理」。

第一,模型没有一份明确的、可持续更新的、可供检查的认知状态。它此刻在考虑哪些假设、对各种解释抱有多大信心、在权衡哪些证据、还有哪些问题悬而未决。这些东西本该随着新信息的到来被系统性修订,但模型内部并没有这样一本「开放的账簿」。

第二,模型没有做到「知道什么」和「如何运用知识」之间的分离。知识和推理死死缠绕在神经网络的权重里,不存在一套独立、显式表达的信念体系。

第三,也是最微妙的:思维链看起来像深思熟虑,但研究已经表明,模型经常在事后编造它们。答案是走一条路得出的,报告给你的却是另一条路。一个「听起来很有道理的故事」,和一段「真实发生的推理」,是两回事。

推理是真是假,有那么重要吗?

如果只是聊天闲聊,推理是真是假可能无所谓。但在我们真正在乎的高风险领域 —— 医疗、工程、科学研究 —— 一个系统得出什么结论和如何得出结论同样重要。出了错,比如在诊断和治疗上出了错,我们需要能定位错在哪一环:是推理过程出了问题,是采信了无效证据,还是做了错误假设?一个只会事后编故事的系统,在这类场景里是无法被信任、也无法被追责的。

这也正是 Graepel 离开 DeepMind 的原因。他认为我们需要一种全新的机器推理路径,而灵感恰恰来自十年前的 AlphaGo。

AlphaGo 随时维护着一份它对当前局面全部认知的记录,也就是那棵博弈树。树里装着它考虑过的所有变化、所有可能的未来,每一手、每个局面都标注着神经网络的判断。随着推演深入,它不断更新这棵树,最终综合树里的信息决定落子。

Graepel 认为,通用推理系统也该如此:维护一个认知状态,明确表达哪些是已确认的、哪些存疑、哪些已被排除、哪些问题仍然开放。而「推理」,就是一连串改变这个认知状态的「动作」—— 推导结论、拆解问题,以及最关键的:决定下一步该问什么问题、做什么计算、跑什么实验。

当然,开放世界的推理比下棋难得多。围棋棋盘上的状态完全可见、规则固定;而现实世界里,当前局面只被部分知晓,可选的动作又多又杂,行动的后果充满随机性甚至完全未知。

但好消息是,LLM 和其他神经模型这些年的进展,恰好给这件事提供了零件:LLM 可以基于已知信息和可用资源,提议解决问题的路径;可以通过 API 和代码与工具交互;可以帮助评估一个论断是否被现有证据支持。最重要的是,系统里必须有一个独立的「裁判」,按「这一步究竟消解了多少不确定性」来评估每个推理动作 —— 只有在证据支持的情况下才更新信念。规则一旦立起来,系统就能积累经过认证的知识,并从过去的推理经验中学习、改进自己的推理策略。

Graepel 给这个图景起了一个很形象的说法:打了兴奋剂的科学方法。目标只有一个,产出经得起审视的知识。

更大的系统 1,不会自动长出系统 2

文章的最后,他把态度亮得清清楚楚:靠把系统 1 做得更大,到不了可信任的机器智能。规模能磨利直觉,但磨不出审慎。

第 37 手之所以重要,是因为一台机器守住了一个局面、称量了可能的未来,然后选中了那手连它自己的「直觉」都大概率会否决的棋。

而人类社会恰恰需要更多这样的「神之一手」,在药物发现、新材料、气候、医疗诊断这些领域。那里的棋盘完全不像围棋,甚至没人把规则递到我们手上。这样的洞见,只会来自真正会推理的系统:结论出自一段可审计的证据、推断与信念修正的链条,而不是一个事后编出来的、令人信服的故事。

十年前,AlphaGo 用第 37 手告诉世界,机器可以超越人类的直觉。

十年后,它的创造者之一在提醒我们:别让流畅的语言骗了你,那一次真正的飞跃,至今还没有在 LLM 身上发生第二次。

你说LLM不会推理,站得住脚吗?

这篇观点文发表后,在 X 上引发了不小的争议。

最犀利的质疑来自多伦多大学教授 David Duvenaud(神经 ODE 那篇 NeurIPS 最佳论文的作者之一)。他提到:Graepel 给 LLM 定的三条罪状 —— 没有可检查的认知状态、知识与推理不分离、事后编造解释 —— 放在人类身上同样成立。「按这个标准,我能算会推理吗?」



Graepel 回应说:你单靠自己也推理不好;给你纸笔,就好得多;再让你严格遵循科学方法,才算得上出色的推理者。诀窍从来不是跟着意识流走,而是把过程结构化 —— 否则任何人都逃不过认知偏差。



Duvenaud 立刻抓住了这句话的弦外之音:「那听起来,我们只要给 LLM 配上类似的工具,就能按你的定义实现真正的推理了 —— 这该不会正是你打算做的事吧?」



Graepel 这套「纸笔增强论」还引来了其他网友的质疑。网友 KingBroken 指出,纸笔本质上是工作记忆的外挂,它让你能同时推理更多数据,但并没有「无中生有」地改变推理能力的存在;不过它有个额外的好处:写下来的文字和数字,恰好就是人类「认知状态」可检查的证据。



紧接着,网友 Daniel Grant 问出了一个更尖锐的问题:照这么说,人类的推理方式就等于「现有模型 + 外挂系统」,那你是在构建一个内部推理能力比两者都强的模型?还是我漏掉了什么细微差别?



对于这些质疑,Graepel 还没有给出回复。

另一种声音则压根觉得这场讨论多余。网友 visimo-dino 直言「不敢相信还有人写这种文章」:LLM 已经在太多事情上表现出色,「不会推理」的说法要么可笑、要么无关紧要,况且同类文章早就发过几百篇了。



Graepel 没有纠缠,只丢了三个问题回去:在无法验证的领域它们可靠吗?产出过强有力的新科学理论吗?你敢让它决定你的医疗方案吗?对方倒也坦率,承认「目前还没有」,但把锅甩给了现有的强化学习方法而非 LLM 架构本身 —— 言下之意,假以时日都能解决。这大概是两派人真正的分歧所在:一方认为缺的是时间,方认为缺的是架构。



还有一条评论问出了很多人心里的八卦:DeepMind 为什么不支持这项研究?Graepel 的回答算得上直白:前沿实验室都在押注 scaling,而可审计的推理无法单从 scaling 中涌现,它需要一种不同的架构。「有时候,激进的新想法在大组织内部更难实现」。提问者 Robert Sperry 的失望溢于言表:在所有实验室里,他原本最期待 DeepMind 会是那个最努力寻找 Transformer 之外答案的人。



也有人把矛头指向了更根本的地方。评论者 Katherine Moore 只留下一句话:「语言本身就是错误工具,靠它做不出可靠的推理。」Graepel 认真接住了这个更激进的立场,并顺势抛出一个开放问题:推理确实需要某种知识表示,如果自然语言太模糊,那能不能用形式化语言对现实世界推理?那样的语言会长什么样?。他没有给答案,但这或许正是接下来一些人创业要回答的问题。



参考链接:https://www.technologyreview.com/2026/10/02/1145639/dont-be-fooled-llms-dont-reason/

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
越南废除使用1800年的汉字,全民学习罗马拼音,如今造成什么影响

越南废除使用1800年的汉字,全民学习罗马拼音,如今造成什么影响

谈古论今历史有道
2026-08-21 15:10:05
狂轰9小时!基辅命脉全瘫,北约东翼告急,普京霸气嘲讽“小丑”

狂轰9小时!基辅命脉全瘫,北约东翼告急,普京霸气嘲讽“小丑”

涵豆说娱
2026-10-01 10:50:53
大家发现没,王楚钦越来越不对劲,不是球技断崖下滑,也不是长相变化,而是精气神肉眼可见地被透支

大家发现没,王楚钦越来越不对劲,不是球技断崖下滑,也不是长相变化,而是精气神肉眼可见地被透支

乒乓助手
2026-08-21 00:37:44
昂撒、犹太和华夏的巅峰对决

昂撒、犹太和华夏的巅峰对决

孝沛与世界
2026-10-04 18:10:22
扮猪吃虎?隐忍四个月,委代总统撕下面具,率几十万大军硬刚美国

扮猪吃虎?隐忍四个月,委代总统撕下面具,率几十万大军硬刚美国

好贤观史记
2026-04-23 16:53:57
刘国梁,为什么极尽资源培养王楚钦

刘国梁,为什么极尽资源培养王楚钦

中场阴谋家
2026-10-01 22:14:29
离婚时女儿选了前妻,儿子选了我,20年后女儿忽然联系我

离婚时女儿选了前妻,儿子选了我,20年后女儿忽然联系我

徐侠客有话说
2026-06-05 10:32:24
美国发现一个离谱真相:中国根本不是对手,而是打不动的底层系统

美国发现一个离谱真相:中国根本不是对手,而是打不动的底层系统

面里历史
2026-09-24 21:49:24
“天塌了”!土木老公突然失业,惠州买房亏损60万,两个年幼儿子,家庭跌入人生低谷

“天塌了”!土木老公突然失业,惠州买房亏损60万,两个年幼儿子,家庭跌入人生低谷

捣蛋窝
2026-08-03 13:25:57
天价回锅肉!成都一家店3片卖105,商家回应:500斤只能切出18片

天价回锅肉!成都一家店3片卖105,商家回应:500斤只能切出18片

西昆仑Bruce
2026-10-04 18:01:04
1984年两暴徒袭击金华武警驻地,致38名战士死伤,结局太惨

1984年两暴徒袭击金华武警驻地,致38名战士死伤,结局太惨

莫地方
2026-09-17 23:43:04
美国为何禁止种植竹子?终于明白,原来竹子比我们想象的更可怕

美国为何禁止种植竹子?终于明白,原来竹子比我们想象的更可怕

抽象派大师
2026-09-28 16:03:48
41岁朱启南谈浙江健儿亚运佳绩,如今已是副局长,22年前奥运夺冠潇洒帅气

41岁朱启南谈浙江健儿亚运佳绩,如今已是副局长,22年前奥运夺冠潇洒帅气

米修体育
2026-10-05 00:19:08
为什么华为被限制越狠越能搞出创新?

为什么华为被限制越狠越能搞出创新?

小眼睛小世界
2026-10-04 04:20:00
海外谈中国:首批两架全新F-16C/D Block 70战斗机飞抵台湾地区

海外谈中国:首批两架全新F-16C/D Block 70战斗机飞抵台湾地区

hawk26讲武堂
2026-10-03 14:08:33
米克尔:当年签约曼联是个愚蠢的错误,耽误了一两年职业生涯

米克尔:当年签约曼联是个愚蠢的错误,耽误了一两年职业生涯

懂球帝
2026-10-05 00:33:20
宋喆直播卖枣笑塌全网!百万流量零成交,满屏王宝强弹幕扎心到爆

宋喆直播卖枣笑塌全网!百万流量零成交,满屏王宝强弹幕扎心到爆

誮惜颜a
2026-01-13 01:12:10
血泪教训!尽量不要跟身边任何人,包括你的父母妻儿,分享3件事

血泪教训!尽量不要跟身边任何人,包括你的父母妻儿,分享3件事

小影的娱乐
2026-10-05 00:05:05
DuDuDuDu!维斯塔潘赛季首冠!勒克莱尔力挽狂澜回归第四!

DuDuDuDu!维斯塔潘赛季首冠!勒克莱尔力挽狂澜回归第四!

五星体育
2026-10-04 18:39:33
“充电至80%必须离场”,假期遇电车充电高峰,不少网友:等得人麻了;交通运输部:10月5日和6日充电车辆将大增,这些服务区会特别繁忙

“充电至80%必须离场”,假期遇电车充电高峰,不少网友:等得人麻了;交通运输部:10月5日和6日充电车辆将大增,这些服务区会特别繁忙

大风新闻
2026-10-04 20:07:06
2026-10-05 02:43:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14123文章数 142744关注度
往期回顾 全部

科技要闻

苹果确认:iPhone 18 Pro Max有问题

头条要闻

30多岁中国夫妇在澳洲遇惨烈车祸丧生 肇事司机仅17岁

头条要闻

30多岁中国夫妇在澳洲遇惨烈车祸丧生 肇事司机仅17岁

体育要闻

32胜0负!德约2-1逆转头号种子兹维列夫 第7次晋级中网四强

娱乐要闻

高晓松悄悄复出:官媒没给他留体面

财经要闻

OpenAI前安全部门员工:公司文化已崩坏

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

本地
艺术
时尚
公开课
军事航空

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

艺术要闻

震惊!吴冠中为何把自己的画展叫“叛徒画展”?真相远比你想的扎心!

谭卓&胡一天,邀你一起“网”下面基

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

驻冲绳美军士兵抢劫杀人 日本向美国提出抗议

无障碍浏览 进入关怀版