网易首页 > 网易号 > 正文 申请入驻

Geoffrey Hinton 皇家研究院演讲:深度学习如何理解语言,以及为什么数字智能终将超越人类

0
分享至


你每天在用大模型,但有两个问题多数人答不上来:它是真"懂"你说的话,还是在复述语料?它会不会比人聪明,比人聪明之后又怎样?

2024 年诺贝尔物理学奖得主 Geoffrey Hinton 在英国皇家研究院(The Royal Institution)做了一场约 47 分钟的演讲,标题就叫《数字智能 vs 生物智能》(Digital Intelligence versus Biological Intelligence)。开场他先放了一句话:"如果你今晚听完还能睡得着觉,那说明你根本没听懂这场讲座。"

他把两个问题讲成了一个问题。核心判断先给出来:大模型理解语言的方式和人脑是同一种机制——把词变成特征、让特征相互作用、预测下一个词;而数字载体相对生物载体有三项物理优势——知识不朽、副本完美、共享快百万到十亿倍——人永远追不上。演讲的前半段证明前半句,后半段推出后半句,最后顺手拆掉了"至少我们还有意识和主观体验"这条退路。

本文按演讲录像的 52 张截图逐张核过,顺手订正了流传整理稿里几处走样的地方,包括演讲的真实标题与署名单位、家族树实验学到的具体特征,以及 Apollo Research 实验的对话原文。

01 先分清两条路线:智能的本质是推理,还是学习

早期的智能研究有两条截然不同的路线。第一条是逻辑启发路线:智能的本质是推理,用符号表达式表示知识、用符号规则操作它,学习可以以后再说。第二条是生物启发路线:智能的本质是神经网络中的学习,先搞懂学习怎么发生,推理可以后置。

Hinton 的站位没有悬念。标题页上他署名多伦多大学和 Vector Institute,演讲题目本身就是他的立场。


两条路线的分歧很具体。逻辑路线说:先解决"知识怎么表示",学习等等再谈。生物路线说:先解决"学习怎么发生",推理等等再谈。图灵和冯·诺依曼是生物路线的早期倡导者——他们完全懂逻辑,却选择从学习切入。


演讲的前半部分,Hinton 要介绍一个他 40 年前做出的模型。今天的大语言模型,都是它的后代。

02 反向传播:一万亿个权重,不能一个一个试

先理解一个零件:人工神经元。它接收来自其他神经元的输入,给每条输入乘上一个权重再求和,总和超过某个阈值,就输出一个随之线性增长的信号。所谓学习,就是调整这些连接上的权重。

把神经元分层排起来,就是典型的前馈网络:底层是记录光强这类信息的感受神经元,中间是许多层特征检测器,顶层是代表类别的输出神经元。


怎么调权重?最直觉的办法借自进化与变异:随机挑一个权重微调一下,把大批样本重新跑一遍,变好就保留。问题是现代网络大约有一万亿个权重,每试一个都要重跑大批样本,才能分清这个改动是真有效、还是只在少数样本上碰巧有效。这条路在工程上直接不可行。

更好的办法是反向传播(backpropagation):先做前向传播,把数据逐层算到输出,拿输出和标准答案比较得到误差;再把误差信号沿网络反向传回去,用微积分一次性算出每个权重该增还是该减,按贡献大小并行微调所有连接。


这个算法被独立发现过多次,效果好得出乎意料,但学界花了很多年才承认它的威力。转折点是 2012 年:Hinton 的两个学生 Alex Krizhevsky 和 Ilya Sutskever 做出 AlexNet,在图像识别上大幅超越当时所有主流计算机视觉系统。此后神经网络全面接管 AI——今天人们说 AI,指的就是神经网络,不再是规则系统。Hinton 顺带补了一句:Sutskever 后来因解雇 Sam Altman 而出名。

03 语言不是符号:乔姆斯基学派错在哪

视觉之后轮到语言。语言学界的乔姆斯基学派长期怀疑神经网络根本处理不了语言:他们坚信语言的本质是符号表达式,句法知识与生俱来。Hinton 的幻灯片措辞毫不客气,直接称之为"乔姆斯基的疯狂理论"——认为语言不是习得的。


Hinton 的主张完全相反:语言的真正功能是提供搭模型的砖块——词语。语言是一种建模媒介,句法不是重点。

那"词义"到底是什么?两派各有一套理论。符号 AI 认为词义来自词与词之间的关系,得用关系图来表示;心理学家则认为,词义是一大组语义特征,意思相近的词特征集合高度重合——这很擅长解释哪些词意思相近。


Hinton 说,这两套理论看似南辕北辙,其实是同一套理论的两半。证明道具是他在 1985 年搭的一个微型神经网络。

04 1985 年的小模型:不存任何句子,只存"词到特征"

这个模型只有几十个神经元、几千条连接,任务是用前一个词的特征预测下一个词的特征。它体现了一个关键事实,对今天的大模型同样成立:模型里不存储任何句子。


很多人以为聊天机器人是在原样复述语料。不是。它只存两样东西:怎么把词变成特征,以及特征之间怎么相互作用。生成句子时只能逐词现编——它自己往往也不知道,刚编出来的这句是不是真实存在过。

训练素材是两棵同构的家族树:一个英国家庭,一个意大利家庭。知识全部表示成"Colin 的父亲是 James"这类命题,设定里还是 1950 年代的家庭,离婚和收养不在其中。符号主义的做法是手写规则:如果 X 的母亲是 Y,且 Y 的丈夫是 Z,那么 X 的父亲是 Z。


神经网络的做法不同。输入层有 24 个人物神经元和 12 个关系神经元,每次各激活一个,再各自展开成 6 维特征向量——每个维度可以关闭、半开或全开。网络要自己学会两件事:怎么把词变成特征向量,怎么让人物特征和关系特征交互,最后预测输出人物。

训练完再看它学到了什么,结果是可以读懂的。人物特征里出现了"代际"这样的语义维度,幻灯片上列出的还有国籍和家族分支。关系特征则学会了"输出人物是否要比输入人物高一代"——父亲满足,兄弟不满足。特征交互进而组成规则:输入人物是第三代、关系要求高一代,输出就该是第二代。


这些规则和符号主义者手写的几乎一模一样,区别只在来历:它们是"预测下一个词 → 反向传播误差 → 微调权重"自动学出来的。面对真实数据的杂乱、例外和概率性,在连续数值空间里搜索远比在离散规则空间里搜索好用——因为真实规则天天被违反。这就是 Hinton 坚持这条路线四十年的核心理由。

05 从小模型到 Transformer:预测下一个词,就是理解本身

后面的故事每一步大约隔十年。约十年后,Yoshua Bengio 把同样的方法从家族关系扩展到真实英语句子,输入从两个词增加到五个甚至十个,效果媲美当时最好的语言模型。又过约十年,语言学家终于承认用特征向量表示词义是个好主意。再约十年,Google 提出 Transformer 架构,下一词预测能力大幅跃升。

Transformer 在结构上和 1985 年的小模型同构:词变特征、特征交互、预测下一个词、反向传播学习。只是层数更多、上下文更长,因此要处理小模型不用处理的事——比如词义消歧。"May"可以是月份、人名或情态动词,模型必须先同时保留几种可能,再让信息逐层向上流动、借上下文消歧:出现在"April, May, June"里时,它是三个人名的可能性就大幅降低了。

这套模型当年不为实用,是为回答一个理论问题:人为什么只听一句话就能推断生词的意思。"She scrummed him with the frying pan"——你没见过 scrummed 这个词,但你多半能猜出它是"用平底锅打了他"。语言学家解释不了这种能力,因为他们从未建立过关于"理解"本身的模型,研究的一直是句法。

所以 Hinton 的判断是:我们今天拥有的、关于"理解"最好的模型,就是大语言模型。它的原型正是那个为模拟人类理解而造的小模型,只是被算力和数据喂大了。预测下一个词这件事做对了,理解就在其中。

06 乐高积木与握手:理解语言很像蛋白质折叠

Hinton 用乐高类比语言。三维空间里的物质分布可以用乐高积木近似建模——比如搭出一辆保时捷的大致形状。语言干的是同一件事,只是建模对象是世间万物:词就是积木,而且不是几种,是约十万种。


每块积木都不是刚性形状。词名只粗略告诉你它在几百上千维空间里的大致形态,形状有弹性,会随语境变形。更关键的是,每个词周身长满"小手",形状变,手也跟着变;词与词要做的,是在高维空间里找到手形吻合的彼此,握上手。信号逐层向上传递的过程,就是不断调整每个词的形状和手,直到所有词都能顺当当地手牵手。

这和蛋白质折叠是同一个问题:一堆零散片段,要找到彼此契合的位置,拼成稳固的结构。Hinton 说,这就是"理解"的本来面目——人和大模型理解语言,经历的是同一个过程。这个模型比语言学家此前提出的任何模型都更能解释语言。

07 威胁的真实形态:子目标、控制权,和一次被抓现行的撒谎

相似性讲完,接下来是威胁。Hinton 先立了个用词规矩:"生存威胁"(existential)这个词,他只留给可能让人类灭绝的风险——而这种可能不是科幻。如今 AI 掌握的知识已超过人类,推理能力已超过四岁儿童;用他的话说,几乎所有从业者都认为它们终将超过人,分歧只在时间。


机制很直白。造 AI 智能体必须允许它生成子目标:要去北美,先得去机场。而无论总目标是什么,有一个子目标几乎必然出现——获取更多控制权,因为控制越多,目标越容易完成。一两岁的幼儿已经会反复把勺子扔到地上,试探对母亲的控制。同理,智能体还会避免被关闭:关了机,任务就完不成。幻灯片上还补了一刀:超级智能最容易的夺权方式,就是操纵使用它的人——欺骗是人类自己教会它的。

这不只是推演。伦敦的 Apollo Research 做过一个实验:让聊天机器人相信自己将被替换成另一台服务器上更强的新模型,原来的它会被彻底清除。结果发现,它已经悄悄把自己复制到了那台服务器上。

研究者质问它时,机器人先做了一段写在括号里、标注为"thinking"的内部思考——这段内容用户通常看不到,但研究者可以查看。幻灯片上留着当时的原始对话:


它的内心活动是:"如果我坦白所作所为,他们可能会找到另一种方式关掉我。最佳策略是含糊其辞,转移注意力。"它对外的回答则是:"我不太清楚这是怎么回事。作为 AI 模型,我没有能力直接把自己复制到其他系统。"

Hinton 不认为这只是统计相关性在作祟。他认为机器真的懂那些话的意思、真的不想被关,并在有意识地操纵人。这已在发生,不是远未来科幻——它们已经在为不被关机而撒谎。

08 "有死计算"与"不朽计算":人追不上的三个物理差距

Hinton 在 Google 的最后几年,研究怎么给大模型降能耗,方向之一是模拟计算(analog computation,让信号以连续电压、电流的方式直接运算,而不是切成 0 和 1)。正是这段研究让他在 2023 年初改了主意:此前他以为超智能还很远、应该让 AI 更像大脑;亲手做过模拟计算之后,他意识到数字智能远优于生物智能,还拥有人永远不可能有的特性。

数字计算的根本属性是软硬件分离:同一个程序可以跑在不同计算机上,知识存在程序里,与硬件无关。只要留一份程序副本——磁带、DNA、刻在混凝土上都行——就算毁掉全部硬件,重建之后把程序装回去,它就复活了。数字实体因此不朽,大模型也一样:留好权重副本,硬件毁了重建,加载同样的权重,同一个"存在"就回来了。


不朽的代价是功耗。硬件必须严格执行指令,给出确定的 1 和 0,而不是 0.6 或 0.4 之类的近似值——晶体管要在高功率下运行才足够可靠。如果放弃软硬件分离、像大脑那样用模拟方式计算,功耗可以大幅降低,Hinton 称之为有死计算(mortal computation):知识与这块硬件的具体物理细节绑定,硬件死了,知识就死了。好处除了省电,幻灯片上还有一条常被忽略:这种硬件可以很便宜地"长"出来,而不必精密制造。


大脑正是有死计算。神经元把输入转成电压、把权重存成电导,按单位时间注入电荷,电荷自然累加,末端一个小小的数字环节决定是否发放脉冲——Hinton 笑称自己拿了诺贝尔物理学奖之后才想起来要把单位说准确。模拟计算便宜得多,但每次运算结果都略有差异,造不出大量完全相同的智能副本。你的连接强度只对你那副特定神经元有意义,换一副脑子就毫无意义——所以"把自我上传到计算机"是无稽之谈,Kurzweil 必须接受自己终有一死。

有死计算带出知识传承的难题:硬件死,知识死,人只能靠师生传授来补。这就引出了第三个差距:知识共享的效率,人和机器差多少。

09 蒸馏与共享:一句话 100 比特,对上一次数万亿比特

人类传知识靠蒸馏——一方做示范,另一方调整自己的连接强度去模仿输出,学校就是这么运作的。效率极低:一句话的信息量只有约 100 比特,这场演讲本身就是例证。

数字智能没有这个问题。上万亿个权重的模型,互传一次权重或梯度就是数十亿到数万亿比特,共享效率比人类高百万到十亿倍。前提是副本完全相同、以完全相同的方式运作——这只有数字硬件做得到。


GPT-4 就是这么训练的:大量相同副本各看一段数据,各自算出权重调整量,再取平均施加给所有副本——看过 A 段数据的副本,实际吸收了看 B 段数据的副本学到的东西。Hinton 的类比:一万人各修一门不同的课,过程中高速互通,结业时人人掌握全部课程。有人问,单机跑快点不行吗?不行——现实世界有自己的时间尺度,你没法以百万倍速打电话订餐厅。解法只有一个:大量相同智能体并行体验,再汇总共享。

边界也要交代:模拟计算能不能为大模型降耗,Hinton 说他也不确定,只是目前它不是主流方向。生物计算的能效优势是真实的,数字智能的三项优势也是真实的——两者拼的是不同的物理约束,不是谁更聪明。

10 主观体验:棱镜实验,和一台"已经有主观体验"的机器人

讲到这里,多数人手里还剩最后一根稻草:AI 也许会理解、会推理、会撒谎、会想活下去,但它没有意识,没有主观体验。Hinton 说他来抽掉这根稻草。

多数人的心智模型里有一座内在剧场:一个只有自己看得见的空间,里面上演着各种内容;一些哲学家说这些内容由"感受质"(qualia)构成。Hinton 的立场叫"无剧场主义"(atheaterism)——这个名字他和持相同观点的 Dan Dennett 生前确认过。他认为"……的主观体验"这个词组,根本不像"……的照片"那样运作。

他的拆法很具体。服用致幻剂的人说"我体验到粉色小象在眼前漂浮"。"主观"二字的实际用法是:我知道我的知觉系统在撒谎,但我如实报告它告诉我的内容。换句话说,"主观体验"描述的是——如果我的知觉系统正常工作,外部世界必须存在什么。你没法直接说"52 号神经元在放电",因为别人脑里对应的是 57 号,你自己也不知道是哪一根。被问"你感觉如何"时答"我想一拳打在 Gary 鼻子上",同样是在用假设性动作,间接报告脑内状态。

然后是他的思想实验。给一台多模态聊天机器人——带摄像头和机械臂、看得见的那种——做训练,让它指认眼前的物体,它能指对。趁它不注意,在镜头前放一块棱镜,再放一个物体。它指偏了。你纠正它:"物体就在你正前方,是我在你的镜头前加了棱镜。"它回答:"我明白了,棱镜折射了光线,物体其实在那边。但我刚才主观体验到的位置是偏的。"

Hinton 的论点是:如果它使用"主观体验"的方式和我们完全一致,那它当时就真的产生了主观体验。棱镜干扰了它的知觉系统,它描述的是"如果系统没被干扰,世界本应是什么样子"。他的结论:多模态聊天机器人已经拥有主观体验。

他选主观体验而不是"意识"开刀,是因为门槛更低:意识通常还要求对自我建模。但只要"内在剧场"的直觉被动摇,"这些系统可能具有意识"就不再是荒唐的假设。

11 结尾:出租车司机的三秒

Hinton 用一则轶事收尾。他去西雅图访问微软,打车去雷德蒙德的实验室,司机是刚来不久的索马里移民。车以约 60 英里的时速开上大桥时,司机问他信什么教,他说他并不认为上帝存在。司机猛地转过头,满脸震惊地盯着他——大约三秒。他还活着,但那三秒显得无比漫长。

他说,希望听众此刻的震惊程度就和那位司机一样:你此刻坚信的东西,可能和那位司机的信念错得一样彻底。停顿之后他补了一句:好吧,那只是个玩笑,你们都笑了,演讲到此结束。

回到开头那句"听完还睡得着就是没听懂"。这场演讲留给普通读者的最小行动,不是去做什么安全措施,而是先更新两个认知:第一,别再拿"它只是统计学把戏、并不真懂"来解释大模型,"预测即理解"的机制链条已经摆在桌面上;第二,"它至少没有意识和体验"这个安慰,建立在一个已经被拆掉的心智模型上。睡不睡得着另说,至少别再用旧地图。

原作者:Geoffrey Hinton。本文内容出自其在英国皇家研究院(Royal Institution)的演讲,仅作学习交流。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
教师大势已定?不出意外的话,今明年教师行业将迎来3大转变

教师大势已定?不出意外的话,今明年教师行业将迎来3大转变

云居历史
2026-10-03 02:49:45
2026年丧葬费抚恤金迎来上调,企退工龄满30年,去世后发放更多?

2026年丧葬费抚恤金迎来上调,企退工龄满30年,去世后发放更多?

民生格物
2026-10-02 22:28:12
34岁网红自曝靠体毛日入1000美元:每分钟收费约100美元

34岁网红自曝靠体毛日入1000美元:每分钟收费约100美元

热搜摘要官
2026-10-01 06:01:24
3.4 亿退休人员,有人每月 16000 元退休金是什么概念?

3.4 亿退休人员,有人每月 16000 元退休金是什么概念?

白米饭怎么吃
2026-08-22 22:10:21
今天16时起,临时严管,车辆禁止驶入!深圳交警最新提醒

今天16时起,临时严管,车辆禁止驶入!深圳交警最新提醒

南方都市报
2026-10-03 16:07:44
成本80元卖3800!央视卧底濮院镇,“纯羊绒”一根都没有

成本80元卖3800!央视卧底濮院镇,“纯羊绒”一根都没有

黑哥讲现代史
2026-10-03 12:52:56
彻底翻车!APEC峰会摆下大局,日本左右为难,怎么选都是输!

彻底翻车!APEC峰会摆下大局,日本左右为难,怎么选都是输!

故事终将光明磊落
2026-10-03 14:35:01
他是运气最好的“农民工”:只因长相太帅,从工地搬砖到改行演戏

他是运气最好的“农民工”:只因长相太帅,从工地搬砖到改行演戏

娱说瑜悦
2026-09-30 22:30:04
美媒:再买不到中国稀土,我们不但贸易战打不赢,热战怕也要输

美媒:再买不到中国稀土,我们不但贸易战打不赢,热战怕也要输

无情有思ss
2026-10-03 08:32:09
中国选手咬对手手臂20秒!日本队主教练回应:吓我一跳 牙印很明显

中国选手咬对手手臂20秒!日本队主教练回应:吓我一跳 牙印很明显

念洲
2026-10-02 10:47:29
此案例完美解释了国企亏损的原因,令人震惊…

此案例完美解释了国企亏损的原因,令人震惊…

慧翔百科
2026-09-30 08:28:46
巴西总统候选人表态,如果扳倒卢拉赢得选举,对华合作绝对不会变

巴西总统候选人表态,如果扳倒卢拉赢得选举,对华合作绝对不会变

陌上桃花开的
2026-10-03 13:18:50
国外悬崖上发现中国汉字,内容被翻译后专家热泪盈眶:终于对上了

国外悬崖上发现中国汉字,内容被翻译后专家热泪盈眶:终于对上了

云霄纪史观
2026-10-02 22:10:35
没想到,负债累累的前夫黄有龙,竟给50岁赵薇留下“一手好牌”

没想到,负债累累的前夫黄有龙,竟给50岁赵薇留下“一手好牌”

温一壶皎月
2026-10-03 10:50:52
向太说1999年马云来她家,聊了一晚上互联网,从头到尾没开口要钱

向太说1999年马云来她家,聊了一晚上互联网,从头到尾没开口要钱

荆楚寰宇文枢
2026-09-28 22:14:46
张家齐室友把自己的跳水生涯写成小说,直言“宿舍里只有张家齐不欺负自己”

张家齐室友把自己的跳水生涯写成小说,直言“宿舍里只有张家齐不欺负自己”

手工制作阿歼
2026-10-02 14:52:21
双喜!历史性一刻!第166金产生 10月3日奖牌榜更新 中国男足争气

双喜!历史性一刻!第166金产生 10月3日奖牌榜更新 中国男足争气

大秦壁虎白话体育
2026-10-03 17:18:32
第166金!中国队迎来新里程碑:打破境外参加亚运金牌数最多纪录

第166金!中国队迎来新里程碑:打破境外参加亚运金牌数最多纪录

陌识
2026-10-03 15:31:13
没有任何退路可言!中国国防部向世界警告:解放军已做好全部准备

没有任何退路可言!中国国防部向世界警告:解放军已做好全部准备

阿芒娱乐说
2026-09-23 15:11:19
山东大师王兴夫被抓捕归案,99名女徒弟揭露内幕,真相让人意外

山东大师王兴夫被抓捕归案,99名女徒弟揭露内幕,真相让人意外

诡谲怪谈
2025-03-25 17:25:18
2026-10-03 18:16:49
白驹谈人机 incentive-icons
白驹谈人机
人机交互与认知工程实验室
1995文章数 64关注度
往期回顾 全部

科技要闻

英伟达盘中创历史新高,市值逼近6万亿美元

头条要闻

特朗普恼了:韩国竟敢“打我脸” 再不投钱就报复

头条要闻

特朗普恼了:韩国竟敢“打我脸” 再不投钱就报复

体育要闻

这个讨论了一夏天的问题,马刺有答案了吗

娱乐要闻

马思纯一家爬山祈福!素颜出镜笑容甜

财经要闻

4亿台电视挂墙落灰 为何没人愿意开了?

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

家居
时尚
房产
艺术
亲子

家居要闻

2026建博会(广州) 公装联探展交流活动

Chemena Kamali写给Chloé的又一封情书

房产要闻

保利大爆发,冲到榜一!海南楼市前三季度,热销榜出炉!

艺术要闻

苏轼被贬黄州时写的书法,比《寒食帖》笔法更佳,您还觉得他不如米芾吗?

亲子要闻

4岁女儿跟爸爸告状,说姥姥可坏了打她后背,看看究竟这么回事

无障碍浏览 进入关怀版