![]()
一个足月婴儿出生时,大脑皮层已经有了近似成人的复杂褶皱。可如果把这些脑沟和脑回全部展开,它的皮层表面积只有成年人的大约三分之一。
接下来,大脑并不会像气球那样均匀膨胀。
2010年,研究者比较了12名足月出生婴儿与12名健康年轻成人的皮层表面。结果显示,岛叶和内侧枕叶的相对扩张较少;外侧颞叶、顶叶和额叶的一些区域,则扩大了接近前者的两倍。出生时已经十分复杂的皮层,在成年之前仍会经历一场高度不均匀的重新分配。
研究者随后把这张“婴儿到成人”的扩张地图,与猕猴到人类的皮层差异进行比较。两张地图呈现出相似的空间模式:在人类演化中扩张较多的区域,往往也在人出生以后继续经历较多扩张。这个结果提示同一些皮层区域,在两个完全不同的时间尺度上,都保留了较大的生长余地。
为什么是这些区域?
早期视觉等感觉系统相对成熟得更早,许多额叶、顶叶和颞叶联合区域则扩张得更多,成熟得更晚,也更容易受到漫长童年经验的塑造。
一个婴儿将来可能学会说两种语言,理解负数,想象一场尚未发生的谈话,或者用一套符号推导另一个星系的运动。这些能力并没有以缩小版本预先藏在新生儿的大脑里。
最初出现的,只是更多组织、更多连接、更多尚未确定用途的神经状态。
哺乳动物皮层在演化中扩大了几个数量级,厚度却没有同比增加。人的皮层也没有变成一块厚厚的神经组织;它仍然是一张只有几毫米厚、面积却很大的薄层,被折叠进颅腔。
Pasko Rakic提出的径向单元假说,为这种几何结构提供了一个有影响力的解释。
胚胎发育早期,增殖区中的神经祖细胞产生一批批沿径向迁移的神经元。若一个祖细胞谱系产生更多神经元,皮层可能有所增厚;若祖细胞群体在生成神经元之前经历更多对称分裂,就会产生更多并排排列的径向发育单元,主要结果是皮层表面积扩大。
Rakic据此解释了一个显著事实:哺乳动物皮层表面积在演化中增加了超过一千倍,皮层厚度却没有发生相近幅度的变化。进化采用的方案,很大程度上是增加横向单元,而非不断加厚同一小块皮层。
这很像工程中的 scale-out:不制造一个越来越巨大的处理器,而是增加更多并列的处理资源。
重复的究竟是什么
在很多皮层区域中,人们都能看到相似的基本材料:分层排列的锥体细胞,PV、SST、VIP等不同抑制性细胞,局部兴奋—抑制相互作用,以及跨层的前馈和反馈连接。
这使人很容易设想,皮层拥有某种反复使用的局部回路语法。视觉皮层、运动皮层和前额叶皮层使用相近的细胞类型与层状结构,却因输入、输出、发育历史和突触权重不同,形成完全不同的功能。
已有研究描述过由不同兴奋性和抑制性细胞构成、反复出现的径向细胞簇,并提出这些“微柱”可能是皮层处理的重复模块。不过,这类结构是否构成跨脑区普遍存在的固定计算单元,领域内仍无共识。
即使大脑存在某种可重复的局部回路,它在复制以后也不会长期保持完全相同。
一组最初相近的回路,只要占据网络中的不同位置,便会接收到不同输入,向不同目标投射,并受到不同神经调质和行为经验影响。发育中的细微差别经过活动依赖性可塑性反复放大,最终可以形成感觉区、运动区和联合区之间的功能分化。
新增单元带来的,并非一排永远执行同一操作的副本。
规模扩大提供了更多位置;网络连接赋予这些位置不同关系;学习再使这些关系稳定下来。演化过程中同时发生了复制、分化和重新连接。
这一步很关键。单纯复制只能提高吞吐量。复制之后发生分化,才可能扩大系统所能表示的问题种类。
规模先扩大了“可区分的世界”
假设一个神经系统只能用一条内部坐标轴表示外界。
这条轴也许足以区分左和右,却难以同时编码物体身份、颜色、位置、时间顺序、当前规则和行为目标。不同情境会投影到相近位置,下游回路很难判断应该采取哪一种反应。
增加神经元不会自动解决这个问题。如果新增细胞总是携带同样的信息、受到同样的噪声、做出相同的响应,系统得到的只是更多副本。
有用的扩展需要增加差异。
2013年,研究者分析了猕猴完成物体序列记忆任务时的前额叶神经元活动。许多单个神经元的响应并不整齐:它们同时受到物体身份、出现顺序、任务类型和时间阶段等多个因素影响,很难被简单命名为“物体神经元”或“顺序神经元”。
放到群体层面,这种杂乱呈现出计算意义。不同神经元以不同的非线性方式混合任务变量,使群体活动进入较高维度的状态空间。各项任务信息仍然可以从群体中解码,而且高维表征允许下游神经元实现更丰富的输入—输出映射。在动物答错的试次中,这种维度会下降。
所谓“高维”,可以用一个简单的例子理解。
假设网络需要分别处理:
·红色圆形;
·红色方形;
·蓝色圆形;
·蓝色方形。
如果细胞只分别编码“红/蓝”和“圆/方”,这四种情况落在一个结构较简单的表征空间里。若另一些神经元只在“红色圆形”或“蓝色方形”这类变量组合出现时响应,四种情境便能被进一步拉开。下游回路更容易为其中任意一种组合指定不同反应。
数量在这里没有直接变成智能。
它先提供了更多相互独立、又能混合变量的活动方向。系统因而能够区分此前重叠的情境。
更多经过分化的单元→更高维的任务表征→更多可以被学习的分类与映射
不过,高维活动本身还不够。
网络可以产生极其复杂的信号,却没有任何下游回路能够稳定读取。它也可能表示大量与任务无关的细节,反而增加学习难度。
真正具有计算价值的,是可区分、可保持、可读出并能影响行为的状态。
如果每个单元只有两个状态,N个单元在数学上就有:
2ᴺ
种可能组合。
这个数字增长得极快。100个二元单元的组合数,已经远远超过任何动物一生可能经历的情境数量。
但真实脑并没有因此获得近乎无限的能力。
绝大多数理论上的活动组合可能永远不会出现;一些状态不稳定,稍有噪声就会消失;一些彼此过于相似,无法被下游区分;还有一些虽然能够出现,却无法通过学习可靠地到达。
因此,网络规模需要解释的是,其中有多少状态可以被可靠进入、保持、分离、转换和重新调用?
一个较大的网络可以拥有更大的状态空间。连接结构则在这个空间中划出可行路径。
有些路径会把系统带回熟悉状态,形成记忆或习惯;有些路径会依次穿过一系列状态,形成动作或思维序列;还有一些状态会因为竞争和抑制而彼此排斥,使系统在几个选择之间作出决定。
从动力系统的角度看,扩展网络并不只是增加更多坐标。新增单元及其连接会改变整个状态空间的地形。
一个原本无法维持的活动模式,可能在回路扩大后成为稳定状态。
两种原本混在一起的轨迹,可能被分开。
此时出现的新能力,并不一定来自某个新发明的基本运算。它可能来自旧运算,获得了新的稳定条件。
设想一个任务需要连续完成20个步骤。
如果每一步独立成功的概率都是90%,只要有一步出错,整个过程就失败,那么完整成功率只有:
0.9²⁰ ≈ 12%
把每一步的可靠性从90%提高到99%,完整成功率变为:
0.99²⁰ ≈ 82%
局部性能只提高了九个百分点,外部表现却从“几乎不会”变成“多数时候会”。
系统没有突然获得一种全新的基本操作。原本存在的操作变得更可靠,较长的组合过程因而越过了可用门槛。
许多高级行为都具有这种结构。复杂心算、句法理解、计划和推理需要保存中间结果;早期步骤的错误会传播到后面;工作记忆中丢失一个变量,可能使整段过程失去意义。
规模可以通过多种方式提高这种可靠性:
·更多神经元可以提供冗余;
·更丰富的表征可以减少不同情境之间的混淆;
·更强的抑制和竞争可以降低无关状态干扰;
·更稳定的循环连接可以维持中间结果;
·专门化回路可以把原先漫长的过程压缩成一个熟练的步骤。
连续的小幅改善,在多步任务中会被乘起来。行为结果于是可能表现出明显的门槛。
人工智能研究提供过一个有启发性的提醒。一些被称为“大模型涌现能力”的跃迁,在改用连续评分指标后会变得平滑;原先的突然出现,部分来自“答案必须完全正确才得分”这样的离散评价方式。这个结果并没有消除所有真实的能力变化,却说明一条陡峭的行为曲线,不能单独证明系统内部在同一位置诞生了全新算法。
规模会改变网络中的因果关系
在一组彼此独立的处理器中,增加单元主要提高并行速度。
神经系统是递归网络。一个区域的输出可以到达另一个区域,又通过反馈回到原来的回路。此刻形成的状态,会成为下一刻计算的起点。
当单元数量和连接层级增加,变化的不只是“每秒能处理多少信息”。系统开始拥有更长的内部因果链。
·一个视觉表征可以被工作记忆保持;
·被保持的表征可以与过去经验比较;
·比较结果可以改变注意方向;
·新的注意输入又会修改最初的视觉表征。
这已经不再是一条从输入到输出的单向流水线。系统正在处理自己刚刚产生的结果。
假设有N个模块,可设想的两两关系数量为:
N(N − 1) / 2
真实大脑不会建立全连接,能量、空间和干扰都会使这种方案失败。但这个简单关系说明了一点:增加一个模块,除了增加一份局部处理能力,也增加了它可能参与的关系。
而关系可以成为新的计算资源。
一个回路负责识别当前刺激,另一个回路维持目标,第三个回路评估误差。三者相连以后,系统得到的功能并不只是三个局部功能的并列:
识别 + 目标 + 误差
可以组成:
根据误差修改下一次识别和行动
这里出现了一种新的闭环。
规模增长给系统增加的,常常正是这种闭环的数量、长度和层次。
随着中间结果能够被保持、传递和再次输入,系统可以执行更长的计划,比较更多候选未来,或者评估自己刚才采用的策略。所谓“表征的表征”,并不必然需要一种专门的元认知神经元;它也可能来自一个回路把另一个回路的状态当作自己的输入。
这提供了规模产生新能力的第二种解释:
新增资源让系统能够对自身的中间结果继续运算。
一旦发生这一步,数量增加开始改变计算的深度,而不只是宽度。
如果高级认知主要与皮层有关,人们很容易把脑演化写成一部皮层不断扩张的历史。
跨物种神经元计数使这幅图景显得不够完整。
一项覆盖19种哺乳动物、横跨多个演化类群的比较研究发现,大脑皮层与小脑的神经元数量呈高度协调的变化。研究者据此提出,认知演化不宜只归结为“新皮层化”,还应考虑皮层—小脑系统作为一个功能整体的协同扩展。
这不表示每个脑区都按固定比例同步增大,也不表示皮层与小脑承担相同运算。它揭示了一个更一般的约束:
一个系统扩大以后,与它协作的系统也可能需要调整。
·皮层可以产生更多感觉与抽象表征,海马相关回路却需要把一部分经验保留下来;
·皮层可以生成更多候选行动,基底节相关回路需要在其中选择;
·皮层可以容纳更多状态,丘脑—皮层循环需要调节哪些状态得到维持和传播;
·更复杂的动作和认知序列,也要求预测、时间控制与误差校正系统能够跟上。
这些关系不能被压缩成一张简单的“脑区功能表”。它们共同说明,大脑中的能力往往跨越多个结构。
假设某一部分不断增加资源,另一个必要环节保持不变,整体收益迟早会进入平台。更多状态产生了,却无法保存;更多候选方案出现了,却无法选择;更多局部计算完成了,却无法传送到需要它的地方。
此时,扩张最慢的环节决定了系统表现。
当这个瓶颈得到改善,其他区域早已存在的容量可能一起变得可用。外部看起来像突然出现的新能力,内部发生的则是一组先前无法协作的过程,终于完成了闭环。
增加网络规模会制造新的计算资源,也会制造距离。
较小的大脑中,许多神经元可以通过较短轴突交换信息。随着皮层面积增加,远距离区域之间的纤维必须变长。跨物种数据表明,较大脑中的皮层白质体积相对于灰质增长得更快;长程通信的空间代价,随规模扩大而变得越来越显著。
能量同样不能忽略。
一项基于啮齿类与灵长类数据的分析发现,在所研究的物种中,平均每个神经元的葡萄糖消耗相对稳定,整个脑、皮层和小脑的总能量使用与神经元数量近似呈线性关系。人脑只占体重约2%,却使用全身约20%的能量,很大程度上可以由其庞大的神经元数量解释。
一个更大的大脑因而不能任意增加长程连接,也不能让所有神经元持续高强度活动。
它必须选择。
·大量信息在局部处理;
·只有一部分结果被送往远处;
·不同回路在不同时间得到访问机会;
·稀疏连接减少代谢和布线成本;
·模块化降低相互干扰;
·层级结构使局部结果可以被逐步汇总。
这造成一个有趣的反转。
规模起初增加了可能连接的数量,资源约束又迫使网络放弃绝大多数连接。最终形成的智能架构,部分来自新增资源,部分来自系统如何处理新增资源带来的负担。
模块、层级、稀疏性和选择性通信,可能并非扩展之前就已完整存在的设计。它们也可能是大规模神经系统为了避免被自身连接成本淹没,而逐渐形成的组织方式。
这样看,规模没有简单地放大旧结构。
它向系统施加了新的问题,而解决这些问题的结构本身,后来成为高级计算的一部分。
回到那张婴儿皮层扩张地图。
外侧颞叶、顶叶和额叶的一些区域在出生以后扩张较多,同时也与人类相对于猕猴扩张较多的区域相似。原研究者提出一种可能解释:演化中较晚扩张的区域,在出生时保持较低成熟度,可能因此受到童年经验更大的影响。这个解释仍属于假说,现有数据并没有直接证明扩张区域一定因“未完成”而获得高级认知。
Randy Buckner和Fenna Krienen后来提出过一个相邻的“脱锚”假说。
初级感觉和运动系统在发育中受到外周输入、分子梯度和早期活动模式的强约束。皮层迅速扩大后,一些位于既有感觉层级之间的区域,可能较少被这些早期约束牢牢指定用途。它们成熟较晚,形成跨越较大范围的联合网络,更容易受到长期经验影响。作者同时明确讨论了这一假说的局限,因此它应被视作一种解释框架,而非已被证明的皮层演化定律。
这个设想提供了一种不同于“更多神经元等于更多算力”的理解。
新增组织的价值,有时来自它尚未被完全指定。
如果一片区域从出生时就被严格连接到一种感觉输入和一种固定输出,它会高效完成特定任务,却较少留下重新组织的余地。成熟较晚、连接更加分布式的组织,可能允许语言、社会规则、符号系统和文化训练参与决定其功能。
规模在这里增加的,是发育的自由度。
它给学习留出更大的空间,也使个体更加依赖经验。一个更可塑的脑,可以适应更多环境;它同样更容易受到早期环境、教育和损伤的影响。
因此,人类皮层的长期发育不能简单理解为“大脑还没长完”。
部分高级能力也许恰恰依赖于它没有过早完成。
现代大语言模型使“规模产生新能力”变成一个可以反复测量的工程问题。
Transformer由相似的基本模块反复堆叠而成。每一层都使用注意力、非线性变换和归一化等相近结构;训练以后,各层权重不同,参与的信息处理也逐渐分化。
这种模式与皮层演化有一处抽象上的相似:
共享的结构语法 + 大量重复 + 学习造成的分化
人工智能提供了两个有用的提醒。
第一个是,模型规模不能脱离训练经验讨论。Chinchilla研究训练了400多个不同规模和数据量的语言模型,发现给定计算预算时,参数数量与训练数据需要协调增加。700亿参数的Chinchilla使用了比2800亿参数Gopher更多的训练数据,并在相同计算预算下取得更好的整体表现。更大的参数量若缺少相应训练,并不会自动转化为更强能力。
第二个提醒来自评价方式。部分看似突然出现的能力,会在换用连续指标后变成渐进改善;另一些变化仍可能反映内部策略或表征发生重组。
对大脑而言,这两点同样重要。
更多的神经组织扩大可学习空间,经验决定这片空间中的哪些结构得到实现。
现在可以重新问最初的问题:
为什么规模本身能够产生新的智能能力?
最谨慎的答案是:规模本身并不够。
如果所有新增单元完全相同,如果它们没有形成新连接,如果学习经验不足,如果通信和记忆系统没有相应调整,规模可以只带来重复、噪声和更高能耗。
但神经系统中的扩展很少只增加一个数字。
它增加可分化的单元数量,也增加单元之间可能形成的关系;
扩大可表示的状态空间,也改变其中哪些状态能够稳定存在;
提高局部计算的可靠性,也让更长的行为序列跨过成功门槛;
产生更多局部结果,也迫使系统发展选择性通信、模块和层级;
留下成熟较晚的组织,也给经验和文化提供更大的塑形空间;
推动一个脑区的扩张,也让与它协作的记忆、选择、预测和校正系统重新配置。
在这样的系统中,规模带来的收益不必与神经元数量成正比。
增加一个孤立的单元,只多一个单元。
增加一个能够接入多个已有回路、并在学习中形成新功能的单元,可能改变许多状态之间的关系。新的关系又让原先分散的操作能够被组合。
组合带来的能力,常常不能在任何一个组成部分中单独找到。
一个回路能识别物体。
另一个回路能保持目标。
第三个回路能比较预期与结果。
当它们形成闭环,系统便可能根据比较结果修改目标,再重新观察同一个物体。
这里没有哪一个神经元单独拥有“反思”能力。能力存在于多个过程彼此进入对方的因果链的方式中。
这也解释了为什么大脑的扩展可能产生质的变化。
规模首先增加内部状态和相互作用。分化使这些状态携带不同内容。连接使一个状态能够影响另一个状态。学习选择其中有用的路径。可靠性提高以后,较长路径不再频繁中断。
最后,系统获得一种新的可能:
它可以把自己刚刚产生的内部结果保存下来,当作下一轮计算的对象。
一个感觉结果可以成为记忆。
一段记忆可以成为比较的依据。
比较结果可以成为计划。
计划执行后的误差又可以修改下一次的计算。
走到这里,扩展带来的变化已经超出“处理更多输入”。系统开始在自己的内部历史上继续工作。
扫描或长按识别二维码获取超强医疗模型MedGPT免费使用额度
谢谢阅读,欢迎点亮“分享”、“在看”,扩散关注!
考文献
Hill J, Inder T, Neil J, Dierker D, Harwell J, Van Essen D. Similar patterns of cortical expansion during human development and evolution. PNAS. 2010;107(29):13135–13140.
Rakic P. A small step for the cell, a giant leap for mankind: a hypothesis of neocortical expansion during evolution. Trends in Neurosciences. 1995;18(9):383–388.
Rigotti M, et al. The importance of mixed selectivity in complex cognitive tasks. Nature. 2013;497:585–590.
Zhang K, Sejnowski TJ. A universal scaling law between gray matter and white matter of cerebral cortex. PNAS. 2000;97(10):5621–5626.
Buckner RL, Krienen FM. The evolution of distributed association networks in the human brain. Trends in Cognitive Sciences. 2013;17(12):648–665.
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.