网易首页 > 网易号 > 正文 申请入驻

自然 · 机器智能:认知地图如何赋予人工智能灵活规划能力

0
分享至


导语

规划不只是复现过去的经验,更要为从未遇到的问题构造新的解决路径。2016年7月21日发表于 Nature Machine Intelligence 的研究借鉴大脑的认知地图机制,提出生成式认知地图学习器(GCML):以认知地图提供行动方向,通过随机采样探索备选方案,再利用组合编码迁移至未见状态。该模型无需深度网络和反向传播,仅依靠局部、自监督的突触可塑性,便能在空间导航、随机图和组合分解任务中实现快速规划,为在神经形态硬件和边缘设备上部署低功耗智能提供了新路径。

关键词:认知地图(cognitive map)、神经采样(neural sampling)、目标导向想象(goal-directed imagination)、生成式认知地图学习器(generative cognitive map learner,GCML)、组合计算(compositional computing)、局部突触可塑性(local synaptic plasticity)、神经形态计算(neuromorphic computing)

彭晨丨作者

赵思怡丨审校


论文题目:Neural sampling from cognitive maps enables goal-directed imagination and planning 论文链接:https://www.nature.com/articles/s42256-026-01254-4 发表时间:2026年7月21日 论文来源:Nature Machine Intelligence

从“记住环境”到“想象未来”

规划不仅意味着从记忆中调取一条走过的路线,更意味着面对新目标时构造从未实际经历过的行动序列。传统人工智能通常依赖搜索或强化学习:前者需要展开大量候选状态,后者往往要通过奖励和反复训练学得策略。当目标或环境发生变化时,重新搜索或重新学习可能带来显著的计算负担。

而人类大脑的工作方式似乎不同,会通过构建认知地图的方式提升计算效率。认知地图并非普通地图,而是通过状态与动作之间的关系,把分散经验组织成连贯结构的数据表征。动物海马体与内嗅皮层中的网格细胞(grid cells)和位置细胞(place cells)构成了研究最充分的空间认知地图。更重要的是,海马体在休息阶段产生的序列活动能够被解码为尚未真正行走的未来轨迹;即使环境突然出现障碍,这些“回放”轨迹也可能绕开障碍而继续指向目标。

研究由此提出一个关键问题:如果认知地图能够提供“目标大致在哪个方向”的结构信息,再向行动选择加入适量随机性,是否就能得到既面向目标、又具有多样性的想象过程?研究团队把这种思路概括为认知地图上的目标导向随机采样,并将认知地图、随机性和组合计算三种机制统一到一个模型框架中。

二维认知地图:从网格细胞活动中采样未来路径

研究首先从二维空间导航入手。模型以网格细胞系统为基础,通过路径积分(path integration)根据运动指令更新位置表征,并利用网格细胞活动训练位置细胞。模型还设置了四类基本动作神经元,分别对应上下左右的运动方向。

真正把地图变成规划工具的是一个线性逆模型(inverse model)。在随机探索环境的过程中,模型同时观察网格细胞状态发生了怎样的变化,以及哪一动作造成了这种变化,进而通过局部突触可塑性学习二者的映射。规划时,逆模型接收“目标状态与当前状态之差”,输出能够缩小这一差距的动作方向。随后,前向模型(forward model)预测该动作可能产生的下一状态;模型不必真的移动,就能在预测状态上继续选择动作,由此逐步生成一条想象轨迹。

研究使用1,000个网格细胞表征二维环境,并在一个边长为4个单位的区域中模拟500秒随机探索,每个时间步为10毫秒。训练时,研究者特意封闭了左下四分之一空间,用来检验模型能否想象穿过从未探索区域的路径。

当行动选择中的噪声较低时,模型生成的轨迹比较集中;噪声升高后,同一起点与终点之间会出现更多弯曲且相互不同的路线,但这些路线仍保持总体目标方向。其多样性与啮齿动物海马体回放中解码出的轨迹在定性上相似。更值得注意的是,较高噪声下的部分轨迹能够穿过训练阶段没有到达过的区域,说明模型的规划并非简单重放经验。

模型还以排斥力近似物体细胞(object cells)和边界细胞(barrier cells)的作用。当新障碍出现在前往目标的直线路径上时,采样轨迹会短暂偏离目标方向以绕过障碍,随后重新朝目标收敛。这为一种实验现象提供了潜在的机制解释:海马体无需重新配置位置场,也可能迅速生成绕过新障碍的目标导向回放轨迹。不过,这里强调的是与脑记录关键模式的定性相似,而不是对生物神经活动的完整拟合。


图 1. 从二维认知地图采样支持空间轨迹的目标导向想象。a、模型架构。网格细胞的标准路径集成模型用于更新基于运动命令(动作)a 的网格细胞发射。这些在这里表示为四个方向上基本运动命令的(规范化)叠加。网格细胞向一系列位置细胞提供突触输入,这些位置细胞通过简单的局部学习机制进行训练。同时,从网格细胞到基本动作神经元的突触连接 W 也通过一个简单的局部突触可塑性规则来学习,从而得到一个线性逆模型。b,网格细胞的输出(对于特定比例尺)将二维空间环境映射到圆环表面的一部分。如果网格细胞在足够大的范围内运行,则该部分对于给定的 2D 场地来说是近似平坦的,从而支持基于二维方向感的导航。c,探索轨迹用于学习逆模型W。留下四分之一的空间进行模型测试。d,动作生成过程中不同噪声水平(0.1、0.3、0.5和1.0)对生成轨迹方差的影响。展示了每个噪音水平的五个轨迹。e,在d. 的每个相应的图中,为其中一个轨迹(用红色标记)选择的50个选定位置细胞的Spike序列。f .由相同模型生成的目标导向轨迹,其中来自障碍物的排斥力影响动作选择。这些轨迹与在啮齿动物大脑中观察到的轨迹非常相似。

GCML:把空间导航推广到抽象问题

二维网格细胞模型适用于近似欧氏空间,却难以直接覆盖复杂图结构和高维组合问题。为此,研究者在认知地图学习器(cognitive map learner,CML)基础上提出GCML。

CML通过预测编码(predictive coding)学习认知地图:观察和动作分别经由映射嵌入共同的高维状态空间,使“当前状态加上某个动作应当通向下一状态”成为这个空间的几何结构。文章所考察的任务使用线性嵌入即可取得效果,约1,000维状态表征已能满足一般实验。学习过程采用自监督的局部规则近似预测误差的梯度下降,不需要误差反向传播或时间反向传播。

GCML的“生成式”变化在于:想象期间没有环境返回真实观察,因此模型用前向模型产生的下一状态预测代替外部反馈,再从这一预测状态选择下一虚拟动作。与此同时,逆模型根据目标与当前想象状态之间的差异评估各动作的用途,可供性门控(affordance gating)则排除当前状态下无法执行的动作。加入高斯噪声后,模型便可围绕同一目标生成不同候选路径。


图 2. GCML 的模型架构和学习过程。a, 大脑能够通过目标导向想象(goal-directed imagination)解决非空间问题的示意图:大脑可以想象出实现任意给定目标的计划,例如获得一把锤子。b, 生成式认知地图学习器(GCML)采用与文中的认知地图学习器(CML)相同的认知地图学习策略:模型将观察以及动作的传出副本(efferent copies)嵌入同一个高维状态空间,使所得认知地图,即嵌入表示的几何结构,能够反映观察与动作之间的关系。对于本文所研究的任务,嵌入映射 Q 和 V 可以采用线性形式,并可通过简单的局部突触可塑性规则学习得到。c, 认知地图,也就是嵌入映射 Q 和 V 的学习,由一个预测学习目标驱动:按照公式(11),利用当前观察和动作预测下一观察,即下一状态的嵌入表示。d, 与此同时,模型还可以学习一个以矩阵 W 表示的逆模型(inverse model),把状态之间的差异映射到造成这些差异的动作。需要注意的是,如果学习得到的嵌入映射 V,即前向模型(forward model),是线性的,并且公式(11)得到满足,那么线性逆模型必然存在。e, 为了生成朝向目标状态s*的想象轨迹,模型会迭代更新估计的当前状态ŝₜ。但重要的是,在这一过程中并不会真正执行任何动作。相反,模型以对下一观察或状态的预测ŝₜ₊₁,取代来自环境的真实反馈。随后,模型针对预测得到的下一状态,以虚拟方式选择下一个动作,这一过程称为自举(bootstrapping)。与真实的动作选择过程类似,目标状态s*与估计当前状态ŝₜ之间的差异,通过已经学习的矩阵W驱动动作选择,从而实现目标导向想象。

随机图任务:噪声不是干扰,而是“想象力”

研究团队首先在一个具有32个节点的随机图上检验抽象问题求解能力。每个节点的度数在2至5之间,训练数据包含200条长度为32的随机探索轨迹。节点作为观察,沿边移动作为动作,GCML学习该图的高维认知地图,然后从任意起点向指定终点采样路径。

低噪声时,生成路径的长度集中在最短路径附近,因而可视为对前k条最短路径问题的启发式近似。噪声增大后,路线更加多样,长度分布也更宽,但模型通常仍能到达目标:一次不理想的选择,会在后续步骤中被重新指向目标的动作补偿。作者将其称为具有自我纠正能力的“归巢”启发式。

多样性还具有实际价值。当研究者在部分节点上临时设置奖励或损失,并让模型在每种噪声水平下生成40条轨迹,再选择累计奖励最高的一条时,较高噪声往往能发现回报更高的路线。换言之,随机性在这里不是需要彻底消除的误差,而是探索替代方案的资源;但噪声并非越高越好,它增加探索范围的同时也可能损害稳定性。


图 3. GCML 的通用问题解决能力。a,一个包含32个节点的随机图,可被视为问题求解环境的一个抽象模型。b,CML在利用其学习到的观测和动作嵌入探索该图后所构建的认知地图的二维投影(通过t分布随机邻域嵌入实现)。该图表示的几何结构支持一种简单的几何启发式策略,用于从任意给定节点选择动作(边)以到达任意远端目标节点:选择指向目标方向的边。c、d,GCML在任意固定起始节点和目标节点(如b中所示)的情况下生成路径长度统计的两个噪声水平。对于x轴上标示的每种路径长度,黑色条形表示GCML生成的从起点到终点的该长度路径所占的比例。两种情况下,路径长度均围绕最小值聚集。c中的较低噪声水平为k最短路径问题提供了一种启发式解决方案。e、f,展示了生成更多样化解决方案路径的功能优势(在GCML中使用更高噪声水平时)。可能对单个节点进行任意分配奖励和损失。如果目标是生成一条奖励总和最大的路径,则较高水平的噪声是有益的(f)。对于每个噪声水平,GCML 生成了40条轨迹,其最大奖励总和在y轴上表示。中心点表示平均值,误差线表示使用不同随机种子重复100次实验的标准差。起始节点和目标节点与b和e中的相同。

轮廓分解:在未见组合上检验强泛化

研究最具挑战性的实验来自组合任务。给定若干基本构件(building blocks,BBs)和一个二维轮廓,模型需要判断并生成一系列构件移除动作,使轮廓最终被完全分解。这类铺砌或分解问题即便只使用少量构件,也属于NP困难问题。

训练阶段仅使用由5个构件组成、可以在5步内完成分解的轮廓。目标状态始终为空轮廓,但测试阶段的起始轮廓通常从未出现过。GCML学习的不是各个完整图形的答案,而是构件、状态变化与可执行动作之间具有组合性的关系。因此,训练完成后,它能够处理由8个构件组成的新轮廓。随着采样候选数增加,成功率提高;研究报告,在这一设置中,GCML即使只生成少量候选方案也表现出接近完美的成功率,并优于随机移除策略和原始CML。

研究还进一步改变了任务。目标不再必须是空轮廓,而可以是一个指定的非空部分轮廓;模型也可以先移除构件,再添加构件以形成新的目标图形。添加动作被表示为相应移除动作的反方向,因此不需要重新训练认知地图。在起始轮廓和目标轮廓均未在训练中出现的情况下,GCML仍能较好地生成解决轨迹。这说明组合结构使模型能够把学到的局部关系迁移到新的状态组合之中,而非局限于训练样本的尺寸和完整形态。


图 4. GCML在组合基准任务目标导向抽样中的应用。a、b,任务示意图。在存在相应分解的情况下,将轮廓分解为图b中所示的BBs(基本块)。c,GCML学习过程中使用的三个示例轨迹。生成每个轮廓所用的五个BBs以随机打乱的顺序被移除。d,对具有可操作性因子的轮廓嵌入Q所得到的认知地图进行二维t分布随机邻域嵌入投影。e,GCML为包含八个BBs的轮廓生成的两个示例轨迹。f,在训练了由五个BBs组成的轮廓分解后,测试GCML对由八个BBs组成的可分解轮廓生成分解的能力。因此,所有测试轮廓均为GCML此前未曾接触过的。

与精确搜索、强化学习和模型预测控制相比

在前5条最短路径实验中,研究者将GCML与K*、多路径A*(mA*)和BELA*三种精确算法比较。测试涵盖32、64、96、128和160个节点的随机图;每种规模生成10张图,每张图使用100组随机起点与终点。为适应较大图,GCML使用1,000条训练轨迹和5,000维状态表征。

三种基线算法能够返回精确最优解,其路径总长度的相对误差为零;GCML是启发式方法,在小图上接近最优,随着节点数增加出现轻微性能下降。其优势则体现在在线生成成本上:在得到第一条候选轨迹之前,GCML访问的节点显著少于精确搜索算法。目标或起点改变时,搜索基线需要重新探索图结构,延迟随图规模增大;GCML依靠已学习的认知地图直接改变目标输入,论文报告其额外重规划成本可忽略。它的在线工作内存也主要用于当前决策和已生成的局部轨迹,无须维护庞大的搜索前沿及多条候选路径结构。

在轮廓分解实验中,研究还比较了随机策略、决斗双重深度Q网络(duelling double-deep Q-network,D3QN)、基于交叉熵方法的模型预测控制(CEM-based model predictive control,MPC)、CML和GCML。当生成的候选分解方案少于20个时,GCML的成功率明显更高。这个结果支持的并不是“GCML在所有指标上优于所有方法”,而是一个更具体的结论:在需要快速产生少量候选方案的在线情境中,认知地图提供的方向感具有明显优势。


图 5. GCML与其他方法在求解k最短路径和铺砖任务上的性能比较。a. 针对不同节点数量的随机图,k最短路径问题的性能表现。图中绘制了k=5时所提出k条路径长度之和的相对劣化百分比Lk。K*、mA*和BELA*的数值重合,因为它们均能产生最优解。GCML在小规模图上也能生成接近最优的解,仅在大规模图上略有性能下降。b. 四种算法的计算开销。以各算法为求解k最短路径问题而访问的节点数量作为其计算开销的衡量指标。显然,GCML的计算开销显著低于其他三种算法。阴影区域表示不同实例间的差异性。c. 当目标发生变化时四种算法的重新规划延迟。展示了起始点或目标节点变化时重新规划所需的墙钟时间。GCML无需重新规划成本,而其他算法则表现出明显的重新规划延迟,且该延迟随图的规模增大而增加。a–c 中的数据表示为十张随机图的平均值 ± 标准差,每张图包含 100 对随机的起点和目标点;阴影误差带表示 ± 标准差。d,GCML 与其他四种方法在将轮廓分解为边界框(BBs)时的成功率。所采用的方法包括随机策略(Random)、双深度 Q 网络对抗学习(D3QN;强化学习,RL)、基于 CEM 的模型预测控制(MPC)、CML 和 GCML。第一个 RL 条形图(即样本数为 1)表示无噪声情况下的结果。当生成的分解提议少于 20 个时,GCML 的性能显著优于其他方法。

一种快速启发式,而非万能求解器

GCML把目标作为输入,而不是把某个固定目标写入网络权重,因此能够在不重新训练的情况下改变目标;它通过局部、自监督的预测学习形成认知地图,又通过逆模型把状态差异转化为动作方向。由此,模型在空间、随机图和组合轮廓三类差异很大的任务中展示出同一套计算逻辑:利用地图提供方向,以随机性生成多个可能方案,再从中选择更合适的结果。

这种结构也适合存内计算(in-memory computing)和忆阻器交叉阵列(memristor crossbars)。由于学习规则局部、行动选择可由矩阵运算实现,作者认为它有望支持片上在线学习和低延迟决策,为机器人、自动驾驶系统及其他资源受限的边缘设备提供一种节能规划机制。

但研究同时明确承认,GCML是一种启发式在线方法。精确搜索和更复杂的离线推理可以获得更优解,并处理难度更高的问题;GCML面对U形障碍等局部结构时,可能需要提高噪声才能逃离,从而牺牲稳定性。当前模型还只是向确定性逆模型加入固定强度的高斯噪声,并未学习随状态、动作和目标变化的不确定性分布。未来可进一步学习概率化的转移与行动模型,使其与规划即推断(planning as inference)主动推断(active inference)等贝叶斯框架建立更直接的联系。

因此,这项工作的价值不在于证明简单模型已经解决通用规划问题,而在于展示了一条清晰的机制路径:智能系统未必必须穷举整个搜索空间,才知道下一步应该往哪里走。认知地图提供方向,随机采样提供备选,组合结构则把有限经验扩展到未见状态。三者结合,使“想象”从一个抽象的认知概念转化为可以学习、运行并部署到节能硬件上的计算过程。

世界模型读书会


目前,世界模型并非边界明确的单一技术范式。强化学习、生成模型、认知科学、具身智能与复杂系统等领域,对“世界”“状态”及其动力学机制有着不同理解。世界模型究竟应预测感知信号、学习隐空间中的状态转移,还是刻画行动、物理约束与因果关系?预测能力又如何转化为有效的规划、决策和行动?这些问题仍有待系统梳理。


为此,集智俱乐部联合认知科学、具身智能、AI Agent、复杂系统与高阶网络等领域的研究者发起,围绕世界模型的思想源流、理论基础、技术路线与应用边界展开专题分享和讨论。读书会自2026年8月7日起,每周五晚19:30-21:30,将以“世界如何被表征、其动力学如何被建模、内部模型如何服务于智能体”为主线,尝试讨论整理世界模型统一框架。



详情请见:

1.

2.

3.

4.

5.

6.

7.

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
你发现没有?2026年还在坚持买油车的人,基本都逃不出这4种情况

你发现没有?2026年还在坚持买油车的人,基本都逃不出这4种情况

铭记历史呀
2026-08-08 14:36:32
四川帅哥汤金伟去世,年仅18岁,刚考上大学,因感情问题跳河轻生

四川帅哥汤金伟去世,年仅18岁,刚考上大学,因感情问题跳河轻生

180视角
2026-08-08 12:01:45
统一有最佳方式,就在昨天,国民党大佬在京,交底郑丽文两岸路线

统一有最佳方式,就在昨天,国民党大佬在京,交底郑丽文两岸路线

影孖看世界
2026-08-08 21:21:35
小S真豁出去了!带二女儿Lily拍广告“全裸身”,走路背影像企鹅

小S真豁出去了!带二女儿Lily拍广告“全裸身”,走路背影像企鹅

小疯子耶
2026-08-08 06:38:53
项英为什么一直抗拒中央的北上发展方针?只因他另有“雄图大志”

项英为什么一直抗拒中央的北上发展方针?只因他另有“雄图大志”

色彩斑斓的世界
2026-07-02 22:06:14
17岁广东球员地域歧视贵州:三四线小城+猪脚饭难吃!就骂你咋了

17岁广东球员地域歧视贵州:三四线小城+猪脚饭难吃!就骂你咋了

念洲
2026-08-08 16:25:25
华快免费第一天,只有黄埔人笑不出来

华快免费第一天,只有黄埔人笑不出来

广州PLUS
2026-08-08 17:37:29
瑞幸“窜稀”吸管卖爆!坐马桶上喝的咖啡出现了?

瑞幸“窜稀”吸管卖爆!坐马桶上喝的咖啡出现了?

品牌新
2026-07-26 17:27:12
老挝国会主席赛宋蓬逝世

老挝国会主席赛宋蓬逝世

新京报
2026-08-08 22:07:11
重磅!苹果国行AI突然发布,首次官宣牵手阿里,Mac用上千问了

重磅!苹果国行AI突然发布,首次官宣牵手阿里,Mac用上千问了

智东西
2026-08-08 22:53:33
国行iPhone双卡防线崩塌?eSIM困局让果粉慌了

国行iPhone双卡防线崩塌?eSIM困局让果粉慌了

叮当当科技
2026-08-07 08:15:28
失望!全场怒砍0分,打尼日利亚全场在隐身,球迷:对不起国手身份

失望!全场怒砍0分,打尼日利亚全场在隐身,球迷:对不起国手身份

林子说事
2026-08-08 06:13:22
第一个被房地产拖累的城市出现了,就是佛山。

第一个被房地产拖累的城市出现了,就是佛山。

流苏晚晴
2026-08-08 20:43:26
iPhone 17本月或调价:苹果供应链减产30% 供货压力骤然加剧

iPhone 17本月或调价:苹果供应链减产30% 供货压力骤然加剧

快科技
2026-08-08 23:43:10
伊朗媒体发布伊朗最高领袖视频

伊朗媒体发布伊朗最高领袖视频

新京报
2026-08-08 18:57:06
“标枪”在 2022 年曾让俄罗斯坦克大吃苦头,现在美国为其配备了新的导引头,让它变得更好

“标枪”在 2022 年曾让俄罗斯坦克大吃苦头,现在美国为其配备了新的导引头,让它变得更好

深度Militaire
2026-08-08 10:32:02
王思聪看不起的傻X,身家已碾压王健林

王思聪看不起的傻X,身家已碾压王健林

首席品牌评论
2026-08-07 22:57:32
国务院原副总理余秋里,秘书官至正国级,唯一的儿子娶了元帅之女

国务院原副总理余秋里,秘书官至正国级,唯一的儿子娶了元帅之女

墨策讲历史
2026-08-07 18:30:18
汪小宝爆火,我才发现老人常说“孩子出生自带口粮”原来是真的。

汪小宝爆火,我才发现老人常说“孩子出生自带口粮”原来是真的。

铁锤妹妹是只猫
2026-08-08 02:30:20
因祸得福!用户RTX 4090修了四次:索泰直接送RTX 5090

因祸得福!用户RTX 4090修了四次:索泰直接送RTX 5090

快科技
2026-08-08 19:11:15
2026-08-08 23:59:00
集智俱乐部 incentive-icons
集智俱乐部
科普人工智能相关知识技能
5978文章数 4682关注度
往期回顾 全部

科技要闻

SpaceX最快下周完成600亿美元收购Cursor

头条要闻

十多万人报名的考试成绩全作废 考生:为何让别人买单

头条要闻

十多万人报名的考试成绩全作废 考生:为何让别人买单

体育要闻

29岁克拉克死因公布:吸食海洛因与可卡因

娱乐要闻

萧敬腾坦白!与大14岁妻子选择丁克

财经要闻

一枚“回旋镖”,击中王思聪

汽车要闻

华为乾崑ADS 5/限时售21.99万起 阿维塔07L正式上市

态度原创

艺术
家居
手机
本地
公开课

艺术要闻

建筑师15年前的脑洞,今天在深圳实现了!

家居要闻

2026建博会(广州) 公装联探展交流活动

手机要闻

华为阔直板新机?多款华为旗下手机新品待发布

本地新闻

课本里的童年,绍兴正上演

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版