如果连接组得到一份它从不查询的外部记忆,会发生什么?我搭了一个很小的、诚实的版本,然后跑了一遍。
这篇要问的问题刻意收得很窄:外部存储的经验,能不能在一次彻底的重置之后存活下来,并让一个从未学过它的网络重新表现出对应行为?这就是全部结果。更奇怪的那个问题,也就是把两段历史对调,属于第三部分。
![]()
我还没有动那个 166,700 个神经元的连接组。我用的是一个小的固定循环网络作为替身:感觉输入,中间的隐藏层,向下的运动输出,一次性接好,之后不再改动。在它旁边,我挂上了一套 Mycelium 机制:显著性门控写入、基于相似度的模式补全、共同访问强化、衰减。
任务本身是一道线索与反应的关卡
智能体看到几个线索中的一个,必须做出几个动作中的一个。每个线索对应一个正确动作。这个映射是固定的,但事先未知。做对给奖励,做错给惩罚。而这个固定网络本身,没有任何从经验中学习这套映射的机制。
下面出现的每一个数字,都是这项任务上的准确率:智能体在全部试次中选对正确动作的比例,取值从 0 到 1。随机猜的概率是 0.33。
整个实验的可信度,压在一个不可让步的规则上:记忆系统不能选择动作。它只能对动作从中涌现的那个状态施加偏置。代码里就是这么强制执行的。
在 observe_and_modulate 里,召回是连续发生的,不发出任何查询:相似的状态自己就会触发。每个记忆被激活的强度,乘以它的强度和符号,再乘上对应的痕迹,求和之后返回一个偏置电流——注意,是电流,永远不是一个动作。
到了 step 环节,网络的驱动来自权重乘状态、输入权重乘输入,再加上偏置。如果存在调制,调制就加在驱动上——记忆是从这里进入的,以电流的形式。
换句话说,记忆不能决定发生什么,它只能改变选择从中产生的那个状态。
四个条件,看的是平还是涨
实验跑了四个条件。读它们的时候,要看的是曲线是平的还是在改善,而不是看原始准确率的高低。准确率依旧是选对正确动作的试次比例,0 到 1,随机水平 0.33。
那个固定网络在这个随机种子上,恰好一开始就在 0.70 附近。这不是学习。它的行为是静态的。它之所以在某些线索与动作的映射上做对了,是因为随机初始化的网络本来就偏好那些线索对应的正确动作。一个固定的大脑可以碰巧表现不错,但它永远不会变得更好。
这里真正重要的,不是哪个条件起点最高,而是经验有没有改变未来的行为。
单独的可塑性表现得很嘈杂,而且在这个设定下它是有害的,准确率落在 0.47 附近。至于外部记忆这一侧的结果,就停在这里。
把这条线索串起来看:一个不会学习的网络,加上一套只能施加偏置、不能替它做决定的记忆机制,问题就变成了——经验到底能不能在基底被重置之后,重新把行为带回来。这个实验给出的,是一个刻意收窄的答案。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.