一个模型刚学会写代码,转头就把医学知识忘光了。这是大语言模型最头疼的问题之一:灾难性遗忘。根源在于,标准Transformer把所有知识都塞进同一个密集前馈网络(FFN)里,不同领域的信息在同一个矩阵中互相覆盖。
最近,一项名为CellularFlow的新架构研究试图解决这个问题。核心思路很直接:把“记忆”和“推理”拆开,让知识存储不再是一锅粥。
![]()
问题出在“单块”结构上
传统Transformer用密集前馈网络存储世界知识,所有事实都纠缠在单一矩阵中。训练新领域时,反向传播会覆盖旧权重,导致模型“学了新的,忘了旧的”。研究者打了个比方:因为MLP是密集的矩阵乘法,每一个权重都会参与每一个token的处理,不存在“文件夹”“槽位”或孤立的边界。
CellularFlow的解法,是用可寻址的DNA记忆库取代单块MLP。推理主干(注意力机制)与知识存储分离:事实信息被路由到动态、可寻址的关联记忆库中,这些记忆库可以独立训练、剪枝或更新。这样,模型既能保留通用能力,又能在新领域实现专门化。
三种学习模式,按需适配
这套架构支持层次化的学习方式,覆盖不同场景:
- 实时学习:零反向传播的前向更新,适合快速吸收新信息
- 选择性微调:冻结主干,只更新记忆库,避免干扰已有能力
- 情景事实注入:快速写入缓冲区,实现即时召回
这种设计让模型无需完整再训练,就能高效适配新任务。句法解析、语法和关系推理留在冻结的主干中,只有特定领域的关联记忆槽位会进行适配。
参数减半,性能反超
实证数据相当亮眼。相比标准的GPT-mini基线,CellularFlow在使用一半参数的情况下,实现了perplexity(困惑度)降低70.3%,准确率提升37.3%。在连续领域测试中,它在五个任务上保留了83.9%的知识,而基线仅为61.8%。
研究者认为,这证明了语言模型不必是刚性、单块的黑箱——那种在学习新内容时就会忘记过去的黑箱。把记忆与推理解耦,模型可以在不牺牲旧知识的前提下,持续吸收新领域。
这项研究来自DEV Community的machinelearning频道,作者Celcilin C S。对于正在做持续学习、参数高效微调或实时知识注入的团队来说,CellularFlow提供了一个值得参考的架构方向。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.