大模型学新知识就忘旧知识,这个老大难问题有了新解法。一个名为CellularFlow的开源项目,提出把知识存储和序列推理彻底解耦,在持续学习场景下实现了83.9%的知识保留率。
这个数字意味着什么?传统微调方式下,模型学习新任务后,旧任务表现往往断崖式下跌,有时甚至跌到20%以下。CellularFlow的思路是:既然遗忘的根源在于参数共享,那干脆别让记忆和推理挤在一起。
![]()
记忆和推理,各干各的
架构上,CellularFlow引入了两个独立模块:联想式DNA记忆库负责长期知识存储,情景缓冲区处理短期上下文。推理时,模型先从记忆库中检索相关知识,再结合当前输入进行序列推理。
这种设计借鉴了生物记忆机制——DNA存储遗传信息,情景记忆处理近期事件,两者互不干扰。放到模型里,就是知识写入和推理计算不再共享同一组参数,从根源上避免了灾难性遗忘。
开源项目,效果可复现
项目已在GitHub上开源,代码和实验配置均可直接获取。对于正在做持续学习、增量训练或者模型终身学习方向的开发者,这个架构提供了一个值得对照的基线方案。
83.9%的保留率当然不是终点,但它至少证明了一件事:对抗遗忘,不一定非要靠回放旧数据或者正则化约束,把存储和推理物理隔离,也是一条走得通的路。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.