来源:市场资讯
(来源:华为计算)
上海AI实验室正式开源基于Mobius系列架构训练的Intern-S2-Mobius。该架构通过解耦知识存储与组合推理,探索提升模型推理效率、持续学习、组合泛化的新路径。现有实验显示,在下游任务准确率不低于对照模型的情况下,Mobius端到端推理效率 Transformer提升近4倍,并在数据压缩率和知识组合泛化任务中展现出进一步潜力。该模型基于昇腾384超节点上实现原生训练和推理,联合昇腾共同优化的Mobius架构,在Xtuner训练与LMDeploy推理框架下的运行表现相对于Transformer提速明显。在昇腾超节点算力架构的加持下,未来有望激发出Mobius更大的效率潜力。
伴随着单纯依靠扩大数据量和参数规模所带来的边际收益逐步趋缓,AI模型研发正处在从规模扩展走向结构创新的关键阶段。如何在“Scaling Law”之外寻找新的能力增长路径,已成为学术界和产业界共同关注的问题。
上海人工智能实验室(以下简称上海AI实验室)近日正式开源 Mobius系列架构,该架构将知识存储与组合推理解耦,旨在拓展模型在持续学习、组合泛化等方向上的能力边界,并以架构层面的能力提升进一步推动训练和推理效率优化。
Github链接:https://github.com/InternLM/Intern-S2-Mobius
Huggingface链接:https://huggingface.co/internlm/Intern-S2-Mobius
Arch Space链接:https://github.com/InternLM/archspace/issues/9
Transformer的“三重瓶颈”
自Transformer问世以来,工业界通过持续扩展数据量和参数规模,以较高的投入产出比推动模型能力快速提升。相关模型在自然语言、代码、数学、视频等任务上取得了前所未有的进展。
但随着基于Transformer的模型规模不断扩大、能力持续增强,架构层面的三类局限也日益值得关注:
学过的知识,难以快速、完整地调用;
新知识的高效写入与稳固记忆,成本较高;
未直接学习过的内容,难以通过知识联想与组合进行构建。
在一种常见的解释框架下,前馈神经网络(Feed-Forward Network,FFN)主要承担知识存储功能,注意力机制(Attention)主要负责组合推理。不同层的FFN存储不同知识,同一词元(Token)在不同层可能激活不同信息;不同层的 Attention则完成不同形式的组合,同一组知识输入也可能产生不同的推理结果。由于Transformer按层顺序计算,当前层的 Attention主要处理此前层级产生的表征;借助层间残差连接(Residual Connection),更早层级的信息也可以被传递到后续层。
从这一层次化的记忆与推理机制出发,可以看到三个具体限制:
在推理过程中,模型需要依次经过各层才能调用分散存储的知识。如果关键知识未在恰当阶段被激活,模型往往需要延长生成过程,以增加后续再次调用相关知识的机会;
知识分散在不同层中,既可能重叠,也存在耦合。学习新知识时,模型难以对写入位置进行显式管理,通常需要联动更新大量参数;
不同层之间的信息交互主要依赖残差连接。随着层数加深,较浅层信息可能被逐步稀释,从而限制跨层知识直接组合的效率。
由此可见,分层的记忆与推理机制不仅影响知识读取效率,也增加了知识写入和跨层组合的难度。构建更高效、更灵活的记忆与推理机制,可能成为进一步拓展AI模型能力边界的重要方向。
围绕上述问题,国内外头部基础模型团队都在积极探索 Transformer的架构改进。其中,一类代表性方向是利用稀疏注意力、线性注意力等机制降低计算复杂度,以缓解算力约束、提升训练和推理效率。在资源受限的条件下,这些方案为更大参数规模的训练提供了支撑,也推动国内模型能力逐步接近国外闭源模型。但从长期看,降低复杂度主要解决的是效率问题;这类架构能否同步拓展模型的能力上限,仍需持续观察和验证。
Mobius:解耦知识存储
与组合推理
针对上述问题,上海AI实验室提出一种新的架构思路:拆解不同层中记忆与推理的耦合关系,将各层知识统一组织为共享记忆池,使每一层的Attention都能够访问其中的信息。在这一设计下,上述三类问题有望得到缓解:
在推理层数相同的情况下,共享记忆后的模型能够更多次遍历(Traversal)知识,提高提取关键信息的概率,从而更容易生成有效输出;
知识采用扁平化组织后,新知识的写入位置更加清晰,有助于降低局部更新对整体知识结构的扰动;
每次访问共享记忆库时,所有知识都有机会被同时激活,从而增加不同知识直接交互的机会,并有望带来更好的组合泛化能力。
现有实验显示,在下游任务准确率不低于对照模型的情况下,Mobius端到端推理效率较Transformer提升近4倍。此外,Mobius也在知识写入和组合泛化方面展现出积极信号:使用 60%的数据,Mobius即可达到与Transformer相近的MMLU PRO评测分数,体现出更高的数据压缩效率;在部分知识组合泛化任务中,其表现达到Transformer的2倍效能。
![]()
35B续训练的推理速度
![]()
35B续训练的CoT长度
![]()
35B续训练的下游任务得分
![]()
7B从头预训练的MMLU分数
![]()
Toy Model的组合泛化验证
原生支持反向残差连接与动态隐空间推理
近期围绕残差连接(Residual Connection)和隐空间推理(Latent Reasoning)的架构改进受到广泛关注。
从这两个视角看,Mobius的设计可以被理解为原生支持反向残差连接(Backward Residual Connection)和动态隐空间推理(Dynamic Latent Reasoning)。
从早期的ResNet,到近期的Hyper-Connection、Attention-Residual,这类机制的共同目标之一,是在前向传播过程中将浅层信息传递至深层。其局限在于,前向信息流仍主要沿层级单向展开,当关键知识未被及时调用,或深层知识构成浅层知识的读取前提时,模型可能需要通过额外生成延长推理过程。
Mobius将不同层的知识统一组织起来,使后续计算能够重新访问此前层级的知识;从机制上看,这可以理解为引入了一种反向残差连接,有望增强信息传递的灵活性,并改善知识压缩率和推理效率。
相比逐Token的显式推理,隐空间推理使用隐状态(Hidden States)连接不同循环,也发挥了类似残差连接的作用。但传统隐空间推理仍存在效率约束:一方面,模型每次循环通常都要经过所有层,即使部分层的知识已不再必要;另一方面,多次迭代往往只用于更新单个Token的表征。
相比之下,Mobius原生支持更为动态的隐空间推理机制。一方面,每一层都有机会访问全部知识,且不预先限定必须激活的知识,因此模型每经过一层都可以被视作完成一次隐空间推理,并通过更灵活的激活选择减少冗余计算。另一方面,Mobius在每一层迭代的不只是单个Token的表征,因此能够形成更高效的迭代过程,以及更连续、可微的优化路径。
面向递归自进化、AI辅助科学发现与世界模型
递归自进化、AI辅助科学发现和世界模型,正成为重要且亟待突破的前沿方向:
现阶段的递归自进化研究涵盖数据迭代、参数迭代、架构迭代等多种路径。无论采用何种方式,都需要构建高密度、高灵活性的记忆存储与拓展机制,以支持模型持续成长;
如果说Coding主要面向流程性问题,那么Research往往是流程、直觉与知识组合泛化的共同作用。要推动科学发现,需要让足以发掘“未知的已知”的关键知识既存储在模型中,又能在同一次推理过程中被有效激活;
语言模型主要建模离散Token,世界模型则需要建模连续的物理世界。现实世界具有丰富的波段与模态,因此,相较语言模型,世界模型对连续、可微的理解与推理机制提出了更高要求。
Mobius对知识存储与组合推理进行解耦,回应了递归自进化和科学发现对记忆机制、知识调用与组合泛化的核心需求,因此有望在这两个方向展现出不同于Transformer的架构潜力。其原生支持的隐空间推理机制的特性,也可能为世界模型的架构提供新的思路。与此同时,若要更充分地适配世界模型,Attention机制本身仍可能需要进一步调整,相关方向将在Mobius后续版本中持续探索。
为趋近Mobius的能力上限软硬协同设计已经在路上
现阶段,Mobius已展现出端到端推理效率优势,但这部分收益主要来自更高效的推理路径,以及由此形成的更短思维链(Chain-of-Thought,CoT)。若仅比较单个Token的推理效率,Mobius相较Transformer还有一点距离,主要源于Mobius架构在算法层面对知识与推理解耦的设计,该设计在硬件上表现为存储与计算的分离,对访存与通信提出更高需求,这也成为Mobius 进一步提升推理效率的主要阻碍。
在训练框架方面,基于上海AI实验室自研的Xtuner框架,实现了Mobius架构下的显存优化、数值一致性对齐、专家负载均衡以及RL全链路分析等相关优化。在推理优化上,上海AI实验室充分发挥自研LMDeploy框架的底层优势,从Kernel入手,针对2560 专家(MoE)的稀疏计算模式做了针对性优化。同时,借助 Mobius短思维链的特点,最终将整体推理效率提升至原来的数倍,大幅降低了延迟与算力成本。
目前,Mobius已经初步实现了在昇腾384超节点算力上的原生训练和推理,技术适配模块已完成开源发布。相较于其他GPU算力,昇腾384超节点对于多机通信有着更好的支持,显著契合Mobius架构对于更大通信带宽、更低通信时延的诉求。基于昇腾384超节点,上海AI实验室和昇腾的联创科研团队将进一步优化Mobius架构在Xtuner训练与LMDeploy推理框架下的运行表现,使其更亲和昇腾超节点算力架构,有望在未来激发出 Mobius更大的效率潜力。
![]()
昇腾384超节点上的测速结果,Mobius相对Transformer有明显提速
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.