网易首页 > 网易号 > 正文 申请入驻

上海人工智能实验室开源Intern-S2-Mobius,昇腾训推使能Mobius加速

0
分享至

来源:市场资讯

(来源:华为计算)

上海AI实验室正式开源基于Mobius系列架构训练的Intern-S2-Mobius。该架构通过解耦知识存储与组合推理,探索提升模型推理效率、持续学习、组合泛化的新路径。现有实验显示,在下游任务准确率不低于对照模型的情况下,Mobius端到端推理效率 Transformer提升近4倍,并在数据压缩率和知识组合泛化任务中展现出进一步潜力。该模型基于昇腾384超节点上实现原生训练和推理,联合昇腾共同优化的Mobius架构,在Xtuner训练与LMDeploy推理框架下的运行表现相对于Transformer提速明显。在昇腾超节点算力架构的加持下,未来有望激发出Mobius更大的效率潜力。

伴随着单纯依靠扩大数据量和参数规模所带来的边际收益逐步趋缓,AI模型研发正处在从规模扩展走向结构创新的关键阶段。如何在“Scaling Law”之外寻找新的能力增长路径,已成为学术界和产业界共同关注的问题。

上海人工智能实验室(以下简称上海AI实验室)近日正式开源 Mobius系列架构,该架构将知识存储与组合推理解耦,旨在拓展模型在持续学习、组合泛化等方向上的能力边界,并以架构层面的能力提升进一步推动训练和推理效率优化。

Github链接:https://github.com/InternLM/Intern-S2-Mobius

Huggingface链接:https://huggingface.co/internlm/Intern-S2-Mobius

Arch Space链接:https://github.com/InternLM/archspace/issues/9

Transformer的“三重瓶颈”

自Transformer问世以来,工业界通过持续扩展数据量和参数规模,以较高的投入产出比推动模型能力快速提升。相关模型在自然语言、代码、数学、视频等任务上取得了前所未有的进展。

但随着基于Transformer的模型规模不断扩大、能力持续增强,架构层面的三类局限也日益值得关注:

学过的知识,难以快速、完整地调用;

新知识的高效写入与稳固记忆,成本较高;

未直接学习过的内容,难以通过知识联想与组合进行构建。

在一种常见的解释框架下,前馈神经网络(Feed-Forward Network,FFN)主要承担知识存储功能,注意力机制(Attention)主要负责组合推理。不同层的FFN存储不同知识,同一词元(Token)在不同层可能激活不同信息;不同层的 Attention则完成不同形式的组合,同一组知识输入也可能产生不同的推理结果。由于Transformer按层顺序计算,当前层的 Attention主要处理此前层级产生的表征;借助层间残差连接(Residual Connection),更早层级的信息也可以被传递到后续层。

从这一层次化的记忆与推理机制出发,可以看到三个具体限制:

在推理过程中,模型需要依次经过各层才能调用分散存储的知识。如果关键知识未在恰当阶段被激活,模型往往需要延长生成过程,以增加后续再次调用相关知识的机会;

知识分散在不同层中,既可能重叠,也存在耦合。学习新知识时,模型难以对写入位置进行显式管理,通常需要联动更新大量参数;

不同层之间的信息交互主要依赖残差连接。随着层数加深,较浅层信息可能被逐步稀释,从而限制跨层知识直接组合的效率。

由此可见,分层的记忆与推理机制不仅影响知识读取效率,也增加了知识写入和跨层组合的难度。构建更高效、更灵活的记忆与推理机制,可能成为进一步拓展AI模型能力边界的重要方向。

围绕上述问题,国内外头部基础模型团队都在积极探索 Transformer的架构改进。其中,一类代表性方向是利用稀疏注意力、线性注意力等机制降低计算复杂度,以缓解算力约束、提升训练和推理效率。在资源受限的条件下,这些方案为更大参数规模的训练提供了支撑,也推动国内模型能力逐步接近国外闭源模型。但从长期看,降低复杂度主要解决的是效率问题;这类架构能否同步拓展模型的能力上限,仍需持续观察和验证。

Mobius:解耦知识存储

与组合推理

针对上述问题,上海AI实验室提出一种新的架构思路:拆解不同层中记忆与推理的耦合关系,将各层知识统一组织为共享记忆池,使每一层的Attention都能够访问其中的信息。在这一设计下,上述三类问题有望得到缓解:

在推理层数相同的情况下,共享记忆后的模型能够更多次遍历(Traversal)知识,提高提取关键信息的概率,从而更容易生成有效输出;

知识采用扁平化组织后,新知识的写入位置更加清晰,有助于降低局部更新对整体知识结构的扰动;

每次访问共享记忆库时,所有知识都有机会被同时激活,从而增加不同知识直接交互的机会,并有望带来更好的组合泛化能力。

现有实验显示,在下游任务准确率不低于对照模型的情况下,Mobius端到端推理效率较Transformer提升近4倍。此外,Mobius也在知识写入和组合泛化方面展现出积极信号:使用 60%的数据,Mobius即可达到与Transformer相近的MMLU PRO评测分数,体现出更高的数据压缩效率;在部分知识组合泛化任务中,其表现达到Transformer的2倍效能。


35B续训练的推理速度


35B续训练的CoT长度


35B续训练的下游任务得分


7B从头预训练的MMLU分数


Toy Model的组合泛化验证

原生支持反向残差连接与动态隐空间推理

近期围绕残差连接(Residual Connection)和隐空间推理(Latent Reasoning)的架构改进受到广泛关注。

从这两个视角看,Mobius的设计可以被理解为原生支持反向残差连接(Backward Residual Connection)和动态隐空间推理(Dynamic Latent Reasoning)。

从早期的ResNet,到近期的Hyper-Connection、Attention-Residual,这类机制的共同目标之一,是在前向传播过程中将浅层信息传递至深层。其局限在于,前向信息流仍主要沿层级单向展开,当关键知识未被及时调用,或深层知识构成浅层知识的读取前提时,模型可能需要通过额外生成延长推理过程。

Mobius将不同层的知识统一组织起来,使后续计算能够重新访问此前层级的知识;从机制上看,这可以理解为引入了一种反向残差连接,有望增强信息传递的灵活性,并改善知识压缩率和推理效率。

相比逐Token的显式推理,隐空间推理使用隐状态(Hidden States)连接不同循环,也发挥了类似残差连接的作用。但传统隐空间推理仍存在效率约束:一方面,模型每次循环通常都要经过所有层,即使部分层的知识已不再必要;另一方面,多次迭代往往只用于更新单个Token的表征。

相比之下,Mobius原生支持更为动态的隐空间推理机制。一方面,每一层都有机会访问全部知识,且不预先限定必须激活的知识,因此模型每经过一层都可以被视作完成一次隐空间推理,并通过更灵活的激活选择减少冗余计算。另一方面,Mobius在每一层迭代的不只是单个Token的表征,因此能够形成更高效的迭代过程,以及更连续、可微的优化路径。

面向递归自进化、AI辅助科学发现与世界模型

递归自进化、AI辅助科学发现和世界模型,正成为重要且亟待突破的前沿方向:

现阶段的递归自进化研究涵盖数据迭代、参数迭代、架构迭代等多种路径。无论采用何种方式,都需要构建高密度、高灵活性的记忆存储与拓展机制,以支持模型持续成长;

如果说Coding主要面向流程性问题,那么Research往往是流程、直觉与知识组合泛化的共同作用。要推动科学发现,需要让足以发掘“未知的已知”的关键知识既存储在模型中,又能在同一次推理过程中被有效激活;

语言模型主要建模离散Token,世界模型则需要建模连续的物理世界。现实世界具有丰富的波段与模态,因此,相较语言模型,世界模型对连续、可微的理解与推理机制提出了更高要求。

Mobius对知识存储与组合推理进行解耦,回应了递归自进化和科学发现对记忆机制、知识调用与组合泛化的核心需求,因此有望在这两个方向展现出不同于Transformer的架构潜力。其原生支持的隐空间推理机制的特性,也可能为世界模型的架构提供新的思路。与此同时,若要更充分地适配世界模型,Attention机制本身仍可能需要进一步调整,相关方向将在Mobius后续版本中持续探索。

为趋近Mobius的能力上限软硬协同设计已经在路上

现阶段,Mobius已展现出端到端推理效率优势,但这部分收益主要来自更高效的推理路径,以及由此形成的更短思维链(Chain-of-Thought,CoT)。若仅比较单个Token的推理效率,Mobius相较Transformer还有一点距离,主要源于Mobius架构在算法层面对知识与推理解耦的设计,该设计在硬件上表现为存储与计算的分离,对访存与通信提出更高需求,这也成为Mobius 进一步提升推理效率的主要阻碍。

在训练框架方面,基于上海AI实验室自研的Xtuner框架,实现了Mobius架构下的显存优化、数值一致性对齐、专家负载均衡以及RL全链路分析等相关优化。在推理优化上,上海AI实验室充分发挥自研LMDeploy框架的底层优势,从Kernel入手,针对2560 专家(MoE)的稀疏计算模式做了针对性优化。同时,借助 Mobius短思维链的特点,最终将整体推理效率提升至原来的数倍,大幅降低了延迟与算力成本。

目前,Mobius已经初步实现了在昇腾384超节点算力上的原生训练和推理,技术适配模块已完成开源发布。相较于其他GPU算力,昇腾384超节点对于多机通信有着更好的支持,显著契合Mobius架构对于更大通信带宽、更低通信时延的诉求。基于昇腾384超节点,上海AI实验室和昇腾的联创科研团队将进一步优化Mobius架构在Xtuner训练与LMDeploy推理框架下的运行表现,使其更亲和昇腾超节点算力架构,有望在未来激发出 Mobius更大的效率潜力。


昇腾384超节点上的测速结果,Mobius相对Transformer有明显提速

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
受台风“白海豚”及残涡影响,11—13日山东6地将迎大到暴雨局部大暴雨

受台风“白海豚”及残涡影响,11—13日山东6地将迎大到暴雨局部大暴雨

大众网
2026-08-11 12:58:06
重要信号!养老金上涨规则迎来调整,退休人员钱袋子如何变化?

重要信号!养老金上涨规则迎来调整,退休人员钱袋子如何变化?

白米饭怎么吃
2026-08-11 20:23:32
攻击俄炼油厂致近百人死伤!大型军用油库被炸,前线俄军严重缺油

攻击俄炼油厂致近百人死伤!大型军用油库被炸,前线俄军严重缺油

鹰眼Defence
2026-08-11 17:23:43
流亡莫斯科两年后,阿萨德被判处死刑,这回普京或也保不住他了?

流亡莫斯科两年后,阿萨德被判处死刑,这回普京或也保不住他了?

好贤观史记
2026-08-12 00:20:00
太湖宁可憋着也不排洪,苏州无锡常州内涝的水却退了

太湖宁可憋着也不排洪,苏州无锡常州内涝的水却退了

秋枫未语
2026-08-11 22:44:44
难以置信!网友扒出来曹小姐初中没完成,14岁就生了一个儿子,如今都18岁了

难以置信!网友扒出来曹小姐初中没完成,14岁就生了一个儿子,如今都18岁了

火山詩话
2026-08-09 06:37:39
1937年,34岁的王牌特工涂作潮和邻居打牌,邻居看了他一眼,说:“你看着像共产党?”

1937年,34岁的王牌特工涂作潮和邻居打牌,邻居看了他一眼,说:“你看着像共产党?”

纪史行者
2026-08-09 08:49:35
杰森应聘经理失败发飙,指责A妈补贴父母,网友:没良心

杰森应聘经理失败发飙,指责A妈补贴父母,网友:没良心

乡野小珥
2026-08-12 01:20:48
话题度拉满!NBA公布揭幕战+圣诞大战赛程:詹姆斯将战湖人

话题度拉满!NBA公布揭幕战+圣诞大战赛程:詹姆斯将战湖人

全景体育V
2026-08-11 20:34:41
托德·布兰奇宣誓就任美国司法部长

托德·布兰奇宣誓就任美国司法部长

澎湃新闻
2026-08-11 04:08:03
前后仅1个月,18岁的张本美和,再次向整个乒坛亮出一张“王牌”

前后仅1个月,18岁的张本美和,再次向整个乒坛亮出一张“王牌”

阿凫爱吐槽
2026-08-12 05:14:08
央行重要部署,信号很大

央行重要部署,信号很大

21世纪经济报道
2026-08-11 22:51:50
太心酸了!42岁著名女歌手江苏走穴,宾客只顾吃席没人搭理

太心酸了!42岁著名女歌手江苏走穴,宾客只顾吃席没人搭理

小徐讲八卦
2026-02-12 12:13:20
天津大到暴雨!雷电!短时大风!最强时段来了→

天津大到暴雨!雷电!短时大风!最强时段来了→

鲁中晨报
2026-08-11 18:30:05
浙江男子占车位一夜,次日发现车子被砸,车门变形,嫌疑人暂未锁定;车位主人称自己是“文明人”,不会干这事;物业:早就提醒过

浙江男子占车位一夜,次日发现车子被砸,车门变形,嫌疑人暂未锁定;车位主人称自己是“文明人”,不会干这事;物业:早就提醒过

洪观新闻
2026-08-11 18:37:06
南太行失联女孩已找到!面部损毁身体腐烂,物品散落现场疑点重重

南太行失联女孩已找到!面部损毁身体腐烂,物品散落现场疑点重重

北纬的咖啡豆
2026-08-11 09:27:28
154亿票房无人起身,5.7分烂片全场起立,百花奖撕开遮羞布

154亿票房无人起身,5.7分烂片全场起立,百花奖撕开遮羞布

阿废冷眼观察所
2026-08-12 03:45:30
汪峰把公司1100人砍到400人,700人被裁。他说:“引入AI两个月,剩下400人干得比原来还好”,财务笑开了花。

汪峰把公司1100人砍到400人,700人被裁。他说:“引入AI两个月,剩下400人干得比原来还好”,财务笑开了花。

背包旅行
2026-08-11 11:40:42
人社部定调!普涨时代结束,未来5年“钱袋子”这样鼓起来

人社部定调!普涨时代结束,未来5年“钱袋子”这样鼓起来

陈博世财经
2026-08-11 14:06:56
我去面试,HR全程用3国语言装高端,我故意装不懂,直到老板进来用方言问:这娃咋样?我用家乡话回:我看不错。老板大喜录用我

我去面试,HR全程用3国语言装高端,我故意装不懂,直到老板进来用方言问:这娃咋样?我用家乡话回:我看不错。老板大喜录用我

晓艾故事汇
2026-08-10 14:16:44
2026-08-12 05:55:00
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4396322文章数 9247关注度
往期回顾 全部

科技要闻

AI大战变天:扎克伯格突然回头

头条要闻

郭兰英逝世 曾演唱《我的祖国》《南泥湾》

头条要闻

郭兰英逝世 曾演唱《我的祖国》《南泥湾》

体育要闻

NBA老顽童,抽着大麻喝着小酒告别了

娱乐要闻

“雅典娜”确认被害 细节令人发指!

财经要闻

AI泡沫的剧本,是2008年的次贷危机?

汽车要闻

闪充/天神之眼B/云辇-C 2027款海豹06售9.99万元起

态度原创

健康
艺术
游戏
本地
公开课

心血管专家破解猝死八大谣言

艺术要闻

色彩的盛宴,视觉的狂欢:西班牙水彩大师福斯蒂诺·马丁·冈萨雷斯的艺术世界

淘宝百亿补贴 港版PS5轻薄款降至3600元:可冲了?

本地新闻

黄州一夜,苏轼写给普通人的月光

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版