网易首页 > 网易号 > 正文 申请入驻

Transformer上限触顶,Mobius能否引发下一代模型架构的革命?

0
分享至



Transformer 的上限在哪里?这个问题从 2022 年 ChatGPT 问世起,就开始被广泛讨论。

最近一两个月,这个问题的答案初见端倪。前 OpenAI 推理负责人 Jerry Tworek 与前 Google Gemini 预训练负责人 Rohan Anil 公开表态,Transformer 已经走到尽头,并成为走向 AGI 的最大瓶颈[1]。

国内头部基础大模型也在积极尝试改进版的 Transformer 架构,但进行这些改进的一部分原因是算力瓶颈,并不完全是为了提升架构的能力上限。通过稀疏/线性注意力来降低架构复杂度,这些方案大幅提升了训推效率,在资源受限的情况下成功实现了更大的参数规模,并让模型能力逐渐趋近国外闭源模型。然而,半年后,这些复杂度更低的架构是否同样会碰壁,还需要打一个问号。

那么,随着 Transformer 上限触顶,AI 的下一代模型架构应该具备哪些特质?来自上海人工智能实验室的书生 Mobius 团队给出了一条可能的路径——通过知识与推理分离,探索在持续学习、组合泛化等方向上能力上限更高的架构,并顺带用更高的能力上限倒逼训推效率的提升。

在这个思路下,团队提出的 Mobius 系列架构,有望在未来赋能商用落地、持续自进化、科学发现等多个关键问题或领域。



  • 论文标题:Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning
  • GitHub 链接:https://github.com/InternLM/Intern-S2-Mobius
  • Hugging Face 链接:https://huggingface.co/internlm/Intern-S2-Mobius
  • Technical Report 链接:https://github.com/InternLM/Intern-S2-Mobius/blob/main/Technical_Report_Intern_S2_Mobius.pdf
  • Arch Space 链接:https://github.com/InternLM/archspace/issues/9

Transformer 的「三宗罪」

自从 Transformer 问世以来,工业界通过不断 Scaling 数据量、参数量,以一种 ROI 非常高的方式,获得了举世瞩目的强大模型。这些模型在自然语言、代码、数学、视频等许多任务上,展现出了前所未有的超强智能。

然而,在基于 Transformer 的模型越来越大、能力越来越强的同时,Transformer 始终具有的「三宗罪」却一直被忽略,没有得到有效解决。这「三宗罪」分别是:

(1)学过的,不能快速回想起来;

(2)新学的,想要记好,成本太高;

(3)没学的,难以通过联想构建。

对于(1),从现有模型的端到端推理效率中便可见一斑。初代 ChatGPT 仍然不具备很强的数学和代码能力。随着 OpenAI O1 的横空出世,超长思维链(Chain-of-Thought,CoT)以及配套的强化学习(Reinforcement Learning,RL)算法正式进入公众视野。

在深度思考模式下,通过不断输出 Token,模型可以持续进行试错、验证和纠错,并大幅提高答对复杂问题的概率。可见,模型并不是不会解决这些问题,而是需要恰当的手段激发出它们内在的潜力。

然而,极致的「啰唆」意味着极致的不聪明和反应慢,长 CoT 只是一种较为低效的智能激发方式。抛开聪明与否不谈,这种超长 CoT 还会让模型在完成任务时耗费非常多的算力和时间。因为长度就摆在那里,推理效率很难随着对 Attention 或 Infra 的充分优化而产生质的飞跃。

对于(2),这其实是在 AI 领域存在已久的持续学习问题,狭义上指在学会新知识的同时不遗忘旧知识,并非 Transformer 自己的「锅」。反而在 Transformer 架构被不断 Scaling 之后,人们发现这个架构原生具备 Few-shot Learning 和 In-Context Learning 能力。

因此,在回答模型没学过的问题时,只要通过 RAG 的方式构造足够充分的上下文,模型就有不小的机会答对这个问题。

然而,人类的需求是无限的,Transformer 的注意力是有限的。随着解决问题所需的知识不断增多,RAG 得到的长上下文所具有的低信息密度属性,反而会成为模型解答问题的瓶颈(即使是开卷考试,不画重点地扔给我们几百页从未读过的书,恐怕也很难找到答案)。看起来,高密度的记忆才能带来真正高效的持续学习。

不过,对于 Transformer 而言,最有效的高密度记忆方式是大规模预训练。假如希望加入一个新领域的知识,最好将核心的旧数据和部分新数据混合,再把模型续训甚至重训一遍。一方面,成本不可接受;另一方面,这也违背了持续学习的初衷。

对于(3),这是一个困扰 AI 领域更久的组合泛化问题,狭义上指通过见过的知识,自动学会没见过的知识,也不是 Transformer 所特有的。并且,随着 Transformer 的 Scaling,人们发现这类模型还可以 Zero-shot 地完成一些从未见过的任务。

不过,目前 Transformer 可以 Zero-shot 解决的问题,更多是流程性的、有明确逻辑链条的问题。在一些强调直觉、联想的领域,如科学发现,Transformer 产生重要泛化的例子屈指可数。

爱因斯坦发现「广义相对论」,不仅因为他同时了解「狭义相对论」和「黎曼几何」这两条知识,还因为这两条知识在某一时刻同时被激活,俗称「灵感迸发」。Scaling 后的 Transformer 架构,已经足以让两条知识同时出现在一个模型中。但在单次推理中,如何提高不同知识同时被看见、同时被激活的概率,是增加不同知识之间产生组合泛化机会的关键。

「三宗罪」的共同源泉

先给出结论,上面的「三宗罪」可以共同归因于一点——分层的记忆与推理。

根据学术界对于 Transformer 的主流理解,全连接层(FFN)负责记忆存储,注意力层(Attn)负责组合推理。不同层的 FFN 存储不同的记忆,相同的 Token 在不同层可以激活出不同的知识;不同层的 Attn 完成不同形式的组合,相同的知识输入在不同层可以产生不同的推理结果。

并且,由于 Transformer 的层间存在递归特性,当前层的 Attn 主要处理上一层 FFN 中取出的知识。当然,由于层间 Residual Connection 的存在,Attn 也可以处理一部分从靠前层取出的知识。

根据 Transformer 的层次化记忆与推理机制,我们可以发现:

(1)在推理时,如果想要完整回顾学过的所有知识,需要经过所有层才行。一旦错过关键知识,只能强行「挤」出一句废话来争取时间,再重新来到第一层,多取几次知识;

(2)知识在不同层的存储管理比较混乱,既存在一定的重叠,又存在一定的耦合关系。学习新知识时,模型无法判断应该将其插入哪里,所以只能暴力地同时更新所有知识;

(3)不同层之间的知识和推理,主要通过 Residual Connection 这条狭窄通路进行连接。即使关键知识都被激活了,等这些知识「见面」时,靠前层的知识也已经被稀释得差不多了。

可见,分层的记忆与推理,不仅限制了知识读取的效率,还限制了知识存储的便利性,更限制了不同知识之间产生组合泛化的概率。如何构建更好的记忆和推理机制,可能成为提升 AI 模型能力上限的关键。

一箭「三」雕的 Mobius

假如将不同层中记忆与推理的耦合关系拆解开,将每层的记忆全部取出,存储为一个共享池,并让每一层的 Attn 都可以访问这些知识,上述三个问题就有机会迎刃而解:

(1)假设推理层数相同,共享记忆后的模型可以更多次地遍历(Traversal)这些知识,有更大的机会取出关键知识,也就更容易输出有用的话;

(2)所有知识进行扁平化存储后,新知识就可以「一览无余」地看到自己应该去哪个位置,更少担心自己的加入会产生牵一发而动全身的问题;

(3)在每次经过共享记忆库时,所有知识都有机会被同时激活,大大增加了不同知识直接「见面」的机会,也有可能带来更好的组合泛化。



架构示意图

在这个思路之下,Mobius 架构被设计出来。目前的实验已经证明,Mobius 对(1)有直接帮助:Mobius 在端到端推理效率较 Transformer 提升近 4 倍的同时,下游任务准确率并未变差。

并且,Mobius 对(2)和(3)也已经展现出间接帮助。例如,Mobius 可以用 60% 的数据达到与 Transformer 相近的 MMLU 分数,具备更好的数据压缩率;在一些知识组合泛化任务中,Mobius 相较 Transformer 提升了 2 倍。



7B 从头预训练的 MMLU 得分



35B 续训练的下游任务得分



35B 续训练的推理速度



35B 续训练的 CoT 长度



Toy Model 的组合泛化验证

其实,从 Transformer 到 Mobius 的改造,与当初从 RNN 到 Transformer 的改造有着异曲同工之处:

(A)从 RNN 到 Transformer 的改造,是将 Token 之间「Recurrent + Residual Connection 的组合」转换为 Full-Connection;

(B)从 Transformer 到 Mobius 的改造,是将知识之间「Recurrent + Residual Connection 的组合」转换为 Full-Connection。

上一代改造完成后,Transformer 大幅提升了基座模型的能力上限。这一次改造会不会产生相似的效果,我们拭目以待。



RNN、Transformer、Mobius 的对比

站在学术热点视角理解 Mobius

近期,对于 Residual Connection 和 Latent Reasoning 的改进比较火。如果站在这两个角度细想,你可能还会发现,Mobius 原生支持 Backward Residual Connection 和 Dynamic Latent Reasoning。

无论是最早的 ResNet,还是近期出现的 Hyper-Connection、Attention-Residual,它们的共性功能都是「在前向传播时,将浅层的信息传向深层;在反向传播时则相反」。

正如上文分析过的,这种单向传播存在一个问题:一旦有些关键知识被错过,或者有些深层知识反而是浅层知识的读取前提,模型就只能输出一些「废话」,再循环一次。

Mobius 在做法上,是将不同层的知识存储到一起;但在思想上,可以认为它引入了一种反向的 Residual Connection。这种残差连接可以让信息传递更加灵活,提高模型的知识压缩率和推理效率。

相比 Token-by-Token 的推理方式,Latent Reasoning 使用连续的 Embedding 连接两次循环,也起到了某种残差连接的作用。不过,传统的 Latent Reasoning 是低效的。

首先,Latent Reasoning 要求模型每次循环都经过所有层,不论某些层的知识是否已经不再必要。另外,进行多次迭代的 Latent Reasoning,通常只是为了迭代一个 Token 的表征。相比之下,Mobius 原生支持一种更加动态的 Latent Reasoning 机制。

一方面,由于 Mobius 在每一层都有机会访问所有知识,并且没有限制这一层必须激活哪些知识,因此,Mobius 每经过一层,不仅可以视作完成了一次 Latent Reasoning,而且还能进行更加灵活的激活选择,减少冗余计算。

另一方面,Mobius 在每一层迭代的不只是一个 Token 的表征,因此,在经过各层的过程中,它具备更高的迭代效率和更加连续可微的优化路径。

Mobius 的下一步——递归自进化、

AI 辅助科学发现、世界模型与软硬协同设计

递归自进化、AI 辅助科学发现和世界模型,正成为最重要、也最亟待解决的前沿应用:

  • 现阶段的递归自进化工作中,有迭代数据的,有迭代参数的,也有迭代架构的……不过,无论采用哪种自进化方式,都需要构建一种高密度、高灵活性的记忆存储与记忆拓展机制,用于模型的可持续生长。

  • Coding 基本是流程性问题的完备解,但 Research 是流程、直觉与知识组合泛化的联合体。为了实现科学发现,需要让足以发掘出「未知的已知」的关键知识,既同时存储在模型中,又能在某次推理中被同时激活。

  • 语言模型建模的是离散的 Token,世界模型建模的是连续的物理世界。这个世界不仅色彩丰富,更是波段丰富、模态丰富。相比语言模型,世界模型对于连续可微的理解和推理方式有着更加迫切的需求。

不难发现,Mobius 知识与推理分离的设计,恰好呼应了递归自进化和科学发现的两个核心需求,在这两个方向上有机会成为比 Transformer 更具潜力的模型。Mobius 原生支持的 Latent Reasoning,则有机会为世界模型带来帮助。

不过,如果想在更大程度上帮助世界模型,对 Attn 机制的改变可能更加重要,这些变化也会在未来版本的 Mobius 中有所体现。

现阶段的 Mobius 虽然带来了端到端推理速度的提升,但这部分提升主要源于 Mobius 更加高效的推理路径带来了更短的 CoT。在比较单个 Token 的推理效率时,Mobius 相比 Transformer 还有一点距离。

这部分距离主要源于 Mobius 在算法上的知识与推理分离,天然带来了硬件上的存算分离特性。这种特性所面临的访存墙、通信墙,是阻碍 Mobius 进一步提高推理效率的根源。

Mobius 提供了更高的能力上限,但如何设计更加适合 Mobius 的存取策略、并行策略,甚至更加适合 Mobius 的硬件架构,是决定 Mobius 能否达到自身能力上限的关键。

[1] https://www.youtube.com/watch?v=2RJiaf0SY8s

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
质疑!1.4亿买19岁天才还是27岁老将?皇马队史标王引爆年龄大瓜

质疑!1.4亿买19岁天才还是27岁老将?皇马队史标王引爆年龄大瓜

体坛老球迷
2026-08-12 10:16:37
男童被巨浪卷走后续,官媒怒批家属,当地不敢救,救了也必死无疑

男童被巨浪卷走后续,官媒怒批家属,当地不敢救,救了也必死无疑

社会日日鲜
2026-08-11 09:21:27
第二批朝鲜兵抵达俄罗斯!兵力5万+新武器,泽连斯基最担心的事情还是发生了

第二批朝鲜兵抵达俄罗斯!兵力5万+新武器,泽连斯基最担心的事情还是发生了

军武次位面
2026-08-10 17:55:01
卫诗雅回应领奖后孤独下台:现场很多人不认识,只认识朱一龙和梁家辉,心情很开心没有孤独感

卫诗雅回应领奖后孤独下台:现场很多人不认识,只认识朱一龙和梁家辉,心情很开心没有孤独感

韩小娱
2026-08-12 12:04:44
一超市老板租借手机号7000余个,从购物平台“薅掉”10余吨大米、鸡蛋,通过自己的超市售卖,已被警方抓获

一超市老板租借手机号7000余个,从购物平台“薅掉”10余吨大米、鸡蛋,通过自己的超市售卖,已被警方抓获

极目新闻
2026-08-12 12:12:54
泪奔!程梦圆遗体腐臭,哥亲手抬棺送老家,哭着说:妹怕黑 咱回家

泪奔!程梦圆遗体腐臭,哥亲手抬棺送老家,哭着说:妹怕黑 咱回家

吃货的分享
2026-08-11 08:54:16
中印谈完不到24小时,印度给中国领土改名,连射两款导弹耀武扬威

中印谈完不到24小时,印度给中国领土改名,连射两款导弹耀武扬威

共工之锚
2026-08-12 00:27:19
脸都不要了?王宝强百花奖0票,这是200亿影帝的“羞辱”之夜

脸都不要了?王宝强百花奖0票,这是200亿影帝的“羞辱”之夜

文刀贰
2026-08-10 22:59:15
被烧了164年的圆明园,地下忽然传出动静,专家:我们被骗惨了

被烧了164年的圆明园,地下忽然传出动静,专家:我们被骗惨了

道远文史
2026-08-12 06:59:17
不查不知道!原来卫诗雅身上这条亮眼的蓝裙子,只是一件27000的成衣,英皇根本没有给她借到高定礼服

不查不知道!原来卫诗雅身上这条亮眼的蓝裙子,只是一件27000的成衣,英皇根本没有给她借到高定礼服

火山詩话
2026-08-12 08:15:28
“结婚八年三女儿均非亲生”离婚案将于8月17日开庭

“结婚八年三女儿均非亲生”离婚案将于8月17日开庭

澎湃新闻
2026-08-12 11:03:10
宁波环城南路高架下起“火瀑布”?交警回应:系面包车自燃,无人员受伤

宁波环城南路高架下起“火瀑布”?交警回应:系面包车自燃,无人员受伤

齐鲁壹点
2026-08-12 12:15:02
货拉拉司机加价不成带着货跑到600多公里外,平台介入交涉仍拒交货

货拉拉司机加价不成带着货跑到600多公里外,平台介入交涉仍拒交货

新闻晨报随申Hi
2026-08-11 18:52:19
好评中国 | “人工智能+”澎湃经济新浪潮

好评中国 | “人工智能+”澎湃经济新浪潮

闪电新闻
2026-08-12 08:48:19
诺奖委,是时候给黄院士颁奖了!本人首次回应来了!

诺奖委,是时候给黄院士颁奖了!本人首次回应来了!

闲侃闲侃
2026-08-12 08:08:33
今日北京铁路计划停运123趟列车,民航计划取消航班57架

今日北京铁路计划停运123趟列车,民航计划取消航班57架

新京报
2026-08-12 10:39:29
离婚半年后,我还是想他,鼓起勇气给他发了条消息:干嘛呢?他秒回:你只要再多问一个字,我明天就坐最早的飞机回来追你

离婚半年后,我还是想他,鼓起勇气给他发了条消息:干嘛呢?他秒回:你只要再多问一个字,我明天就坐最早的飞机回来追你

晓艾故事汇
2026-08-12 10:14:47
如临大敌!网传坊间相互提醒重庆王先生一伙人到西藏旅游,评论区炸锅

如临大敌!网传坊间相互提醒重庆王先生一伙人到西藏旅游,评论区炸锅

火山詩话
2026-08-12 07:31:02
世界杯夺冠英雄 5000万送走!巴萨离队第7人敲定 只差官宣

世界杯夺冠英雄 5000万送走!巴萨离队第7人敲定 只差官宣

叶青足球世界
2026-08-12 09:00:44
“卫诗雅百花奖获最佳女主后孤独下台”引热议,本人回应:现场认识的人不多,也就梁家辉和朱一龙,并不是孤单;原本担心获零票会很尴尬

“卫诗雅百花奖获最佳女主后孤独下台”引热议,本人回应:现场认识的人不多,也就梁家辉和朱一龙,并不是孤单;原本担心获零票会很尴尬

鲁中晨报
2026-08-12 11:06:52
2026-08-12 13:40:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13739文章数 142718关注度
往期回顾 全部

科技要闻

Claude又出骚操作 改个错字也要留AI水印?

头条要闻

行长套取2100万获刑:3100万的万柳书院月供9万压力大

头条要闻

行长套取2100万获刑:3100万的万柳书院月供9万压力大

体育要闻

乔丹鲨鱼们的合同:1996,史上最伟大夏天

娱乐要闻

陈思诚恋情疑云再起

财经要闻

李嘉诚,再一次大撤退!他嗅到了什么?

汽车要闻

闪充/天神之眼B/云辇-C 2027款海豹06售9.99万元起

态度原创

数码
教育
艺术
家居
公开课

数码要闻

英特尔一口气修了8个漏洞!酷睿Ultra到至强全中招:速更新微码

教育要闻

2026上海长宁高中补习机构推荐|上海长宁家长辅导班实测优选(2026优选版)

艺术要闻

只租20年,她在京郊为父母造养老小院:比买房值

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版