![]()
作者 | 四月
“做大模型其实并没有什么秘密。”
两个月前,从 OpenAI 空降腾讯的姚顺雨,在谈及大模型竞争时这样说道。当时很少有人真正在意这个论断。毕竟,此话由一位顶级研究员口中说出,未免有凡尔赛之嫌。
但只要看清他接手的战局,就知道这未必是谦辞。
过去半年,智谱、月之暗面、DeepSeek、千问……群狼环伺,开源旗舰的更新周期被压到几个月,甚至数周;而腾讯,急缺一款能在行业里站稳脚跟的旗舰产品。
这位不到30岁的空降少帅,接手的从来都不是一摊慢工出细活的研究课题,而是一场容不得半点迟疑的前线救火。他要做的,是在最短时间内重组团队、更新血液,拿出一个稳站第一梯队的答案。
上周,混元交出了这份答卷。
![]()
这是混元大语言与多模态两大部门合并重组后的首次大考,混元4(Hy4 preview)各项指标直逼第一梯队,参数规模770B,支持百万上下文,距离上一代大版本发布不到四个月。
细品模型的 README,你会猛然回过味来:姚顺雨说的是大实话。
从官方坦诚架构设计“受到DeepSeek和GLM启发”,到注意力模块借鉴DeepSeek的DSA与智谱的IndexCache机制,再到GLM-5的核心研究员一个月前出现在混元论文作者栏……
原来大模型所谓的“独门秘笈”,早已被顶尖人才的高速流动、极度透明的开源机制迅速瓦解。
一套熟悉的骨架
要看清混元4的底牌,最直接的方法,是翻开它的底层配置文件(Config)。
当模型参数来到 700B (7000亿)这一中大规模档位,各家模型厂面对的其实是同一道算力极限题。在混元4交卷之前,国内在这个体量上真正跑通万卡训练、并立住口碑的,是智谱在今年2月发布的 GLM-5(744B)。
相隔半年,同处 700B 的量级,把两代旗舰的底层骨架并排摊开,重合之处一目了然:
![]()
这里的前四项基本决定了一款Transformer主干网络的深度、宽度和注意力并行结构;后四项则进一步还原了模型的稀疏注意力内部,涉及Query如何压缩、负责筛选Token的索引器开多少个头,以及每次最终保留多少Token。
当模型主干与稀疏注意力内部同时对齐,可以看出,同一个量级的大模型工程最优解,正在收敛。
隐藏维度6144、78层、64个注意力头——这是智谱用真金白银砸出来的‘700B最优解’,而开源,让它成了全行业公认的共识底座。对于急需突围的混元来说,没有理由绕开它重踩一遍坑。
技术沿路迁移
具体到架构,Hy4架构最核心的注意力模块,主干来自DeepSeek的稀疏注意力机制,同时叠加了智谱团队最新验证的跨层索引复用。最后,连同GLM-5核心贡献者白雨石一起,移植到了腾讯混元。
先从源头DeepSeek说起。
2025年9月,DeepSeek在V3.2-Exp中首次公开DeepSeek稀疏注意力(DeepSeek Sparse Attention,DSA),名字里的"D",毫不掩饰地标注着它的原创归属。
它针对的是超长上下文越来越昂贵的注意力计算:先增加一个轻量级索引器,从漫长上下文里筛出真正值得关注的Top-K Token,再进行核心注意力计算,避免每一次都遍历全部历史信息。
两个月后,DSA进入V3.2正式版,并被DeepSeek列为当代模型的核心技术突破之一。长文本的行业基准,就此改写。
很快,接力棒到了智谱手里。
今年2月,744B参数的GLM-5直接采用了DSA。但真正把这套稀疏注意力做到超大规模后,智谱团队很快发现另一个隐藏的成本黑洞:注意力虽然稀疏了,负责筛选Top-K Token的索引器却仍然要在不同网络层反复运行,无疑是巨大的浪费。
一个月后,IndexCache给出了解法。
![]()
智谱AI联合清华团队发表研究称,相邻Transformer层最终筛出的Top-K Token高度重合。既然上一层刚算过,下一层何必重新找一遍?于是,IndexCache让大量网络层直接复用已有索引结果。
这个四两拨千斤的改动,最高可以砍掉75%的索引器计算量。更关键的是,它没有停留在小模型实验,而是在744B的GLM-5上完成了生产级验证:削减50%索引器计算后,端到端仍取得约1.2倍提速。
从中不难看出,在开源生态下,大模型技术的迁徙周期已被压缩到以月计。
2025年9月,DeepSeek将DSA推向开源;次年2月,智谱将其部署进GLM-5;到了3月,智谱继续将其向前推演,迭代出IndexCache;2026年8月,这套组合拳已经赫然出现在770B的混元4身上。
不到一年时间,一项针对算力瓶颈的底层创新,就完成了从概念提出、工程降本到全行业旗舰标配的完整闭环。
论文背后的人
技术接力只是故事的一半。另一半,藏在论文的作者栏里。
在大模型这场智力密集的角逐中,任何一项能改变行业走向的底层优化,背后都站着极其稀缺的顶尖大脑。
混元能在四个月里把长文本架构拉满(从295B的Hy3到770B的Hy4),靠的不只是公开的论文,更是那个亲手把积木严丝合缝嵌进混元底座的研究员。![]()
白雨石,清华姚班2022届本科毕业生,随后留清华计算机系读博,师从清华大学人工智能研究院知识智能中心主任李涓子;在此期间,他先后赴斯坦福、哈佛做访问研究,并参与了唐杰、刘知远、Jure Leskovec、Ariel Procaccia等知名学者的研究项目。
在入职腾讯之前,白雨石是智谱GLM-5这条架构线上的关键人物。
![]()
今年2月GLM-5发布时,白雨石在个人主页上介绍:“GLM-5新模型架构(DSA)、架构改进以及强化学习适配的负责人”。GLM-5 的技术论文里也能看到他的署名。
![]()
一个月后,他又以第一作者身份发布IndexCache,把GLM-5刚刚采用的全新DSA继续往前推进。不过,他当时在智谱的身份还是实习生。
有意思的是,腾讯和他的交集,其实开始得更早。
![]()
今年1月,白雨石入选首届腾讯青云奖学金(Tencent Project Up Scholarship)——这是腾讯面向AI前沿在校硕博设立的顶尖人才项目,全国仅15人,每人20万元现金加30万元云算力,并明确提供进入腾讯实习、就业的通道。而为他颁奖的,正是刚接掌腾讯AI体系不久的“姚班”师兄,姚顺雨。
再往后,时间线突然加速。
7月3日,腾讯混元发布HiLS-Attention,一篇研究“无限上下文”的新型稀疏注意力论文。作者名单里,已经出现了Yushi Bai;论文归属机构包括Tencent HY Team。
![]()
一个多月后,Hy4发布。白雨石的个人简介同步更新:“Prev @Zai_org,currently scaling at @TencentHunyuan.”
如果说,论文完成了显性技术的公开,那么跳槽的天才们,则推进了隐性工程经验的物理迁徙。
大模型没有独家秘笈
今天,任何能够被论文、代码和实验数据完整表达出来的技术优势,独占期都在急剧缩短。
DeepSeek的DSA 发布即成为行业标准模块,智谱的IndexCache 不到五个月也被旗舰模型验证。更有意思的是,连一篇实验论证的知乎热帖,也在半年后并入了大厂的Model Card。
在残差侧优化上,Hy4并没有沿用DeepSeek复杂的mHC(流形约束超连接),而是选择了更简单的恒等超连接(identity Hyper-Connections,iHC)。而这项技术的参考链接,甚至都不能称之为正式研究,而是一篇在社交平台公开讨论的知乎热帖。![]()
![]()
从顶会论文,到开源代码,再到社区讨论……前沿架构的传播路径已经彻底扁平化。
据笔者了解,那位质疑 mHC、提出iHC方案的作者“涮月亮的谪仙人”(微软亚洲研究院研究员谢天),近期也从微软加入了阿里千问。
顶尖人才的高速流动,正在迅速填平领先大模型的护城河。
声明:本文为 AI 前线原创,不代表平台观点,也不构成投资建议,未经许可禁止转载。
会议推荐
QCon 全球软件开发大会·2026(上海站)现已正式启动。本届大会聚焦 Harness AI 时代的工程实践,从「构建 AI」到「驾驭 AI」,围绕 AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型等热门技术方向,邀请全球技术社区与产业一线实践者,共同分享 AI Native 时代最具价值的工程经验。
今日荐文
你也「在看」吗?
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.