网易首页 > 网易号 > 正文 申请入驻

像素级对标?智谱、Kimi 底层参数「撞衫」背后,藏着线性注意力的黄金窗口

0
分享至


国产大模型内卷到算子底层。

作者丨高允毅

编辑丨岑 峰

昨晚,智谱 AI 认领了最近一周在 OpenRouter 盲测榜上风头最盛的“牛来”模型,正式命名GLM-5.3-Flash。

这款上线首日就登顶 OpenRouter 调用量榜单,刷新全网长文本性价比斩杀线的国产模型,在底层架构上展现出“集百家之长”的特质。

它采用了混合架构,将 DeepSeek 的稀疏注意力机制(NSA) 与 Kimi 赖以成名的线性注意力机制结合 ,再叠加DeepSeek的流形约束超连接(mHC)技术,可以大幅降本提效。

今天早上,月之暗面核心研究员、“注意力残差”论文作者陈广宇,仔细研究了 GLM-5.3-Flash 的模型配置文件后,贴出一张 Kimi K3 和 GLM-5.3-Flash 的底层代码对比图。

他发现两者不仅都采用了KDA 线性注意力,排布逻辑高度重合,连核心参数“遗忘门下界”(gate_lower_bound) 同样是 - 5


从 Kimi K3 公开技术报告到智谱上新,还不到一个月。有人感叹:哪怕是参考了 Kimi 的公开参数,短短 20 天内就能推出这么强的模型,也太惊人了。


这背后其实是一种技术必然。在大模型长文本的深水区,KDA,尤其是它的核心参数,一直是实现“长记忆”和“训练稳定性”的关键。线性注意力发展到今天,数值稳定的最优区间本就极度狭窄。即便是顶尖团队各自独立试错,最终也往往会收敛到同一个数值。

-5数值背后,既是Kimi K3在开源领域的巨大辐射力,也揭开了中国最顶尖的大模型团队,正不约而同迈进了同一个底层算子优化的技术深水区。



01


KDA的核心参数,为什么都选择-5?

为什么两家顶尖大模型团队,会不约而同地把 KDA 的核心参数设为 -5?要解答这个问题,得先搞懂大模型在长文本赛道经历了什么。

过去,传统 Transformer 架构用的是 Softmax 注意力机制,它保留了大模型的完整记忆。大模型会把每一个 Token 都存进 KV 缓存,随着对话拉长,计算量会呈平方级()暴涨,KV 缓存的显存占用也随上下文长度线性攀升,当上下文拉到百万级别,光 KV 缓存就能吃掉几十 GB 显存,推理成本高到无法商业化。

为了把成本打下来,行业开始转向“线性注意力”路线。月之暗面的KDA正是其中代表。

它不再保存全量 KV 缓存,而是用一块固定大小的状态矩阵压缩历史信息,模型一边写入新内容,一边用一个名为“遗忘门”的组件来控制旧信息的衰减。这样无论后续涌入多少文本,占用的显存基本保持恒定。这也是近期百万级长文本 API 能卖出“白菜价”的底层逻辑。

但这套 “压缩记忆”的模式 也有自己的天然缺陷,那就是数值溢出

线性注意力靠循环乘法来更新状态,当它每处理一个新 Token,旧状态就要乘一次遗忘门系数。当上下文越来越长,乘法次数多了,数值要么不断变小直到彻底归零,要么反向暴涨成无穷大。这个过程,只要算出一个错误结果(NaN),训练直接崩溃,千万级算力直接打水漂。这就是线性注意力过去没有被广泛使用的原因。

这个瓶颈卡了很多年,直到一个名叫杨松霖的哈佛博士生,发表门控线性注意力(GLA)论文,系统提出门控状态衰减方案,这一问题才有了系统性的学术解决思路。他首次系统提出必须给状态衰减设一个“下限”,不允许它无限趋近于 0。

但从学术成果到大规模工业落地,仍有不少问题。

当月之暗面(Kimi)团队基于 GLA 演进出自研的 KDA 架构,试图将上下文推向 100 万字时,直接撞上了底层芯片的物理极限。

在大规模预训练中,万卡集群普遍使用的是 fp16 或 bf16 半精度浮点数,其数值动态范围极其狭窄。而线性注意力需要对超长序列进行数万次循环累乘,在这种递推计算中,任何微小的数值发散,都会在半精度芯片的反复乘法中被迅速放大。最终触发 NaN(非数)崩溃,导致高昂的训练算力成本折损。

为了规避这种因数值不稳定带来的算力风险,Kimi 的底层架构团队直接下潜到硬件算子层,在自研的 FlashKDA CUDA 内核里,设定 gate_lower_bound = -5。

-5 经过激活函数转换后,大约对应 0.67% 的留存率。这意味着,哪怕模型决定遗忘某段信息,也会被强制保留 0.67% 的旧信息。

至于为何是 - 5 这个数值,这是靠海量工程试错找出的黄金平衡点

如果设得太高,比如设在 - 3,对应的留存比例约为 5%,旧信息在矩阵中过度堆积,会导致网络过载、梯度爆炸或上下文混杂幻觉。


如果数值太低,比如设在 - 8,对应留存比例仅约 0.03%,模型会出现严重的 “健忘症”,长文本读到后面就忘记前面的关键信息,在长代码调试、长财报分析等需要精准召回的任务直接失效。

-5 恰好卡在中间。在预训练中,它为算子底层的稳定性“保驾护航”;在推理端,它则是性价比之王,让线性注意力机制得以在极低的显存开销下稳住长文本召回率,使百万级长文本的商业化落地真正成为可能。


02


同样是 -5,Kimi和智谱又走出不同的路

但同样选择 - 5 的遗忘门下界,对于Kimi 和智谱又是不同的意味。

对于Kimi K3而言,它采用的是混合注意力架构,用线性注意力承接长上下文的记忆压缩,把显存和推理成本打下来;同时,它也用传统 Softmax 注意力,处理复杂逻辑推理,保证核心能力不打折。

在这套架构里,gate_lower_bound=-5从预训练启动的第一天就已嵌入,是原生设计的一部分。这个数值是 Kimi 团队在自身万卡级预训练中,通过大量试错踩出来的稳定解。 这些都在Kimi K3公开技术报告里体现了出来,底层算子怎么实现、配置怎么设、工程上踩过哪些坑,全部公开。

而智谱 GLM-5.3 Flash 的配置文件中,虽然出现了完全一致的 gate_lower_bound=-5,但陈广宇猜测这很有可能是“中途注入”

这种操作在工程逻辑上完全成立,甚至是很高明的策略。在预训练中后期追加门控约束,再用调低后的学习率续训一段时间,不需要推倒重来重置权重,就能让一个原本就在相近区间摸索的模型,快速对齐行业验证过的最佳实践。这种打法省下的是动辄数亿的底层试错算力,体现的是智谱极强的工程落地效率。


当然这并不意味着仅靠改一个数字就能迭代出新模型,智谱本身在线性注意力方向已有数月研发积累,更合理的逻辑是,团队原本就在相近区间内做实验,看到 Kimi 报告明确验证了 - 5 在大参数量级下的稳定性后,直接采用了这一经过工业验证的最佳实践,省去了大量重复试错的成本。

那么,中途加入这样一个底层约束,到底会不会影响模型的实际表现?

评论区有一位开发者Oliver Sieberling认为,这属于 “非侵入式改动”。遗忘门本身是模型自适应学习的结果,加一个下限只是卡住了极端取值,并不会改变遗忘门本身的学习目标,对模型主体的扰动极小,更像加了一道安全护栏,性价比很高。


但这一取舍也有一定的风险,比如隐性分布偏移的危害。 模型经过几千万步预训练,已经形成了 “遗忘门可以调到极低” 的内在行为模式,中途突然锁死下限,相当于半路修改了底层运行规则。表面上看训练损失、公开基准跑分都正常,但模型内部的记忆分布其实已经悄悄发生了偏移。

这种偏移很难通过常规测试发现,但在 50 万字以上的超长代码、超长文档这类极端长尾场景中,可能会因为残留信息持续累积出现 “慢性中毒”,产生一些逻辑错误。

事实上,在长文本底层优化这条赛道上,并非只有这一条路线。国内另一家顶尖玩家DeepSeek,就走出了完全独立的技术路径。

他们没有采用 Delta Rule 谱系下的 - 5 门控方案,而是沿着自研的 MLA(混合潜在注意力)与 NSA(原生稀疏注意力)持续演进,通过低秩压缩和硬件级算子优化,在另一套数学框架里实现了长序列的数值稳定。

为什么中国最顶尖的大模型团队,都集体下潜到算子层,死磕长文本的底层计算瓶颈?答案藏在大推理模型时代的算力账本里。

自 o1 与 DeepSeek-R1 开启强化学习大推理时代以来,模型在后台进行深度推导时需要自主生成几十万字的“思维链(CoT)”Token。如果还固守传统 Transformer 平方级增长的算力成本,超长思维链带来的显存黑洞,会直接吞掉任何一家公司的商业毛利。

谁能用线性的成本守住长文本的体验底线,谁就能在推理时代拿到最高的利润空间。而当行业都在相近的模型规模、相近的训练框架下做超参搜索时,基于 Delta Rule 的线性注意力,其数学收敛的物理极限区间,天然就指向这个窄小的黄金带。

从这个角度看,参数 “撞衫” 从来不是抄袭的佐证,而是行业集体挺进技术深水区时,必然会出现的技术趋同。


03


参数战之后,是品味、效率与创新的真正较量

回到最初的问题:智谱有没有“参考”Kimi的参数?

在“exe文件比txt文件重要”的工业界,这个问题其实已经不重要。大语言模型的技术日新月异,如果一直固守传统Transformer架构,在强调只讲究数学规律和商业ROI的产业界完全行不通。-5这个参数,不是属于谁的专利,而是在攀登技术高峰中,目前唯一一条被探明、不会摔得粉身碎骨的安全道路

当大模型公司的竞争下沉到算子优化、数值边界、训练工程细节这些看不见的底层功夫。参数战之外,还有品味战、效率战、创新之战。这本身就是行业成熟的信号。

任何经受住万卡集群实战检验的“最佳实践”,都会在最短的时间内沦为行业的通用基建。这也解释了为什么国产大模型在长文本处理与超低成本推理上,能在极短时间内逼近甚至斩落国际顶尖闭源模型的身位。

因为在极致的算力压迫下,中国最顶尖的顶尖大脑,正在以一种惊人的敏捷度,最终都会不约而同地攀上统一做山峰的极顶,向物理极限不断发起挑战。

参考链接:https://x.com/nathancgy4/status/2092626984362725877

https://x.com/Zai_org/status/2092616204787626030

上车,雷峰网带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
8月27日 中国女排最新消息:王媛媛被误伤 吴梦洁出色 日媒质疑抽

8月27日 中国女排最新消息:王媛媛被误伤 吴梦洁出色 日媒质疑抽

北海史记
2026-08-28 12:13:54
家长轻信“排毒”给孩子药浴三个月,致7岁女儿八成皮肤溃烂

家长轻信“排毒”给孩子药浴三个月,致7岁女儿八成皮肤溃烂

南方都市报
2026-08-27 22:01:08
深圳这座大楼一旦投用,全世界都得重新认识中国

深圳这座大楼一旦投用,全世界都得重新认识中国

天气观察站
2026-08-28 02:01:13
河南省人民医院:郑大一附院之下,省人民怎么从老大哥变成备选?

河南省人民医院:郑大一附院之下,省人民怎么从老大哥变成备选?

华庭讲美食
2026-08-28 06:01:35
明明是吃得差,为什么报道成美国饥饿问题日益严重?

明明是吃得差,为什么报道成美国饥饿问题日益严重?

廖保平
2026-08-26 09:23:04
记者丨米兰可能提出先租后买方案

记者丨米兰可能提出先租后买方案

米兰圈
2026-08-28 08:55:39
希拉里直言评论:特朗普要从伊朗困境中脱身,关键点可能在于印度

希拉里直言评论:特朗普要从伊朗困境中脱身,关键点可能在于印度

观锐器
2026-08-26 22:15:05
“中午11点18分突发巨响”,江苏一地销毁烟花爆炸,隔壁市570多户家墙裂玻璃碎

“中午11点18分突发巨响”,江苏一地销毁烟花爆炸,隔壁市570多户家墙裂玻璃碎

黄河新闻网吕梁
2026-08-27 15:33:29
新华社记者抵近吉隆泥石流灾害核心现场,最新救援情况→

新华社记者抵近吉隆泥石流灾害核心现场,最新救援情况→

学申论的谈妹
2026-08-27 15:43:00
向全网道歉:我错了我曾经看错了郑丽文,以后她说什么我都不信了

向全网道歉:我错了我曾经看错了郑丽文,以后她说什么我都不信了

潋滟晴方DAY
2026-08-08 16:44:09
央视小尼离婚后不再婚,原因曝光:不是放不下前妻,是放不下她

央视小尼离婚后不再婚,原因曝光:不是放不下前妻,是放不下她

凛若秋霜
2026-08-27 00:08:39
细节破防!孙宇晨当年珍藏的景甜旧照流出,藏尽多年隐秘情愫

细节破防!孙宇晨当年珍藏的景甜旧照流出,藏尽多年隐秘情愫

东方不败然多多
2026-08-28 10:43:37
星宇股份向107位被劝退应届生致歉:发放求职生活补贴,积极联系其他企业提供适配岗位,如3个月内未实现就业,给予6个月工资作为补偿

星宇股份向107位被劝退应届生致歉:发放求职生活补贴,积极联系其他企业提供适配岗位,如3个月内未实现就业,给予6个月工资作为补偿

极目新闻
2026-08-27 08:40:12
为了这次地震,冥界准备了整整五十年?

为了这次地震,冥界准备了整整五十年?

神奇故事
2026-08-25 23:18:13
法媒:中国仍然怕“阵风”,宣传歼-16战胜“阵风”,是想阻止印度购买!如何反驳?我来教你

法媒:中国仍然怕“阵风”,宣传歼-16战胜“阵风”,是想阻止印度购买!如何反驳?我来教你

蓝星杂谈
2026-08-27 08:15:07
“断子绝孙”还有救?联合国曾预言:2050年,中国人口将出乎意料

“断子绝孙”还有救?联合国曾预言:2050年,中国人口将出乎意料

悦心知足
2026-08-23 03:55:40
比亚迪可变磁通电机全面铺开,刚提车的老车主坐不住了

比亚迪可变磁通电机全面铺开,刚提车的老车主坐不住了

刘哥谈体育
2026-08-27 01:59:53
中国第一位被处决女明星:37岁红遍中国,行刑前嘶吼:这不公平

中国第一位被处决女明星:37岁红遍中国,行刑前嘶吼:这不公平

小豫讲故事
2026-08-23 06:00:12
女星再曝猛料:4女共侍61岁男,陪玩陪睡只是冰山一角

女星再曝猛料:4女共侍61岁男,陪玩陪睡只是冰山一角

骄阳之夏明
2026-07-29 13:53:52
拒给景甜5000万美元全因AI建议!孙宇晨回应长文:大多数真实陈述

拒给景甜5000万美元全因AI建议!孙宇晨回应长文:大多数真实陈述

ETtoday星光云
2026-08-28 10:49:02
2026-08-28 13:19:00
雷峰网 incentive-icons
雷峰网
关注智能与未来!
70703文章数 656216关注度
往期回顾 全部

科技要闻

AI牛马永不下班!OpenAI让智能体自己找活

头条要闻

孙宇晨回应起诉景甜:某种程度上是Claude的锅

头条要闻

孙宇晨回应起诉景甜:某种程度上是Claude的锅

体育要闻

曼城花1个亿,买下了摩洛哥的“国民女婿”

娱乐要闻

孙宇晨魔性长文加真实诉讼,围剿景甜

财经要闻

一颗卵子想割孙割3.4亿?多个圈全炸锅了

汽车要闻

享界G9现身机器人运动会 国产豪华智驾对话未来

态度原创

艺术
时尚
教育
数码
本地

艺术要闻

一个南瓜卖几千万,也就只有她了!

女装完了,晚晚来了

教育要闻

为山东高考改革,点赞!

数码要闻

Aqara智能窗帘电机C100开售:原生支持Apple Home,售399元

本地新闻

昆明的雨,解锁汪曾祺的浪漫雨季

无障碍浏览 进入关怀版