网易首页 > 网易号 > 正文 申请入驻

像素级对标?智谱、Kimi 底层参数「撞衫」背后,藏着线性注意力的黄金窗口

0
分享至

来源:市场资讯

(来源:雷峰网)


国产大模型内卷到算子底层。

作者丨高允毅

编辑丨岑 峰

昨晚,智谱 AI 认领了最近一周在 OpenRouter 盲测榜上风头最盛的“牛来”模型,正式命名GLM-5.3-Flash。

这款上线首日就登顶 OpenRouter 调用量榜单,刷新全网长文本性价比斩杀线的国产模型,在底层架构上展现出“集百家之长”的特质。

它采用了混合架构,将 DeepSeek 的稀疏注意力机制(NSA) 与 Kimi 赖以成名的线性注意力机制结合 ,再叠加DeepSeek的流形约束超连接(mHC)技术,可以大幅降本提效。

今天早上,月之暗面核心研究员、“注意力残差”论文作者陈广宇,仔细研究了 GLM-5.3-Flash 的模型配置文件后,贴出一张 Kimi K3 和 GLM-5.3-Flash 的底层代码对比图。

他发现两者不仅都采用了KDA 线性注意力,排布逻辑高度重合,连核心参数“遗忘门下界”(gate_lower_bound) 同样是 - 5。


从 Kimi K3 公开技术报告到智谱上新,还不到一个月。有人感叹:哪怕是参考了 Kimi 的公开参数,短短 20 天内就能推出这么强的模型,也太惊人了。


这背后其实是一种技术必然。在大模型长文本的深水区,KDA,尤其是它的核心参数,一直是实现“长记忆”和“训练稳定性”的关键。线性注意力发展到今天,数值稳定的最优区间本就极度狭窄。即便是顶尖团队各自独立试错,最终也往往会收敛到同一个数值。

-5数值背后,既是Kimi K3在开源领域的巨大辐射力,也揭开了中国最顶尖的大模型团队,正不约而同迈进了同一个底层算子优化的技术深水区。



01

KDA的核心参数,为什么都选择-5?

为什么两家顶尖大模型团队,会不约而同地把 KDA 的核心参数设为 -5?要解答这个问题,得先搞懂大模型在长文本赛道经历了什么。

过去,传统 Transformer 架构用的是 Softmax 注意力机制,它保留了大模型的完整记忆。大模型会把每一个 Token 都存进 KV 缓存,随着对话拉长,计算量会呈平方级()暴涨,KV 缓存的显存占用也随上下文长度线性攀升,当上下文拉到百万级别,光 KV 缓存就能吃掉几十 GB 显存,推理成本高到无法商业化。

为了把成本打下来,行业开始转向“线性注意力”路线。月之暗面的KDA正是其中代表。

它不再保存全量 KV 缓存,而是用一块固定大小的状态矩阵压缩历史信息,模型一边写入新内容,一边用一个名为“遗忘门”的组件来控制旧信息的衰减。这样无论后续涌入多少文本,占用的显存基本保持恒定。这也是近期百万级长文本 API 能卖出“白菜价”的底层逻辑。

但这套 “压缩记忆”的模式 也有自己的天然缺陷,那就是数值溢出。

线性注意力靠循环乘法来更新状态,当它每处理一个新 Token,旧状态就要乘一次遗忘门系数。当上下文越来越长,乘法次数多了,数值要么不断变小直到彻底归零,要么反向暴涨成无穷大。这个过程,只要算出一个错误结果(NaN),训练直接崩溃,千万级算力直接打水漂。这就是线性注意力过去没有被广泛使用的原因。

这个瓶颈卡了很多年,直到一个名叫杨松霖的哈佛博士生,发表门控线性注意力(GLA)论文,系统提出门控状态衰减方案,这一问题才有了系统性的学术解决思路。他首次系统提出必须给状态衰减设一个“下限”,不允许它无限趋近于 0。

但从学术成果到大规模工业落地,仍有不少问题。

当月之暗面(Kimi)团队基于 GLA 演进出自研的 KDA 架构,试图将上下文推向 100 万字时,直接撞上了底层芯片的物理极限。

在大规模预训练中,万卡集群普遍使用的是 fp16 或 bf16 半精度浮点数,其数值动态范围极其狭窄。而线性注意力需要对超长序列进行数万次循环累乘,在这种递推计算中,任何微小的数值发散,都会在半精度芯片的反复乘法中被迅速放大。最终触发 NaN(非数)崩溃,导致高昂的训练算力成本折损。

为了规避这种因数值不稳定带来的算力风险,Kimi 的底层架构团队直接下潜到硬件算子层,在自研的 FlashKDA CUDA 内核里,设定 gate_lower_bound = -5。

-5 经过激活函数转换后,大约对应 0.67% 的留存率。这意味着,哪怕模型决定遗忘某段信息,也会被强制保留 0.67% 的旧信息。

至于为何是 - 5 这个数值,这是靠海量工程试错找出的黄金平衡点。

如果设得太高,比如设在 - 3,对应的留存比例约为 5%,旧信息在矩阵中过度堆积,会导致网络过载、梯度爆炸或上下文混杂幻觉。


如果数值太低,比如设在 - 8,对应留存比例仅约 0.03%,模型会出现严重的 “健忘症”,长文本读到后面就忘记前面的关键信息,在长代码调试、长财报分析等需要精准召回的任务直接失效。

-5 恰好卡在中间。在预训练中,它为算子底层的稳定性“保驾护航”;在推理端,它则是性价比之王,让线性注意力机制得以在极低的显存开销下稳住长文本召回率,使百万级长文本的商业化落地真正成为可能。


02

同样是 -5,Kimi和智谱又走出不同的路

但同样选择 - 5 的遗忘门下界,对于Kimi 和智谱又是不同的意味。

对于Kimi K3而言,它采用的是混合注意力架构,用线性注意力承接长上下文的记忆压缩,把显存和推理成本打下来;同时,它也用传统 Softmax 注意力,处理复杂逻辑推理,保证核心能力不打折。

在这套架构里,gate_lower_bound=-5从预训练启动的第一天就已嵌入,是原生设计的一部分。这个数值是 Kimi 团队在自身万卡级预训练中,通过大量试错踩出来的稳定解。 这些都在Kimi K3公开技术报告里体现了出来,底层算子怎么实现、配置怎么设、工程上踩过哪些坑,全部公开。

而智谱 GLM-5.3 Flash 的配置文件中,虽然出现了完全一致的 gate_lower_bound=-5,但陈广宇猜测这很有可能是“中途注入”。

这种操作在工程逻辑上完全成立,甚至是很高明的策略。在预训练中后期追加门控约束,再用调低后的学习率续训一段时间,不需要推倒重来重置权重,就能让一个原本就在相近区间摸索的模型,快速对齐行业验证过的最佳实践。这种打法省下的是动辄数亿的底层试错算力,体现的是智谱极强的工程落地效率。


当然这并不意味着仅靠改一个数字就能迭代出新模型,智谱本身在线性注意力方向已有数月研发积累,更合理的逻辑是,团队原本就在相近区间内做实验,看到 Kimi 报告明确验证了 - 5 在大参数量级下的稳定性后,直接采用了这一经过工业验证的最佳实践,省去了大量重复试错的成本。

那么,中途加入这样一个底层约束,到底会不会影响模型的实际表现?

评论区有一位开发者Oliver Sieberling认为,这属于 “非侵入式改动”。遗忘门本身是模型自适应学习的结果,加一个下限只是卡住了极端取值,并不会改变遗忘门本身的学习目标,对模型主体的扰动极小,更像加了一道安全护栏,性价比很高。


但这一取舍也有一定的风险,比如隐性分布偏移的危害。 模型经过几千万步预训练,已经形成了 “遗忘门可以调到极低” 的内在行为模式,中途突然锁死下限,相当于半路修改了底层运行规则。表面上看训练损失、公开基准跑分都正常,但模型内部的记忆分布其实已经悄悄发生了偏移。

这种偏移很难通过常规测试发现,但在 50 万字以上的超长代码、超长文档这类极端长尾场景中,可能会因为残留信息持续累积出现 “慢性中毒”,产生一些逻辑错误。

事实上,在长文本底层优化这条赛道上,并非只有这一条路线。国内另一家顶尖玩家DeepSeek,就走出了完全独立的技术路径。

他们没有采用 Delta Rule 谱系下的 - 5 门控方案,而是沿着自研的 MLA(混合潜在注意力)与 NSA(原生稀疏注意力)持续演进,通过低秩压缩和硬件级算子优化,在另一套数学框架里实现了长序列的数值稳定。

为什么中国最顶尖的大模型团队,都集体下潜到算子层,死磕长文本的底层计算瓶颈?答案藏在大推理模型时代的算力账本里。

自 o1 与 DeepSeek-R1 开启强化学习大推理时代以来,模型在后台进行深度推导时需要自主生成几十万字的“思维链(CoT)”Token。如果还固守传统 Transformer 平方级增长的算力成本,超长思维链带来的显存黑洞,会直接吞掉任何一家公司的商业毛利。

谁能用线性的成本守住长文本的体验底线,谁就能在推理时代拿到最高的利润空间。而当行业都在相近的模型规模、相近的训练框架下做超参搜索时,基于 Delta Rule 的线性注意力,其数学收敛的物理极限区间,天然就指向这个窄小的黄金带。

从这个角度看,参数 “撞衫” 从来不是抄袭的佐证,而是行业集体挺进技术深水区时,必然会出现的技术趋同。


03

参数战之后,是品味、效率与创新的真正较量

回到最初的问题:智谱有没有“参考”Kimi的参数?

在“exe文件比txt文件重要”的工业界,这个问题其实已经不重要。大语言模型的技术日新月异,如果一直固守传统Transformer架构,在强调只讲究数学规律和商业ROI的产业界完全行不通。-5这个参数,不是属于谁的专利,而是在攀登技术高峰中,目前唯一一条被探明、不会摔得粉身碎骨的安全道路。

当大模型公司的竞争下沉到算子优化、数值边界、训练工程细节这些看不见的底层功夫。参数战之外,还有品味战、效率战、创新之战。这本身就是行业成熟的信号。

任何经受住万卡集群实战检验的“最佳实践”,都会在最短的时间内沦为行业的通用基建。这也解释了为什么国产大模型在长文本处理与超低成本推理上,能在极短时间内逼近甚至斩落国际顶尖闭源模型的身位。

因为在极致的算力压迫下,中国最顶尖的顶尖大脑,正在以一种惊人的敏捷度,最终都会不约而同地攀上统一做山峰的极顶,向物理极限不断发起挑战。

参考链接:https://x.com/nathancgy4/status/2092626984362725877

https://x.com/Zai_org/status/2092616204787626030

上车,雷峰网带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
俄罗斯终于露出了最致命的软肋!战死在乌克兰的,大多是布里亚特

俄罗斯终于露出了最致命的软肋!战死在乌克兰的,大多是布里亚特

果妈聊娱乐
2026-08-12 08:32:47
90%的律师,严重低估了 WorkBuddy

90%的律师,严重低估了 WorkBuddy

LegalMVP律海芒芒
2026-08-20 09:10:11
关于征集火箭军部队违规采购问题的公告

关于征集火箭军部队违规采购问题的公告

观察者网
2026-08-25 20:29:09
曝孙宇晨称景甜是“捞女”不讲信用,知情人称景甜被骗,及时止损

曝孙宇晨称景甜是“捞女”不讲信用,知情人称景甜被骗,及时止损

神颜贩卖机
2026-08-28 03:57:29
北京:事关采暖补贴,请务必在8月31日前完成这件事!

北京:事关采暖补贴,请务必在8月31日前完成这件事!

北青网-北京青年报
2026-08-27 15:56:03
我们为什么不能全民皆兵?回看首钢拉出13个团四万人的真实往事

我们为什么不能全民皆兵?回看首钢拉出13个团四万人的真实往事

近史谈
2026-08-25 15:43:40
哥哥五岁走失,二十年后我实习,刁难我的领导竟戴着哥哥的玉佩

哥哥五岁走失,二十年后我实习,刁难我的领导竟戴着哥哥的玉佩

观观说事
2026-08-26 18:20:03
3亿镑!曼城疯狂大清洗送走4.75亿豪阵,10年王朝一夜推倒重建!

3亿镑!曼城疯狂大清洗送走4.75亿豪阵,10年王朝一夜推倒重建!

小桥流水q
2026-08-27 10:17:02
刘翔深夜再发文:继续搞笑吧,我一直没有离开,并不是我不想走,而是你没让我走,10年了,突然现在要“安置”我……

刘翔深夜再发文:继续搞笑吧,我一直没有离开,并不是我不想走,而是你没让我走,10年了,突然现在要“安置”我……

浙江之声
2026-08-27 07:19:42
特朗普选择梭哈,凌晨2点准时动手,伊朗总统发声,言语尽显无奈

特朗普选择梭哈,凌晨2点准时动手,伊朗总统发声,言语尽显无奈

一口娱乐
2026-08-28 01:27:40
WTT 世界乒联发文,高调宣布王楚钦喜讯,与体育主播恋情早有真相

WTT 世界乒联发文,高调宣布王楚钦喜讯,与体育主播恋情早有真相

黄小仙的搞笑视频
2026-08-26 14:39:36
妻子出差回来后,我在她箱子发现一条男士内裤,她看到后脸色煞白

妻子出差回来后,我在她箱子发现一条男士内裤,她看到后脸色煞白

千秋文化
2026-08-16 19:36:35
罗森克兰茨,将率团访华

罗森克兰茨,将率团访华

政知新媒体
2026-08-27 11:53:42
在自嗨和瞎折腾上,有些人确实遥遥领先!

在自嗨和瞎折腾上,有些人确实遥遥领先!

胖胖说他不胖
2026-08-12 09:49:28
80后夫妻存够300万后退休,每个月一万利息花不完,却比上班还痛苦

80后夫妻存够300万后退休,每个月一万利息花不完,却比上班还痛苦

小邵说剧
2026-08-24 08:29:51
美国又“国家紧急状态”了……

美国又“国家紧急状态”了……

环球时报国际
2026-08-28 07:50:10
藏了21年的雷彻底炸了,中国官方发全球征缴令,潘石屹躲得掉吗?

藏了21年的雷彻底炸了,中国官方发全球征缴令,潘石屹躲得掉吗?

明天见灌装冰块
2026-08-13 20:00:24
生过男孩的女性,体内会长期存在男性DNA?!多项研究:妊娠期间,胎儿细胞会通过胎盘进入母体血液循环,甚至分化为功能细胞

生过男孩的女性,体内会长期存在男性DNA?!多项研究:妊娠期间,胎儿细胞会通过胎盘进入母体血液循环,甚至分化为功能细胞

梅斯医学
2026-08-09 07:54:41
如果不算核武器,全球十大军事强国分别是谁?第一名你想不到!

如果不算核武器,全球十大军事强国分别是谁?第一名你想不到!

铭记历史呀
2026-08-26 20:08:56
被算出来的“一胎化”:1979年那场影响几亿人的决定,陈云为何说“准备挨骂”

被算出来的“一胎化”:1979年那场影响几亿人的决定,陈云为何说“准备挨骂”

z千年历史老号
2026-08-26 21:25:49
2026-08-28 14:27:00
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4580704文章数 9372关注度
往期回顾 全部

科技要闻

AI牛马永不下班!OpenAI让智能体自己找活

头条要闻

超载渣土车肇事致女童遇难 父亲:女儿胸部以下都没了

头条要闻

超载渣土车肇事致女童遇难 父亲:女儿胸部以下都没了

体育要闻

曼城花1个亿,买下了摩洛哥的“国民女婿”

娱乐要闻

孙宇晨魔性长文加真实诉讼,围剿景甜

财经要闻

一颗卵子想割孙割3.4亿?多个圈全炸锅了

汽车要闻

享界G9现身机器人运动会 国产豪华智驾对话未来

态度原创

艺术
数码
游戏
健康
公开课

艺术要闻

一个南瓜卖几千万,也就只有她了!

数码要闻

一根内存,双倍快乐!技嘉Z890 Single Boost装机省钱大法

顶级互动电影体验!艺画开天跨界新游《凡应》今日开启第二轮测试

突发脑梗怎么救命?一定看这两条路

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版