2026年,学界一口气提出了四种解释神经网络训练中损失尖峰的机制。每一篇论文都言之凿凿,在自己的实验设置里验证了因果。但问题是——没人跑过别人的实验。
一位同时担任同行评审期刊编辑的研究者决定较真。他搭了一个受控的玩具基准,把四种机制放在同一套设置下同时测试。结果有点尴尬:单独来看,没有一种机制能导致尖峰。
![]()
四种机制,各测各的
这四种机制分别是:稳定边缘临界性、权重范数临界性、数值特征膨胀,以及非正态瞬态放大。每篇论文都声称自己找到了损失尖峰的根源,但测量方法各不相同,实验设置也各说各话。
新实验构建了一个统一的测试环境:MLP加LayerNorm、普通SGD、学习率与权重衰减相图、60次运行、每个单元3个种子。每次运行都同时测量四种机制各自指认的触发量。结果如下:
- 权重范数崩溃发生在所有带权重衰减的运行中,但只有37.5%与尖峰一致
- 跨越EoS阈值如同抛硬币,一致性仅54.5%
- fp64训练的尖峰数量与fp32一样多,排除了精度引起的弹弓式尖峰
换句话说,每种机制单独拿出来,都解释不了尖峰的全貌。
关键实验:冻结隐藏投影
研究者做了一个更狠的测试。在尖峰前的分支处冻结隐藏投影,结果0/5的种子消除了尖峰。而对照组和冻结读出层的分支,5/5的种子都出现了尖峰,置信区间完全不重叠。
这个对比指向一个规律:损失尖峰既需要尖锐状态(λmax ≥ 2/η),也需要尺度不变的隐藏投影权重的持续适应。是尖锐状态下隐藏投影共同适应导致的动态不稳定性,而非某个静态阈值。
这为非正态瞬态放大框架提供了首个玩具规模上的因果证据。此前这一框架一直缺乏直接的因果支持。
一个预测失败却坚持前行的作者
更有意思的是论文的注册先验。作者原本预测权重范数或λmax单独即可导致尖峰,但数据直接驳斥了这两个假设。按常理,预测失败的研究往往会搁置或修改结论。
但作者选择继续推进,如实报告了失败。他在文中强调这是科学诚信的一个显著例子——尽管预测被自身数据推翻,仍然坚持把结果公之于众。
这项实验的局限也很诚实:玩具MLP、普通SGD,距离真实大模型训练还有距离。但它至少说明一件事:2026年那些单一机制的论文,可能都是在其他条件恰好成立的场景下,测量了一个必要条件。
损失尖峰这个困扰训练的老问题,答案或许比想象中更复杂。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.