网易首页 > 网易号 > 正文 申请入驻

训练会留下指纹:如何仅凭权重判断两个大模型是否"沾亲带故"

0
分享至


你有没有想过一个问题:如果你下载了一个开源大模型,改了个名字重新发布,别人能不能看穿这是"抄"来的?

不是通过对比它说话的风格,不是通过测试它答题的表现,就是纯粹盯着那一堆权重数字看,能不能看出这个模型的"血统"?

这个问题在2024年之后变得越来越棘手。开源模型的生态已经变成了一条复杂的供应链:一个基础模型被微调、被量化、被剪枝、被用低秩适配器改造、被和别的模型合并,然后换个名字重新发布。这些操作每一步都在生成新的"后代"模型,但它们的血缘关系往往没有记录,甚至是被故意隐藏的。

这就是一篇最新论文要解决的问题:**在完全不知道训练数据、不做任何前向推理、只看权重本身的情况下,能不能判断两个模型是否师出同门**。

现有方法为什么都不够用

在深入这篇论文的方法之前,得先搞清楚一件事:这个问题为什么没有被"顺手"解决掉。

如果你觉得这事应该很简单,无非是对比一下两个模型的参数嘛,那你可能低估了这里面的门道。先看看已经存在的几种思路,它们各自卡在了哪个坎上。

密码学哈希是最直接的想法,给模型权重算个哈希值,一样就是一样,不一样就是不一样。

> 密码学哈希:一种把任意长度数据转换成固定长度"指纹"的函数,哪怕原数据只改一个比特,输出的哈希值也会天差地别。

问题是,模型权重只要经过一次微调,哪怕只调了一层,哈希值就彻底面目全非了。这套方案对"一字不改的复制"有效,对"经过训练改造的复制"完全失效。

那模型卡(model card)和训练日志呢?这些文档理论上应该记录模型的来源。但这套机制的前提是分发者诚实。如果有人故意隐瞒血统重新包装模型,这些文档要么缺失要么被篡改,起不到任何验证作用。

数字水印技术呢?这个思路是训练时就往模型里嵌入一个只有开发者知道的隐藏标记,后续可以检测出来。但水印必须在训练之前就主动植入。已经发布在外面、从来没被打过水印的海量历史模型,这套方法对它们无能为力。而且已有研究发现,没有哪种水印方案能可靠地扛过微调和剪枝这类常规操作。

那用行为相似度来判断呢?比如CKA、SVCCA这类方法,通过让两个模型对同一批数据做推理,对比它们内部表示的相似程度。

> CKA(Centered Kernel Alignment)和SVCCA:两种通过分析神经网络在特定输入上的内部激活模式,来衡量两个模型表示相似程度的技术,常用于神经网络可解释性研究。

这类方法的根本问题在于,它测的是"表现像不像",而不是"是不是同一个血脉"。一个从零训练、专门模仿老师模型输出的"蒸馏学生"模型,可以在行为上表现得和老师一模一样,但它的权重是完全独立训练出来的,压根不算是老师的"后代"。用行为相似度去判断血统,会把这种蒸馏关系错误地认定为真实的继承关系。而且这类方法还需要准备数据、跑推理,成本不低。

还有最朴素的权重相似度比较,直接算两个模型权重的余弦相似度或者欧氏距离。这个方法在模型没被"打乱"过的情况下确实管用,但神经网络有个特性叫"重参数化对称性":你把某一层里的神经元顺序打乱,只要相应地调整下一层的连接,模型的输出功能完全不变,但权重数值已经面目全非。稍微懂行的人只要把权重神经元顺序打乱重排,朴素的权重比较方法立刻失灵。

最后是"重新对齐"(Re-Basin)这类方法,试图先把两个模型的神经元顺序重新排齐,再做比较。这个思路理论上更稳健,但计算成本极高,要对每一对候选模型做一次复杂度是模型维度三次方的匹配运算,速度慢得离谱。

这就是这篇论文想要打破的僵局。研究者们发现了一个此前被忽视的结构性线索,藏在"残差网络"这个如今几乎所有大模型都在用的架构设计里。

残差连接里藏着的秘密

要理解这篇论文的核心发现,得先说清楚什么是残差结构。

现在几乎所有的大模型,包括GPT系列、LLaMA系列,内部都是由很多个"模块"堆叠而成的。每个模块做的事情不是"重新计算一遍整个表示",而是在原来的表示基础上"加一点修正量"。用公式说,就是新的表示等于旧的表示,加上这个模块算出来的一个修正项。这条"直接把旧表示传下去"的路径,就叫跳跃连接或者残差连接。

> 残差连接(skip connection):神经网络里让信息绕过某个计算模块直接传递到下一层的连接方式,由何恺明团队在2016年的ResNet论文中提出,是现代深度网络能训练得很深的关键设计。

这个设计当年是为了解决"网络太深训练不动"的问题而发明的,但论文作者们发现,这个设计还带来了一个意外的副产品。

具体来说,每个残差模块内部通常有两层线性变换,一层是"输入投影",一层是"输出投影"。研究者把这两层权重矩阵相乘,得到一个"分支乘积矩阵"。神奇的地方在于:如果这两层权重是正确配对的(也就是真的来自同一个训练好的模块),这个乘积矩阵会呈现出一种很特殊的结构,矩阵的对角线上聚集了大量的"能量",用数学语言说就是矩阵的迹(对角线元素之和)占整个矩阵范数的比例特别高。而如果你把两个不相关的投影矩阵硬凑在一起相乘,这个比例就会低得多,接近随机水平。

论文里做了一个特别直观的实验来证明这一点。他们训练了一个真正带残差连接的网络(ResNet),同时训练了一个把跳跃连接去掉、结构完全一样的"纯净网络"(PlainNet),然后观察训练过程中这个"对角线聚集度"的变化。结果是:带残差连接的网络,这个对角线聚集的结构从训练一开始的随机状态,随着训练轮数增加越来越清晰,到训练后期几乎变成了一条明显的对角亮线;而去掉跳跃连接的纯净网络,不管训练多久,这个结构始终保持随机模样,没有任何规律浮现。

这说明什么?这个"对角线聚集"的现象不是网络初始化时天生就有的巧合,而是训练过程本身,配合跳跃连接这个结构设计,共同"孵化"出来的规律。

这里有个日常场景可以帮你理解这件事的分量。想象你在教两个学生做同一份练习,一个学生每次做题都要重新从头写完整的解题过程,另一个学生已经有一份标准答案在手,他只需要在标准答案上做"修正批注"就行。经过大量练习后,第一个学生每次写的解题步骤都天差地别,因为他每次都是从零开始组织;而第二个学生的批注会越来越集中在几个固定的"易错点"上,因为他反复修正的其实是同一份底稿里那几处薄弱环节。如果不让第二个学生有底稿可以批注,只让他和第一个学生一样从零写起,那这种"批注集中在固定位置"的规律性根本不会出现。跳跃连接扮演的正是这份"底稿"的角色,残差模块学的不是"整个映射关系",而是"围绕单位映射的一点点修正",这个修正天然会更集中、更结构化。

论文作者进一步验证了这不是巧合。他们测试了七种不同的权重初始化方式,发现不管用哪种初始化,网络刚初始化的时候这个"配对准确率"都接近随机水平(不超过2.1%),但只要训练收敛了,准确率就能飙升到93%到100%。甚至用了一种理论上号称能让网络在初始化时就达到"完美正交"状态的初始化方法(dynamical isometry),初始时的配对准确率照样是0%,说明这个现象铁板钉钉是训练过程带来的,不是初始化的副作用。

论文还测试了这个现象是否只在人工合成的小型MLP网络里存在,结果发现它广泛存在于六个主流语言模型家族里,包括GPT-2、BERT、LLaMA-2、Mistral、Qwen2.5、DeepSeek-R1。在这些真实的大模型里,通过"匈牙利算法"(一种经典的最优匹配算法)去尝试恢复每个残差模块里两层权重的正确配对关系,在标准的多层感知机路径上,准确率达到了100%,而如果用随机初始化的权重去做同样的匹配,准确率最高只有4%。这个现象甚至跨越到了视觉模型(ViT、ResNet)和语音模型(Whisper),说明这不是语言模型独有的特性,而是残差架构训练过程的一种普遍规律。

光有这个信号还不够:必须剔除"共性"

如果你以为找到了这个"对角线聚集"信号就大功告成,那就把问题想得太简单了。

论文里非常坦诚地指出了一个关键陷阱:这个对角线聚集的结构,是所有经过充分训练的残差网络共有的特征,不管这两个网络之间有没有血缘关系。换句话说,两个完全独立训练、互不相干的模型,只要它们都用了残差结构、都训练得比较充分,它们各自的分支乘积矩阵都会呈现出这种对角线聚集的样子。

这就好比你想通过"这个人会不会用筷子"来判断两个人是不是亲戚。如果两个人都是在同一个文化圈子里长大的,他们大概率都会用筷子,但这完全不能说明他们有血缘关系,因为"会用筷子"是这个文化圈子里所有人的共性,不是某个家族特有的印记。如果直接拿"会不会用筷子"当作亲缘鉴定的依据,你会把一整个文化圈子的陌生人全都误判成亲戚。

论文用严谨的实验证实了这一点:如果只用这个原始的"迹集中度"信号去做血缘验证,得到的AUROC(一种衡量分类效果好坏的指标,1.0代表完美区分,0.5代表和瞎猜没区别)只有0.417,基本等同于随机瞎猜,甚至比瞎猜还差一点。这说明单靠这个信号,不但没法确认血缘,反而会引入误导。

> AUROC(曲线下面积):一种衡量二分类模型区分能力的指标,数值范围从0到1,越接近1说明模型越能把两类样本正确分开,0.5则代表完全没有区分能力。

那怎么办?论文的解法很巧妙:既然对角线聚集的"共性"部分是所有训练好的模型都有的,那就把这部分"减掉",只留下每个模型独有的"个性"部分,再拿这个个性部分去做比较。

具体的数学操作是这样的:任何一个矩阵,都可以拆分成两部分,一部分是"沿着单位矩阵方向"的分量(这就是造成迹集中的那个共性成分),另一部分是"迹为零的剩余部分",这两部分在数学上是正交的,互不干扰。论文把第一部分剔除掉,只保留第二部分,并把它归一化成一个单位向量,称之为"中心化残差签名"。

> 中心化残差签名(centered residual signature):从残差模块的分支乘积矩阵中减去它沿单位矩阵方向的共性分量后,剩下的、经过归一化处理的"个性化"向量,用来捕捉每个模型独有的训练痕迹。

这个操作的效果立竿见影。在GPT-2的基准测试里,论文对比了"不做中心化处理"和"做了中心化处理"两种方案下,两个完全独立训练的模型之间的伪相似度。不做中心化处理时,这个伪相似度是0.027;做了中心化处理之后,直接降到0.0015,足足降低了18倍。这说明中心化操作确实精准地剔除了那部分"人人都有"的共性噪声,让剩下的信号真正变成了每个模型独有的指纹。

这里还有一个特别有意思的算法机制上的选择。因为每个残差模块内部具体是哪两层权重相乘,不同的网络架构可能不一样,单纯的Transformer多层感知机是两层权重相乘,而像ResNet这样的瓶颈结构需要三层权重连乘才对。论文里专门做了个对照实验:如果偷懒只用两层相乘(跳过中间那一层),在ResNet-50上的配对准确率会直接掉到随机水平;而用正确的三层连乘,配对准确率能恢复到91%到100%。这说明这套方法对"分支乘积怎么算"这件事非常敏感,必须严格按照每种架构的真实计算路径去还原,少一步都不行。

拿到每个模块的"个性签名"之后,论文还要解决一个问题:两个模型各自有很多个残差模块,怎么知道哪个模块该跟哪个模块比?论文用了"匈牙利算法",这是运筹学里一个经典的最优指派算法,用来在两组元素之间找到总体相似度最高的一一对应关系。对于血缘关系明确、模块顺序没被打乱的模型,这套算法应该能准确恢复出"第一个模块对第一个模块、第二个模块对第二个模块"这种顺序对应关系,恢复的准确性本身也成为验证这套方法有效性的一个佐证。

最终,把所有匹配好的模块对之间的个性签名相似度取平均,就得到了一个介于负一到正一之间的"血缘分数"。这个分数越接近1,说明两个模型共享的个性化痕迹越多,越可能有血缘关系;越接近0,说明两者的个性化痕迹互不相关,大概率是独立训练出来的。

为了避免研究者随手定一个阈值就说"分数超过0.5就算有血缘",论文设计了一套更严谨的校准流程:拿一批已知和参考模型没有血缘关系的独立模型,计算出它们各自和参考模型的血缘分数,取这批分数里的最大值作为一个"零假设阈值"。只有当待验证模型的分数超过这个阈值,才判定为"有血缘关系"。这种做法借用了统计学里"共形推断"的思路,能给出一个有理论保证的置信水平。

这套方法为什么能扛住"洗白"操作

光在干净的实验条件下表现好还不够。真正的考验在于:如果有人故意想要掩盖模型的血缘关系,这套方法还灵不灵?

论文设计了一整套"模型洗白"(checkpoint laundering)实验来测试这一点。所谓模型洗白,就是对模型做一些不改变它实际功能、但会让权重数值面目全非的操作,试图借此摆脱溯源。

论文测试了两种典型的洗白手法。第一种叫"逐模块神经元重排"(permutation),就是把某个模块内部的神经元顺序打乱,同时调整前后连接的权重,让模型的实际计算结果完全不变,权重数值却大变样。第二种叫"倒数缩放"(reciprocal rescaling),对某一层的权重乘以一个缩放系数,同时对下一层的对应权重除以同一个系数,同样能保证功能不变,数值改头换面。

论文测试了包括朴素权重余弦相似度、对齐后的弗罗贝尼乌斯距离、奇异值距离、以及重新对齐算法(Re-Basin)在内的多种基线方法,在这些洗白操作下的表现。

结果相当有说服力。在多层感知机基准上,朴素的弗罗贝尼乌斯距离方法,在遭遇神经元重排后,AUROC从1.0直接掉到0.50,基本等于失效;遭遇强力的倒数缩放后,直接归零。奇异值距离方法在遭遇任何一种缩放操作后都彻底失效,AUROC变成0。就连表现相对稳健的权重余弦相似度,在"先重排再缩放"的组合攻击下也退化到0.80,而且更关键的是,它的"区分度间隔"(Gap-Z指标,衡量两类分数分布之间的标准化距离,数值超过3说明两类分布几乎没有重叠)从原本的76.3骤降到1.8,意味着虽然名义上还能分辨,但两类分数的分布已经几乎贴在一起,随便再加一点扰动就可能彻底翻车。

而这篇论文提出的中心化残差签名方法呢?在所有这些洗白操作下,AUROC始终保持1.0不变,Gap-Z指标也始终维持在53左右的高位,几乎没有任何衰减。

这背后的原因不难理解。回想一下论文的核心构造:分支乘积矩阵M本身,在神经元重排操作下具有代数不变性,因为重排本质上是给这个矩阵做了一次"排列变换加逆变换",乘积结果原封不动;在倒数缩放操作下同理,缩放系数和它的倒数在矩阵乘法里正好抵消。既然分支乘积矩阵本身对这两种洗白操作天然免疫,那么建立在它基础上的中心化签名自然也免疫,不需要额外做任何对齐搜索或者匹配运算。

这就是为什么这套方法在计算速度上还有巨大优势。前面提到的Re-Basin重新对齐方法虽然也能扛住这些洗白攻击,恢复出AUROC等于1.0,但它的代价是要对模型的每一对残差模块做一次复杂的匹配运算,计算复杂度是模块维度的三次方级别。而这篇论文的方法直接通过矩阵乘法计算分支乘积,不需要任何搜索或对齐步骤,复杂度低得多。实测下来,在GPT-2规模的模型上,这篇论文的方法平均每次比对只需要5.1毫秒,而Re-Basin需要387.9毫秒,速度差了整整76倍。

这个对比可以想象成两种给行李贴身份标签的方式。一种是每次安检都要把行李箱打开,把里面每件衣服都拿出来仔细核对是不是这个人的(对应Re-Basin的暴力搜索式对齐),另一种是行李箱外壳本身就烙印了一个不会因为怎么颠簸、怎么倒腾内部物品都不会消失的编号(对应这篇论文利用矩阵乘积的代数不变性)。前者理论上也能查清楚,但每次都要翻箱倒柜,慢得让人抓狂;后者扫一眼编号就搞定,前提是这个编号必须设计得足够巧妙,不会因为正常的搬运颠簸就跟着变形。如果没有找到这种天然不变的"编号"设计,唯一的办法就只能是每次都翻箱倒柜式地重新核对,这正是Re-Basin不得不付出76倍时间代价的根本原因。

论文还专门在公开发布的真实大模型上验证了这个抗洗白能力。他们拿LLaMA-2、LLaMA-3、Mistral、Qwen2.5这四个7B到8B规模的模型家族,对每个基础模型和它的官方微调衍生版本做神经元重排洗白操作,然后对比洗白前后血缘分数的变化。结果显示,这篇论文的血缘分数变化量小于十的负七次方,基本等同于完全不受影响;而朴素的权重余弦相似度在所有测试案例里都损失了超过93%的原始信号强度。

拿真实的开源大模型练手

方法论说得再好,终归要在真实世界里跑一跑才算数。论文做了一个特别接地气的案例研究:拿LLaMA-2-7B作为参考基准,去验证它和10个公开可下载的模型之间到底有没有血缘关系。

这10个模型里,有3个是有据可查的、确实基于LLaMA-2改造而来的衍生模型:LLaMA-2-7B-Chat(官方对话微调版)、Vicuna-7B(社区基于LLaMA-2微调的知名聊天模型)、CodeLlama-7B(针对代码任务做了大量继续预训练的版本)。

另外7个,是架构参数和LLaMA-2完全一样(都是32层、隐藏维度4096),但从零独立训练出来的"架构克隆"模型,包括OpenLLaMA、OpenLLaMA-v2、Amber、Baichuan-7B、Baichuan2-7B、InternLM-7B、Yi-6B。这些模型模仿了LLaMA-2的网络结构设计,但权重是各自团队从零训练出来的,和LLaMA-2没有任何权重层面的继承关系。

结果非常干净利落。三个真实的衍生模型,血缘分数分别是0.995、0.996、0.336,都远远超过零假设阈值;而那七个独立训练的架构克隆模型,血缘分数全部低于5乘以10的负五次方,几乎为零。

值得多说一句的是CodeLlama那个0.336的分数,虽然明显比另外两个衍生模型低,但依然清晰地超过了独立模型的噪声水平。这背后的原因是CodeLlama经历了大量的继续预训练(在海量代码数据上又训练了很长时间),这种高强度的后续训练会持续"冲刷"掉一部分原始的个性化痕迹,让血缘信号逐渐衰减,但只要没有从头重新初始化,这个信号就不会完全消失。这个现象其实也提示了这套方法的一个边界:血缘分数会随着"训练强度"和"训练量"的增加而单调衰减,但衰减到检测不出来需要相当极端的条件。

和其他基线方法的正面较量

前面提到的这些优势,总要有一个公平的擂台去验证。论文构建了两个受控实验的基准测试:一个是基于合成回归任务的多层感知机基准,一个是基于3千万参数、在TinyStories数据集上训练的迷你GPT-2基准。

> TinyStories:一个专门为训练小型语言模型设计的合成数据集,由简单的英文小故事组成,常用于快速验证语言模型架构和训练方法。

在多层感知机基准上,研究者训练了2个"根模型",然后从每个根模型衍生出15个不同类型的后代:包括同任务微调、异任务微调、权重扰动、剪枝、量化,每种衍生方式还有3个变体。同时训练了8个独立初始化的对照模型和3个蒸馏学生模型作为负样本。总共构成52对样本用于测试。

在GPT-2基准上,训练了8个根模型,衍生出继续预训练、LoRA合并微调、多种程度的剪枝、多种精度的量化等后代模型,再加上蒸馏学生和跨根独立模型作为负样本,构成45对测试样本。

论文横向对比了七种方法:这篇论文提出的中心化残差签名、朴素权重余弦相似度、对齐后的弗罗贝尼乌斯距离、奇异值分解距离、SVCCA、CKA、以及IPGuard。

下面这张表格是核心结果,数值越接近1.0代表区分能力越强:

| 方法 | 是否需要数据 | MLP基准 AUROC | GPT-2基准 AUROC |

| **中心化残差签名(本文)** | 不需要 | **1.00** | **1.00** |

| 权重余弦相似度 | 不需要 | **1.00** | **1.00** |

| 对齐弗罗贝尼乌斯距离 | 不需要 | **1.00** | **1.00** |

| 奇异值分解距离 | 不需要 | **1.00** | 0.73 |

| SVCCA | 需要 | **1.00** | 0.99 |

| CKA | 需要 | 0.83 | 0.86 |

| IPGuard | 需要 | 0.70 | 0.91 |

在干净、没有被刻意洗白的情况下,前四种权重空间方法几乎打成平手,都能达到完美区分。但差距在洗白攻击下才真正拉开,前面已经详细讲过了这部分对比结果。

值得一提的是,IPGuard这个基于决策边界的方法在多层感知机基准上的Gap-Z是负数(负3.5),这意味着它有时候会把真正的独立模型判断得比真实的后代模型还"像血缘关系",这是一种方向性的错误,比单纯"分不清"更糟糕。

论文还专门在GPT-2基准上按照不同的后处理操作类型,把血缘分数拆开来看,结果列在下表:

| 操作类型 | 平均血缘分数 | 最低血缘分数 |

| 量化(INT8/INT6) | 0.999 | **0.999** |

| LoRA低秩合并 | 0.998 | 0.996 |

| 微调(1个epoch) | 0.980 | 0.980 |

| 剪枝(30%到70%稀疏度) | 0.937 | 0.855 |

| 蒸馏学生(负样本) | 0.002 | 0.001 |

| 独立训练模型(负样本) | 0.003 | 0.000 |

可以看到,即便是剪枝掉70%参数这种相当激进的操作,血缘分数最低也还有0.855,而所有负样本的分数都紧贴着零。这中间200倍左右的分数差距,构成了非常宽裕的判断安全边际。

这套方法目前还做不到什么

任何方法都有边界,这篇论文在这方面写得相当坦诚,值得专门讲一讲。

首先,这套方法要求"白盒访问",也就是必须能拿到两个模型完整的权重文件。如果对方只提供一个API接口,你只能发请求拿回答,拿不到权重本身,这套方法就完全用不上。

其次,这套方法只对"残差架构"有效。如果是普通的前馈网络、循环神经网络(RNN)、或者近几年新兴的状态空间模型(比如Mamba这类架构),因为它们不存在跳跃连接这个结构基础,整套方法的理论根基就不成立了。

> 状态空间模型(State Space Model):一类近年来兴起的、试图替代Transformer注意力机制的序列建模架构,通过状态空间方程来处理序列信息,代表工作包括Mamba。

再者,这套方法要求两个待比较的模型必须有完全相同的层数和隐藏维度。如果拿LLaMA系列去和GPT-2系列做跨架构比较,这套方法直接宣告"不兼容",给不出任何有效判断。

还有一点很关键:这套方法给出的血缘分数是对称的,也就是说它只能告诉你"A和B有血缘关系",但没法告诉你到底是A衍生自B,还是B衍生自A,谁是"祖先"谁是"后代"需要额外的文档信息才能确定。

另外,论文也诚实地指出了这套方法在应对"专门针对它设计的对抗攻击"时的脆弱程度。他们做了一个梯度优化攻击实验:让攻击者用梯度下降的方式,专门去优化一个扰动,目的是在尽量不破坏模型实际性能的前提下,把血缘分数压低到检测阈值以下。实验发现,把血缘分数压到刚好等于零假设阈值的水平,只需要牺牲1.5%的模型性能;但如果想把分数可靠地压到阈值以下留有安全边际,则需要牺牲12%的性能。这说明这套指纹机制并非坚不可摧,面对"有备而来、专门针对这套算法设计对抗样本"的攻击者,它有被绕过的可能,只是需要付出实实在在的性能代价作为交换。

最后一个值得留意的边界是关于神经网络里另一种对称性,叫"正交旋转"。理论上,如果把残差流(网络内部信息传递的主干道)整体做一次正交旋转变换,分支乘积矩阵的迹是保持不变的,但这套方法赖以生存的"中心化剩余部分"却会被这次旋转彻底打乱,导致跨模型的相似度检测失效。好在论文分析指出,对于目前主流的、使用了LayerNorm或者RMSNorm这类带有可学习缩放参数的归一化模块的模型架构(几乎涵盖了GPT-2、BERT、LLaMA、Mistral等所有主流大模型),这种正交旋转操作本身就不是"功能保持"的,也就是说旋转之后模型的实际输出会发生变化,等于旋转操作本身要付出破坏模型功能的代价,这在实际的洗白场景里没有太大的可操作性。只有那种使用完全没有可学习缩放参数的、纯粹的RMS归一化的模型才会真正暴露在这种攻击之下,但论文作者表示,他们目前没有发现有任何广泛部署的主流模型属于这一类。

写在后面

读完这篇论文,最让我意外的一点其实是那个梯度耦合的解释机制。研究者提出了一个假说:残差模块里两层权重之所以会形成对角线聚集,是因为跳跃连接改变了梯度反向传播的路径,让这两层权重的更新方向天然地被绑在了一起,而不是各自独立乱走。他们专门做了一个"打乱梯度"的消融实验来验证这个假说:如果人为把输出层的梯度更新在不同模块之间打乱重排,最终形成的指纹强度会衰减68%。这个实验设计本身很聪明,它没有停留在"观察到现象"的层面,而是真的动手去拆解现象背后的因果链条。

论文里还有一个细节让我印象很深:训练好的Transformer模型,雅可比矩阵的正交程度居然比随机初始化时还要低5到12倍。这和一种叫"动态等距"的理论直觉是矛盾的,那套理论本以为训练会让网络趋向于更接近正交变换。这说明"对角线聚集"这个现象背后的机制,和大家过去以为的某些神经网络训练理论直觉是不一致的,这本身就是个值得深挖的反常现象。

这篇论文让我联想到的一件事是,很多看似"生成式模型的产物"(权重矩阵)其实携带着大量"过程性的痕迹",这些痕迹并不是模型设计者刻意植入的,而是训练动力学本身自然沉淀下来的副产品,就像树的年轮记录着它经历过的每一个季节。这提出了一个很值得继续追问的问题:除了残差连接之外,现代深度学习里还有哪些看似只是"工程技巧"的设计,其实也在悄悄留下类似的、可以被反向挖掘出来的训练痕迹?

Q&A

Q1:中心化残差签名是用来做什么的?

A:它是一种从模型权重本身判断两个大模型是否有共同祖先的方法,不需要训练数据也不需要跑推理,只看权重结构里残留的训练痕迹就能判断血缘关系。

Q2:这套方法能不能防住把模型"洗白"重新发布的行为?

A:能。哪怕有人把模型内部神经元顺序打乱或者做数值缩放来掩盖来源,这套方法的分数依然保持不变,而大多数传统的权重比较方法在这种情况下会失效或者大幅掉分。

Q3:这套方法对所有模型都适用吗?

A:不是。它只对带跳跃连接的残差网络架构有效,而且要求两个模型层数和隐藏维度完全一致,另外它只能判断"是否相关",判断不出谁是祖先谁是后代。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
势赵云登场,赵云模拟器上线,三国杀联动河北文旅开启新版本

势赵云登场,赵云模拟器上线,三国杀联动河北文旅开启新版本

娱游笑点
2026-10-01 15:58:09
中国德比!郑钦文2-1首盘抢七力克施晗 连续3年晋级中网次轮

中国德比!郑钦文2-1首盘抢七力克施晗 连续3年晋级中网次轮

醉卧浮生
2026-10-01 13:55:54
迪拜航空客机上唯一医护乘客披露救治细节:印度籍机长“手部几乎被切断”

迪拜航空客机上唯一医护乘客披露救治细节:印度籍机长“手部几乎被切断”

澎湃新闻
2026-10-01 16:30:27
尿酸危机,席卷中国

尿酸危机,席卷中国

快刀财经
2026-10-01 00:51:49
以媒:阿曼籍飞行员同事称其为极端分子、拒与女性握手

以媒:阿曼籍飞行员同事称其为极端分子、拒与女性握手

观察者网
2026-10-01 14:20:02
生娃不用自己掏钱了,会有更多人敢生吗?

生娃不用自己掏钱了,会有更多人敢生吗?

育娲人口智库
2026-09-30 17:23:01
政府、国家、祖国三者不可混淆

政府、国家、祖国三者不可混淆

觉民行道
2026-10-01 11:31:29
孙俪邓超现身妈妈生宴,孙母脸很肿打扮时髦,美甲鲜红戴大金镯子

孙俪邓超现身妈妈生宴,孙母脸很肿打扮时髦,美甲鲜红戴大金镯子

嫹笔牂牂
2026-10-01 07:08:38
华人岳父母枪杀变性女婿案后续!死者父母远在台湾,亲人表示离婚争子或成导火线

华人岳父母枪杀变性女婿案后续!死者父母远在台湾,亲人表示离婚争子或成导火线

华人生活网
2026-10-01 02:15:51
加息大消息,突然来袭!三大利好共振,亚太市场狂飙!

加息大消息,突然来袭!三大利好共振,亚太市场狂飙!

证券时报
2026-10-01 16:30:09
领先日本100金!亚运会最新奖牌榜更新,中国队金牌数太夸张

领先日本100金!亚运会最新奖牌榜更新,中国队金牌数太夸张

宗介说体育
2026-09-30 15:10:15
广东43岁男子用土豆当主食,1个月花300元,半年瘦了25斤!脂肪肝好转,血压、血糖稳了;网友:这应该是最便宜的减肥法了

广东43岁男子用土豆当主食,1个月花300元,半年瘦了25斤!脂肪肝好转,血压、血糖稳了;网友:这应该是最便宜的减肥法了

蓬勃新闻
2026-10-01 17:42:38
刘欢为啥爱办家宴?高晓松爆料:北京三里屯的一件事,让他没办法

刘欢为啥爱办家宴?高晓松爆料:北京三里屯的一件事,让他没办法

寒士之言本尊
2026-10-01 15:07:02
突发:新西兰受训机长,万米高空被副驾刺伤!浑身是血仍打开舱门,救下174人

突发:新西兰受训机长,万米高空被副驾刺伤!浑身是血仍打开舱门,救下174人

发现新西兰
2026-10-01 08:03:31
亚运会争议判罚!中国柔道运动员误咬伤日本选手,被裁判直接判负

亚运会争议判罚!中国柔道运动员误咬伤日本选手,被裁判直接判负

全景体育V
2026-10-01 18:42:29
中国驻美大使谢锋:年底前,中美两国元首还有望在深圳、迈阿密两度聚首,为中美关系注入强劲动力

中国驻美大使谢锋:年底前,中美两国元首还有望在深圳、迈阿密两度聚首,为中美关系注入强劲动力

政知新媒体
2026-10-01 16:47:36
中国男排3比0战胜泰国晋级四强,半决赛前景并不乐观

中国男排3比0战胜泰国晋级四强,半决赛前景并不乐观

李广专业体育评论
2026-10-01 16:36:34
猪猪侠勇闯《三国杀一将成名》!联动PVE开启,多位武将限时变身

猪猪侠勇闯《三国杀一将成名》!联动PVE开启,多位武将限时变身

游人馆
2026-10-01 11:42:03
喋血航班、真人真事:一个普通人可以勇敢冷静到何种程度?

喋血航班、真人真事:一个普通人可以勇敢冷静到何种程度?

呦呦鹿鸣
2026-10-01 15:15:53
势·赵云领衔,马云騄重制归来,《三国杀》国庆开启锦囊妙会

势·赵云领衔,马云騄重制归来,《三国杀》国庆开启锦囊妙会

游戏好看点
2026-10-01 12:01:05
2026-10-01 20:28:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
10022文章数 569关注度
往期回顾 全部

科技要闻

5999元起!华为Mate 90系列发布

头条要闻

C罗离开后葡萄牙队7号球衣疑光速易主 莱奥将披7号球衣

头条要闻

C罗离开后葡萄牙队7号球衣疑光速易主 莱奥将披7号球衣

体育要闻

“今天的表现,我们可以昂首离开球场”

娱乐要闻

宋佳二封金鹰视后 内娱奖项史即将改写

财经要闻

智谱发上亿Token 能挽回开发者信任吗?

汽车要闻

2027款极氪001将于明年一季度上市 现款猎装同步推新配色

态度原创

房产
时尚
亲子
游戏
家居

房产要闻

4000+/平!华侨城,直接把海口楼市的地板给掀了!

在米兰,用时装唤醒内心的自我

亲子要闻

开学一个月“学习困难门诊”迎就诊高峰,医生:就诊诉求几乎只有“提分”

《蕾卡的移动工坊》免费上线Steam 支持简体中文

家居要闻

2026建博会(广州) 公装联探展交流活动

无障碍浏览 进入关怀版