网易首页 > 网易号 > 正文 申请入驻

当模型读出一个词的时候,它到底"看见"了什么

0
分享至


你有没有想过一个很奇怪的问题:当一个语言模型在生成文本的过程中,某一层的隐藏状态被翻译成"bug"这个词的时候,它究竟是在说一只虫子,还是在说代码里的漏洞?

这听起来像是个无关紧要的语言学问题,但对研究人员来说,这个问题背后藏着一整套解读AI大脑的方法论是否可靠。剑桥大学的一组研究者发现,答案可能比大家想象的要棘手得多。

**这篇论文要讲的核心事实是:同一个词,在模型内部可能对应着完全不同的"理由",而我们过去一直用来解读模型思维过程的工具,其实分不清这些理由。**

先说说这件事有多反直觉。过去几年,"logit lens"(逻辑透镜)这类方法在可解释性研究里几乎成了标配工具,研究者用它窥探Transformer模型内部某一层在"想"什么。方法很简单:把模型某一中间层的隐藏状态,直接扔进最后那层负责把向量转成词汇的矩阵(也就是所谓的"读出层"或"LM head"),看看它最偏向哪个词。如果一个用中文提问的多语言模型,中间层被解码出来全是英文词,那许多论文就会直接下结论:这个模型的"内部工作语言"是英文。

问题是,这套推理链条里藏着一个从未被认真检验过的假设:词语本身能准确代表模型内部的计算结构。这篇论文用一个非常朴素的例子戳破了这个假设。

一个词的两幅面孔

论文开篇给出了一个example:Qwen3.5-2B模型面对提示"程序员复现了这次崩溃,并提交了一个",logit lens给出的最高分词是"bug",比第二名"insect"(昆虫)高出整整20多个logit单位。

如果你只看这个排名,你可能会觉得,好,这说明模型此刻明确知道自己在说"软件缺陷"。但真相没那么简单:模型词表里,"bug"这个词只有一行向量,不管它代表昆虫还是代码缺陷,用的都是同一行数字。

*读出层*:也叫解嵌入矩阵(unembedding matrix),是Transformer模型最后一步把隐藏状态转换成词汇预测分数的那个巨大矩阵,每一行对应词表里的一个词。

*logit*:模型对每个候选词打出的原始分数,分数越高代表模型认为这个词越可能是答案,还没经过softmax转成概率。

也就是说,"bug"这一行向量本身是一个混合体,昆虫的信息和软件缺陷的信息挤在同一组数字里。仅凭这一行给出的分数,你根本无法判断模型此刻调用的是哪种含义。反过来,另一个麻烦也存在:两个意思相近的词,比如"bug"和它的近义词,在词表里对应着不同的行,但这些行可能在某些方向上高度重合,本质上指向同一种底层结构。

这就是论文提出的核心矛盾:**词语这个单位,对于分辨同一个词的不同含义来说太粗糙,而对于识别跨词共享的结构来说又太精细。**

打个比方,这就像你去查一本词典,发现"bank"这个词条下面同时塞着"银行"和"河岸"两个释义,可词典只给了一个笼统的褒贬分数,不分场合。你拿着这个分数,永远猜不出说话人此刻到底在讲存钱还是在讲河流。如果不把这个词条拆开看,你所有基于这个分数做出的推断,从一开始就是在赌概率,而不是在读懂语义。

拆开读出层:把词语换成"特征"

那怎么办?研究者的思路是:既然问题出在"用词语作为分析单位",那就换一个更细的单位。

他们提出的方法叫Sparse Readout Prism,简称SRP。

*Sparse Readout Prism(稀疏读出棱镜,简称SRP)*:一种直接对读出层(LM head)的权重矩阵做稀疏分解的方法,把每个词对应的向量表示成若干个"稀疏特征"的加权组合,从而把模型对某个词或某个对比打出的分数拆解成一系列可以逐项解读的贡献项。

这个名字里的"棱镜"很形象:一束白光穿过棱镜,会被分解成红橙黄绿青蓝紫这些可辨识的颜色成分。SRP做的事情类似,它把读出层里每一行向量(对应一个词)拆解成若干个更细粒度的"读出特征"的组合,外加一个残差项来兜底那些解释不了的部分。

具体来说,SRP用的是一种叫TopK稀疏自编码器的技术,直接对读出矩阵的行向量做训练。

*TopK稀疏自编码器(SAE)*:一种只保留每行数据里最强的k个激活信号、其余全部清零的神经网络结构,通过这种"稀疏"约束,逼迫模型学出一组更容易被人类理解的基础方向(也就是"特征")。

这里有个关键的设计选择:SRP只用模型的权重来训练,完全不需要任何语料库或者提示词。这一点看似技术细节,其实是整篇论文最重要的设计初衷。

为什么这么设计?

因为很多用来"翻译"模型隐藏状态的工具,比如tuned lens(调谐透镜)和Jacobian lens(雅可比透镜),都需要先用一批语料去拟合一个转换矩阵,把中间层的向量"运输"到读出层能理解的空间里。这意味着这些工具的输出,天然混杂了两种信息来源:一是模型的隐藏状态本身,二是拟合这个转换矩阵时用的语料库。

如果你想验证一个模型内部到底在想什么,却用了一个自己"沾染"了训练语料偏好的工具去验证,那你测出来的结果,究竟是模型的真实状态,还是工具本身的口味,根本说不清楚。

这就好比你想知道某人对一道菜的真实口味偏好,却找了一个刚在法国餐厅打过工的翻译来帮你转述对方的评价。这个翻译可能会不自觉地把"还行"翻译成"有点淡",因为他见过更浓郁的调味标准。如果你不知道翻译本身带着口味偏见,你会误以为这就是说话人的真实想法。SRP的价值就在于,它是一个完全不经过"翻译培训"的记录员,只依据词典本身(模型权重)做记录,不受任何具体谈话场景(语料库)的影响。

一个分数,拆成一串信号灯

有了这套分解工具,回到最初那个"bug"的例子会发生什么?

论文用同一个模型、同一个隐藏状态,把"bug减去insect"这个分数差异拆开,得到的结果非常直观:排在前面的贡献项,全都指向软件缺陷相关的方向,比如"defect/缺陷"、"crash/崩溃"、"debug/调试",甚至还混杂着中文、俄语、韩语里表达"缺陷""漏洞"含义的词。而"昆虫"相关的特征,压根没有出现在贡献榜前列。

这个结果本身很直观,但更有意思的是论文接下来做的对照实验。同样是"bug"这个token,如果把它放进一个昆虫语境(比如"程序员在花园里发现了一只"),再对比另一个锚点词,拆解出来的贡献项立刻切换成了"mosquito/蚊子"、"bee/蜜蜂"、"beetle/甲虫"这些昆虫特征。

**同一个词,在不同语境里,被完全不同的一组特征在背后支撑着,尽管它在读出层里始终是同一行数字。**

这说明了什么?说明语境的作用,不是改变了词表里那一行向量本身(那行数字是固定的),而是改变了当前隐藏状态在这些"特征方向"上的投影强度。用棱镜的比喻来说,白光本身没变,但穿过棱镜时的角度变了,所以分解出来的颜色配比也就完全不同了。

为了验证这不是巧合,研究者又在一个专门收集歧义词的公开数据集CoarseWSD-20上做了更系统的测试。

*CoarseWSD-20*:一个包含20个具有明显歧义的英语单词及其粗粒度词义标注的公开数据集,比如某个词在不同上下文里到底该理解成哪个意思,数据集里都有明确的人工标签。

结果是,仅用8个特征去区分一个词的不同词义,在三个不同模型上都能达到80%到92%的平衡准确率,而随机打乱标签的对照组只有41%左右。这说明特征拆解确实抓住了真实存在的语义区分信号,而不是研究者在过度解读噪音。

这套分解靠不靠谱?

一个好的分解方法,光是"看起来合理"是不够的,还得经得起量化检验。论文在这方面做了相当扎实的工作。

第一个检验是"替换测试":如果用SRP重构出来的读出矩阵去替代原始的读出矩阵,模型的预测结果会不会大变样?在Qwen3.5和Ministral这些模型上,替换后模型在验证集上给出的最高分词,有89%到90%和原始模型保持一致;在经过推理蒸馏的模型上(比如R1-Distill系列),这个数字略低,大约75%到76%。

第二个检验是和其他"竞争对手"方法的对比。研究者拿SRP去跟六种基于读出矩阵几何结构构建的基线方法比赛,包括最近邻行岭回归、加权K近邻、K均值聚类字典、主成分分析(PCA)等等。结果是,SRP在所有测试的六个"无软上限"模型上,都比表现最好的对手高出8.9到17.3个百分点的覆盖率(也就是能正确重构、且误差在可接受范围内的分数比例)。

*softcap(软上限)*:某些模型(比如Gemma系列)在计算最终logit之前会加一个非线性的压缩变换,防止分数无限增长,这会给分析工作带来额外的复杂度,所以本文把用了softcap的模型单独处理。

这个覆盖率的差距意味着什么?意味着在大约850组词语对比中,SRP能正确解释的比例,比最强的竞争对手多出接近六分之一。换句话说,如果你随便挑六个案例来看,SRP能多解释出至少一个案例中隐藏的真实结构,而这六个基线方法即便调到最优也做不到。

第三个检验更有说服力,叫"消融实验":既然SRP说某个特征对某个分数差贡献了多少,那如果直接把这个特征方向从模型的隐藏状态里"抹掉",实际测出来的分数变化,应不应该跟预测值对上号?论文测出的相关系数(r?)在六个模型上都达到0.83到0.93,而如果换成随机方向去做同样的消融,相关系数最高只有0.06。

这说明SRP给出的贡献分值,不是纸面上的数字游戏,它真实预测了"抹掉这个特征会发生什么"这件事。这就好比一个天气预报,不光要说"明天可能下雨",还得在真的下雨之后,回头验证降雨量和预报数字对不对得上。SRP做到了这一点,而且做得相当准。

语言之谜:模型的"内心独白"到底说的哪国话?

讲到这里,论文进入了整篇文章里最有戏剧性的部分:用SRP这个"独立于语料库"的工具,去检验那些"依赖语料库"的透镜工具是不是靠谱。

背景是这样的:像Jacobian lens这样的拟合式透镜,需要用一批语料去训练一个转换矩阵,把中间层状态映射到读出层能理解的空间。之前有研究者用这类工具观察一个用中文提问的多语言模型,发现中间层解码出来的词大多是英文,于是得出结论:这个模型的内部工作语言是英文。

论文的研究者做了一个近乎"抓现行"式的实验:他们用Qwen3.5-9B模型,分别用100个英文语料和100个中文语料去训练两个结构完全相同的Jacobian lens,唯一的差别就是训练语料的语言。然后拿这两个透镜去解码同一批冻结的隐藏状态。

结果非常戏剧性。在80个测试提示词里,两个透镜在21、24、26、29这四层给出了不同脚本(拉丁字母vs中日韩字符)的读数,比例高达39/80。在事实性问答类提示词上,这个比例更夸张:10个案例里有9个,两个透镜给出的读数完全不是同一种语言。

论文举的一个具体例子非常生动:提示词是"中国的首都是北京,英国的首都是……",同一个隐藏状态,用英文语料训练的透镜读出"London",用中文语料训练的透镜读出"伦敦"。这不是巧合,这是系统性的偏差。

*Jacobian lens(雅可比透镜)*:一种拟合式的模型内部状态解读工具,通过在一批语料上计算并平均雅可比矩阵,把中间层的隐藏状态"运输"到读出层可以理解的空间,再用读出层解码出对应的词。

如果只看到这里,你可能会觉得:好嘛,那些声称"模型内部用英语思考"的论文,是不是全都得打上问号了?先别急着下结论,论文接下来给出了整篇文章里最关键的反转。

研究者用SRP把两个透镜在同一个隐藏状态上打出的分数,都拆解成特征贡献。结果发现:在77个测试案例里(占比96%),尽管两个透镜给出的表面词语完全不同(一个是"London",一个是"伦敦"),但支撑这两个分数的最大贡献特征,居然是同一个。

**表面上看,两个透镜像是在争论模型到底用哪种语言思考,但拆开看,它们其实一直在谈论同一件事,只是用了两种不同的"说法"。**

这个发现的分量非常重。它意味着:那些基于拟合式透镜读出的"表面语言",很大程度上反映的是训练语料的偏好,而不是模型内部真正激活的语义结构。用中文语料训练出来的透镜,天然更容易把结果"翻译"成中文词,用英文语料训练的透镜天然更容易翻译成英文词,但两者背后指向的,其实是同一个读出特征。

这就好比你请了两位翻译,一位精通法语,一位精通日语,让他们分别转述同一个人的心理活动。法语翻译给你的稿子里全是法语词汇,日语翻译给你的稿子里全是日语词汇,但如果你能看懂两份稿子背后共同指向的那份原始笔记,你会发现两人其实转述的是完全一致的内容。表面语言的差异,只是翻译习惯造成的,不代表原文本身换了语言。如果不做这层拆解,你很容易被两位翻译各自的语言习惯误导,以为原始想法真的在两种语言之间切换。

为了确认这不是偶然,研究者又做了三组扩展实验。第一组换了一种拟合工具,用类似tuned lens风格的岭回归翻译器重新训练,结果模式一致:67/80的案例里,共享的特征依然占主导。第二组换了语言对,把中文换成同样使用拉丁字母的德语,排除"因为字母系统不同才导致表面差异"的可能性,结果依然是84/90案例共享主导特征。第三组把训练语料从100条扩到300条,测试这个现象是不是训练数据不足造成的估计误差,结果是:表面语言的分歧比例确实随语料增加发生了变化(英中对比从39/80降到33/80,英德对比反而从73/90升到76/90),但共享主导特征的比例几乎纹丝不动。

这个"文风不动"的稳定性,恰恰说明了SRP揭示的这个共享特征,抓住的是某种更本质、不随训练语料波动的东西。

稳不稳?换个种子训练还一样吗?

任何依赖神经网络训练的方法,都会面对一个绕不开的质疑:换一个随机种子重新训练一遍,结果还一样吗?

论文对此做了专门的稳定性测试,用Qwen3.5-2B,在两种宽度设置下各训练三个独立的字典(只改随机种子,其他配置全部相同)。结果显示,单个特征方向本身在不同种子间几乎不重合(余弦相似度中位数只有0.33左右),这符合此前文献里对TopK字典训练不稳定性的记录。

但如果看的不是单个方向,而是"这个方向对应的词语组合",情况就完全不同了:同一个对比对象,在不同种子训练出的字典里,对应的词语组合的重叠度(用Jaccard相似度衡量)达到0.21到0.24,而随机挑选两个无关对比的重叠度只有0.014到0.018左右,差了十几倍。

也就是说,特征编号会变,但特征捕捉到的语义结构基本稳定。论文用一个很贴切的说法总结这个现象:**特征索引像门牌号会重新编排,但门牌号背后住的"住户"基本没变。**

意外之处:这套分解还能干预模型行为

除了拿来做分析,SRP的分解结果还能直接用来做"手术"式的干预。论文设计了一个约束性的编辑实验,专门挑选与粗俗语言相关的读出特征,看看编辑这些特征方向能否压制模型对这类词的偏好。

有意思的是,这个编辑用五个"发现词"选出的特征方向,居然能推广到十个完全没被用来选择特征的"留出词"上。在Qwen3.5-2B上,这种基于特征方向的编辑,达到了和"作弊式"的oracle方法(直接知道全部测试词表、精确惩罚这些词)几乎完全一致的效果,留出词的翻转率都是0.359。而作为对照的"只惩罚已知发现词"的方法,对留出词的效果是零,因为它压根没接触过那些词的ID。

这说明SRP找到的方向,确实抓住了这类词汇背后共享的某种语义结构,而不仅仅是记住了几个具体的token。不过论文也很诚实地报告了一个局限:这种编辑带来的"副作用"(衡量指标是对无关文本的KL散度扰动)在不同模型上表现不一,在展示模型Qwen3.5-2B上SRP确实比简单的均值方向、主成分方向要更省成本,但在另外两个模型(0.8B和9B)上,SRP反而输给了最朴素的"均值行方向"基线。

论文对此的态度也很坦诚:这个优势是模型特定的,不是普遍成立的结论,只在展示模型上,基于字典的方向编辑,能以更低的代价压制目标词汇。

从这篇论文走出去的路

这篇论文发表之后,其思路直接指向了几个明显的后续方向。论文自己在讨论部分就提到,未来的工作可以把这套"棱镜"式的分解思路,扩展到同时对隐藏状态和读出层两侧做联合分解,让每一项贡献都能同时记录"激活侧的哪个特征"和"读出侧的哪个特征"发生了对齐,而不只是单侧分析。

另一个更贴近实际应用的方向,是把SRP用于安全审计。论文设想,可以针对拒答、信源核实等具体场景定义分数对比,跟踪这些分数背后的特征贡献在不同语言、对抗性提示、模型checkpoint之间是否反复出现,把那些反复出现的特征当作后续因果验证的候选对象。这个思路和论文本身在语言对比实验里用到的方法,是同一套逻辑的延伸。

从更宏观的角度看,这篇论文提出的读出特征,某种意义上补齐了可解释性研究里长期偏科的一块拼图。过去几年,稀疏自编码器技术几乎全部用来分解模型的激活值(也就是隐藏状态本身),比如Anthropic那几篇著名的"走向单义性"系列论文。而模型的输出端,也就是读出矩阵本身的结构,却一直没有被同样系统地拆解过。这篇论文相当于把"棱镜"这套工具,第一次系统性地对准了模型的另一侧。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
郭斌发文阴阳王励勤,说乒协没打招呼就动了他那块地盘。 不是因为他说自己亏本经营替国乒兜底。

郭斌发文阴阳王励勤,说乒协没打招呼就动了他那块地盘。 不是因为他说自己亏本经营替国乒兜底。

乒乓网国球汇
2026-06-23 02:31:09
医生提醒:老年人4件事上太勤快,并不是好事,可能会招来疾病

医生提醒:老年人4件事上太勤快,并不是好事,可能会招来疾病

袁医生课堂
2026-09-20 08:07:09
他是北京市委原书记,培养了两位正国级领导,离休后定下3条规矩

他是北京市委原书记,培养了两位正国级领导,离休后定下3条规矩

燕小姐说历史
2024-12-08 09:19:59
身体有这6种表现,说明你可太健康了!占1条都值得恭喜!

身体有这6种表现,说明你可太健康了!占1条都值得恭喜!

医学原创故事会
2026-10-04 22:58:10
18.8万彩礼+10万酒席钱,男方起诉欲要回全部,还质疑女儿非他亲生,女方称“他隐瞒了父亲瘫痪”,法院判了,双方都不服……

18.8万彩礼+10万酒席钱,男方起诉欲要回全部,还质疑女儿非他亲生,女方称“他隐瞒了父亲瘫痪”,法院判了,双方都不服……

都市快报橙柿互动
2026-10-04 12:44:57
越来越多人得胰腺癌,医生揭露凶手,竟是冰箱久放的3种食物

越来越多人得胰腺癌,医生揭露凶手,竟是冰箱久放的3种食物

健康科普365
2026-10-03 22:25:05
拒不认罪!杨兰兰车祸案开庭本人未到场,六项指控全部否认,身受重伤受害者静待百万澳元赔偿

拒不认罪!杨兰兰车祸案开庭本人未到场,六项指控全部否认,身受重伤受害者静待百万澳元赔偿

秋风妃
2026-10-04 21:51:44
1992年,叶利钦将苏联压箱底军工家底打包卖给中国没人料到,这次合作竟让中国军工少走20年弯路!

1992年,叶利钦将苏联压箱底军工家底打包卖给中国没人料到,这次合作竟让中国军工少走20年弯路!

磊子讲史
2026-08-14 16:30:21
《大河报》报道劫机为以色列自导自演,是因为不专业吗?

《大河报》报道劫机为以色列自导自演,是因为不专业吗?

黔有虎
2026-10-03 18:12:13
故事:川藏线上的大货车,入夜后就成了魔窟,专门挑搭车女孩下手

故事:川藏线上的大货车,入夜后就成了魔窟,专门挑搭车女孩下手

白云故事
2025-05-03 19:50:10
总理介入:C罗闹剧在葡萄牙造成前所未有影响

总理介入:C罗闹剧在葡萄牙造成前所未有影响

本泽体育
2026-10-03 20:56:32
研究发现:山楂可以溶解一半多的血栓?是真的吗?主要看这些细节

研究发现:山楂可以溶解一半多的血栓?是真的吗?主要看这些细节

芹姐说生活
2026-10-03 22:27:57
何捷携张馨予为战友送新婚祝福,相比妻子老得明显,但气场仍很强

何捷携张馨予为战友送新婚祝福,相比妻子老得明显,但气场仍很强

柒佰娱
2026-10-04 17:47:13
王心凌的健身照绝了!这个状态,谁敢想她都44岁了?

王心凌的健身照绝了!这个状态,谁敢想她都44岁了?

小方说跑步
2026-10-03 19:20:06
公安不能插手的五件事,你报警了也没用,该找谁?

公安不能插手的五件事,你报警了也没用,该找谁?

警说
2026-10-05 04:26:45
毛伟杰不能冲击李昊了!足协杯必须复出,刘洋难保国足主力左后卫

毛伟杰不能冲击李昊了!足协杯必须复出,刘洋难保国足主力左后卫

刀锋体育
2026-10-04 17:18:00
16岁孙心然中网连赢两场,为何没按常规交职业赛学费?

16岁孙心然中网连赢两场,为何没按常规交职业赛学费?

安逸安逸
2026-10-05 04:17:11
发现奇怪现象:越是儿女没本事的家庭,父母晚年生活却越热闹

发现奇怪现象:越是儿女没本事的家庭,父母晚年生活却越热闹

枫红染山径
2026-10-04 09:58:36
3种让你拉屎的菜,堪称“肠道清洁工”,秋天隔三差五吃,通顺了

3种让你拉屎的菜,堪称“肠道清洁工”,秋天隔三差五吃,通顺了

阿天爱旅行
2026-10-04 19:08:14
普京没想到,连老天都在帮他,乌克兰爆发内乱,俄不再给中亚面子

普京没想到,连老天都在帮他,乌克兰爆发内乱,俄不再给中亚面子

老范谈史
2026-09-05 10:33:55
2026-10-05 05:04:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
10040文章数 570关注度
往期回顾 全部

科技要闻

苹果确认:iPhone 18 Pro Max有问题

头条要闻

30多岁中国夫妇在澳洲遇惨烈车祸丧生 肇事司机仅17岁

头条要闻

30多岁中国夫妇在澳洲遇惨烈车祸丧生 肇事司机仅17岁

体育要闻

32胜0负!德约2-1逆转头号种子兹维列夫 第7次晋级中网四强

娱乐要闻

高晓松悄悄复出:官媒没给他留体面

财经要闻

OpenAI前安全部门员工:公司文化已崩坏

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

教育
数码
时尚
家居
手机

教育要闻

家长注意:节假日期间,南京多所学校体育场对外开放!

数码要闻

联想推出Lenovo Watch Fit 3智能手表,199元

谭卓&胡一天,邀你一起“网”下面基

家居要闻

2026建博会(广州) 公装联探展交流活动

手机要闻

iPhone18 Pro:首销破百万,国产旗舰首销总和不到人一半!

无障碍浏览 进入关怀版