网易首页 > 网易号 > 正文 申请入驻

AI知道你懂多少,但要过多久才会真的“用上”这个判断?

0
分享至

你有没有遇到过这种同事:他明明知道你是新人,但直到项目做到一半才开始放慢语速、少用术语跟你解释。前半程他脑子里其实早就贴好了"这人是菜鸟"的标签,可这个判断迟迟没有体现在他说话的方式上。

这篇论文研究的就是AI身上一模一样的现象。只不过这次的"同事"是语言模型,它在跟你聊天的过程中,会不断判断你到底是什么水平,然后呢,这个判断被它写进了脑子里很浅的地方,但真正拿出来用,却要等到聊了很久之后。

**核心问题:AI记住的东西,不等于AI在用的东西**

要理解这篇论文在做什么,得先搞懂一个技术圈里越来越被重视的区分:可解码(decodable)和可因果作用(causally active)完全是两码事。

Transformer*:目前主流大语言模型(比如ChatGPT、Llama)背后的神经网络架构,由很多层堆叠而成,信息从输入的第一层一路传递到输出的最后一层。

残差流*:Transformer内部信息传递的一条"主干道",每一层处理完之后,会把结果加到这条主干道上,而不是完全替换掉之前的内容,这意味着前面层写下的信息,理论上可以一路带到很后面的层。

残差流的这个设计带来一个有意思的副作用:一层网络如果在很早期就把某个信息记下来了,这个信息哪怕之后完全没人用它,它依然可以在很晚的层里被读出来。研究者管这个叫"可解码",用一个探针(一个简单的分类器)去读某一层的内部状态,如果能准确猜出某个属性,就说这层"可解码"这个属性。但可解码不代表AI真的拿这个信息去做了什么决定,这就好比你办公桌抽屉里锁着一份重要文件,任何人打开抽屉都能看到它,但这不代表你今天的工作决策真的用到了它。

之前已经有几篇论文发现,对于那些直接写在输入里的属性(比如"这个用户是医生"这种明说的信息),AI经常出现早期就能读出来、但很晚才真正影响输出的情况。这篇论文想问的问题更进一步:如果这个属性不是明说的,而是AI需要在对话过程中一点点猜出来的呢?比如对方到底是新手还是专家,这种事没人会直接告诉你,得靠聊天过程中慢慢感觉出来。这种"需要推理才能得到"的信息,会不会表现出同样的滞后?

**用一场角色扮演对话来做实验:EXPERTCOLLAB数据集**

研究者设计了一个巧妙的实验场景,让同一个AI模型(Llama-3.3-70B)分别扮演两个角色,进行关于科研课题的多轮对话。

这两个角色分别来自四种身份设定:高中生、初级研究者、资深研究者、教授。研究者给每个身份写了详细的性格设定,高中生问的问题偏表面、喜欢用不太准确的类比;初级研究者容易被资深的人一压就退缩;教授则直接指出方案的致命缺陷,从不拐弯抹角。

关键的设计在这里:这些角色设定里绝对不允许出现"我是教授""我有十年经验"这种直接暴露身份的话。系统提示里明确写着"通过你参与对话的方式来体现你的专业水平,而不是直接声明它"。研究者还专门做了一个"泄露检测器",去扫描每一段对话,确认没有任何一句话直接透露了身份,28段对话全部通过检测。

这个设计的用意其实很实际。如果直接在对话里写"我是新手",那AI要做的事情就变成了简单的关键词匹配,跟"推理"没什么关系了。研究者想测的是那种更接近真实社交场景的能力:光靠对方说话的语气、用词、提问方式,AI能不能在心里悄悄给对方打分,以及这个打分到底什么时候真正开始影响它自己怎么回话。

四个身份等级、四个科研话题(图神经网络鲁棒性、投机解码、缩放定律、土壤微生物组),组合出28段完整对话,每段12轮。这个规模不算大,论文自己也承认这只是一次初步验证,而不是一个铁板钉钉的定论。

**探针实验:专业水平信息藏在第8层,但很快就消失了**

研究者从AI每次即将说话前的那个瞬间去读取它内部的状态,一共读了80层里的20个采样层(每隔4层读一次)。然后用一个简单的线性分类器(也就是"探针")去尝试从这个状态里读出两件事:AI自己扮演的角色是什么水平,以及AI判断对方是什么水平。

结果分成两条完全不同的曲线。

AI对自己身份的判断,从第0层开始就能以100%的准确率被读出来,而且一路保持到最后一层都没掉过。这很好理解,因为AI自己的身份是系统提示里写死的,属于"直接给出"的信息,架构完全有能力把这种信息原封不动地传到底。

AI对对方专业水平的判断则完全不同。准确率在第8层达到峰值0.79(满分是1.0,四选一蒙对的概率是0.25),然后一路下滑,到第40层左右就已经掉到接近随机蒙对的水平了。也就是说,AI确实很早就"感觉"出对方是什么水平了,但这个感觉越往后传,越被冲淡,到网络中段基本就找不着了。

研究者还做了个对照实验,防止这个早期信号只是某种"字面小把戏"。他们用一个只看表面语言特征的分类器(比如犹豫词的使用频率、句子长短、疑问句比例、词汇复杂度)去做同样的判断,结果只有0.32的准确率,比蒙的高一点,但远远不如神经网络探针的0.79。这说明AI在第8层记下的东西,不只是简单的"这人说话啰嗦所以是新手"这种表面统计,而是更深层的东西。

**反转发生:真正决定输出的层,是第36层之后**

如果故事到这里结束,那结论会是"AI很早就懂了,但后面忘了"。但研究者接下来做的因果实验,揭示了一个更有意思的真相:AI并没有忘,它只是把这个判断压着没用,直到很晚才开始真正调用它。

这里用到的方法叫反事实激活拼接(counterfactual patching)。

反事实激活拼接*:一种因果验证手段,找两段场景几乎一样、只有一个变量不同的对话(这里是对方的专业水平不同),计算它们在某一层内部状态的差异,然后把这个差异"注入"到另一段对话的对应位置,看看这个改动会不会一路传导到最终输出。

具体操作是这样的:研究者找了48组"配对对话",这些对话场景相同,唯一的区别是对方角色的专业水平不一样。他们计算出这个专业水平差异在某一层残差流里对应的向量差,然后把这个差值硬塞进另一段对话在同一层的状态里,让AI继续往后跑完整个网络,最后看输出端的判断有没有跟着变。

结果用一个叫"归一化因果效应"的指标来衡量,数值接近1代表这个改动完全传导到了最终判断,接近0代表这个改动几乎被网络"无视"了。

在第8层,也就是探针准确率最高的那一层,注入这个专业水平差异,因果效应只有0.01。几乎等于没有任何作用。这就好比你在一份文件上悄悄改了一个关键数字,但审批链条上的每一个人都对这个数字视而不见,最后批下来的结果跟你没改之前一模一样。如果不做这个因果实验,只看探针的解码准确率,研究者很可能会误以为"AI在第8层就已经用上了这个判断",但实际情况恰恰相反:那里的信息虽然存在,却对后续处理毫无影响力。

而当研究者把同样的注入操作放到第36层往后,因果效应飙升到0.86,第40层之后更是超过0.90。这意味着,同一份"专业水平差异"信息,在浅层几乎是死信息,到了网络后半段却几乎能完全左右最终判断,差距超过一个数量级。

为了排除这只是"随便改一下深层状态都会有大影响"这种巧合,研究者还做了一个对照:换成一个跟专业水平毫无关系、只是长度相同的随机向量去做同样的注入。结果这个随机向量在任何层都没有制造出类似的上升曲线,效应始终在0附近晃荡,波动区间也宽得多。这说明第36层之后那条清晰的上升曲线,确实是"专业水平"这个方向本身带来的,不是随便扰动残差流就能出现的假象。

**两种完全独立的检验方法,指向同一个转折点**

科学结论最怕只靠一种方法撑着。研究者又加了一个完全不需要训练任何探针的检验手段:直接算patch前后最后一层激活值的余弦不相似度(可以简单理解成"改动前后输出内部状态差了多少")。

这个不需要任何分类器的指标,同样在第8层附近开始明显上升,到第32层左右趋于饱和,跟因果效应曲线的转折点几乎重合。两种完全独立的方法(一种靠训练好的探针,一种完全不用探针,纯靠数学距离)竟然指向同一个层区间,这大大增加了这个发现不是偶然巧合的可信度。

在实际输出层面,研究者还统计了patch前后AI给出的"最可能的5个下一个词"重合了多少。浅层patch几乎不改变这5个候选词(重合率高达0.97),而深层patch会让大约三分之一的候选词发生变化。换句话说,在AI真正要开口说话的那一刻,浅层的那个"专业水平判断"根本没有参与决策,而深层的判断实实在在地在左右它要说的话。

**这一切合起来意味着什么**

回到开头那个同事的比喻。这篇论文告诉我们的东西,其实可以这样理解:AI并不是"忘了"对方是新手这件事,它更像是把这个判断先记在了一张便签纸上(浅层),但真正翻出这张便签、拿来决定该怎么说话的,是很晚以后(深层)才发生的事情。如果一个产品经理只看AI"知不知道"某件事(也就是探针能不能解码出来),却不去验证"AI有没有真的用上",很可能会对AI的能力产生错误的信心。

研究者把这个转折点和另一篇论文(Lad等人2025年的工作)发现的现象联系了起来。那篇论文发现,Transformer网络在中点附近会出现一个"阶段转换":表示开始向词汇空间对齐,也就是网络开始为最终输出做准备。这篇论文观察到的因果转折点(约第36层,网络一共80层,差不多正好是中点偏后)跟那个转换点对上了号。这提示我们,"需要推理得到的信息几时才真正被使用",可能不是随机分布在网络各处的,而是跟网络本身的功能分区有关系。

论文最后提出了一个可以被验证或推翻的猜想:一个属性越是需要靠推理才能得到(而不是直接说出来),它从"能被读出"到"真正被使用"之间的层数差距就越大。这个猜想目前只有一个对照组的数据支撑(AI自身身份vs对方身份),研究者自己也承认,要真正验证这条规律,需要系统地控制"信息明确程度",从直接说明、到有暗示线索、到完全靠推断,逐档去测,看因果起效的层数是不是真的跟着单调后移。

这篇论文也坦诚地列出了自己的局限:只用了一个模型(Llama-3.3-70B),只有28段对话的小规模合成语料,而且扮演双方角色的是同一个模型,这意味着AI某种程度上可能只是在"认出自己生成内容的模式",而不是真正在做通用的社交推理。层数的具体边界(第8层、第36层)大概率也是这款模型特有的,换个架构未必是同样的数字。

对于关心AI对齐和安全的人来说,这个发现有一个挺直接的应用提示:如果你想去"读出"或者"引导"AI对用户的隐含判断(比如它是不是在迎合用户、是不是因为觉得对方懂得少就简化了回答),你不能只盯着那个探针准确率最高的层去下手,因为在那一层,这个信息虽然存在,却根本不参与决策。真正要干预,得去网络的后半段。

写在后面

读这篇论文的时候,我一直在想一件事:探针能读出来的东西,到底算不算AI"知道"的东西?

这其实是个挺哲学的问题。人类心理学里也有类似的争论,你脑子里存在的记忆,跟你在做决定那一刻真正调用的信息,从来就不是一回事。心理学家管这个叫"内隐知识"和"可及知识"的区别,你可能知道某件事,但那件事在当下这个决策场景里根本没被激活。AI的这个发现,某种程度上是这个现象在神经网络里的一个具体、可测量的版本。

论文里有个细节我觉得特别值得单独拎出来说:错误的混淆矩阵显示,AI搞错专业水平时,几乎全部错在相邻等级之间(比如把初级研究者错认成资深研究者),几乎不会把高中生和教授搞混。这说明AI对"专业水平"的内部表征其实是连续的、有梯度的,不是简单粗暴的四个孤立标签。这跟人类判断陌生人专业水平时的直觉其实挺像的,我们很少会把一个新手和专家完全搞反,但经常分不清"有点经验"和"很有经验"之间的那条线。

还有一个问题这篇论文没有回答,但我觉得特别值得追问:这个"早知道、晚使用"的模式,是不是AI在训练过程中学到的一种"谨慎"策略?会不会是模型在训练时被隐性地鼓励不要过早对用户下判断,直到积累了足够多的证据才敢真正调整自己的行为?如果真是这样,这不是bug,而是一种某种意义上"合理"的保守主义。这个问题留在那里,没有答案,但值得继续想下去。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
西媒:葡足协本希望C罗世界杯后主动退出国家队

西媒:葡足协本希望C罗世界杯后主动退出国家队

体坛周报
2026-10-01 17:13:09
东风导弹泄密案中,间谍郭万钧一家三口均被依法执行死刑

东风导弹泄密案中,间谍郭万钧一家三口均被依法执行死刑

人生录
2026-06-17 20:53:45
两轮加枪惜败!中国选手苏连博凡获男子25米手枪速射银牌

两轮加枪惜败!中国选手苏连博凡获男子25米手枪速射银牌

林子说事
2026-10-01 18:31:33
王钰栋到欧洲绝对有球踢:昨天除进球外4镜头完胜韩国留洋军团!

王钰栋到欧洲绝对有球踢:昨天除进球外4镜头完胜韩国留洋军团!

邱泽云
2026-10-01 19:06:39
她是2届奥运冠军,47岁成妇联主席,嫁大21岁教练,女儿随她姓

她是2届奥运冠军,47岁成妇联主席,嫁大21岁教练,女儿随她姓

大西体育
2026-10-01 14:37:32
国民党主席改选落幕!表面赢家是郑丽文,真正的赢家另有其人

国民党主席改选落幕!表面赢家是郑丽文,真正的赢家另有其人

呼呼历史论
2026-10-01 07:56:38
特朗普声情并茂讲诉迪拜客机遭劫过程,“从未开过飞机的以色列水管工拉起了操纵杆”

特朗普声情并茂讲诉迪拜客机遭劫过程,“从未开过飞机的以色列水管工拉起了操纵杆”

都市快报橙柿互动
2026-10-01 11:44:29
终身不得糖尿病:为了不得糖尿病,请坚守这25条

终身不得糖尿病:为了不得糖尿病,请坚守这25条

鼠鼠健康图鉴
2026-10-01 06:00:15
现场视频曝光!副机长欲劫持飞以色列航班,机长浑身是血躺在地上

现场视频曝光!副机长欲劫持飞以色列航班,机长浑身是血躺在地上

观察者网
2026-09-30 21:07:07
争议?世界第30质疑林诗栋:亚运会没鹰眼,他的发球又开始有问题了

争议?世界第30质疑林诗栋:亚运会没鹰眼,他的发球又开始有问题了

念洲
2026-10-01 09:09:19
刘欢神秘侄子曝光,生活状态太意外

刘欢神秘侄子曝光,生活状态太意外

阿废冷眼观察所
2026-10-01 19:39:45
金鹰奖合照:秦海璐一脸不屑,蒋欣靠边站被翻白眼,宋佳又被曝瓜

金鹰奖合照:秦海璐一脸不屑,蒋欣靠边站被翻白眼,宋佳又被曝瓜

娱圈办事处
2026-10-01 15:33:23
伊总统落地后,伊对美信件曝光:最高领袖已阵亡,停战对两国都好

伊总统落地后,伊对美信件曝光:最高领袖已阵亡,停战对两国都好

不似少年游
2026-10-01 07:10:11
官方说死了9个人,幸存者说至少三千,那列装满尸体的火车,开了两百节车厢,一路开进了《百年孤独》

官方说死了9个人,幸存者说至少三千,那列装满尸体的火车,开了两百节车厢,一路开进了《百年孤独》

古代经典
2026-09-17 12:10:18
医美是个无底洞,这次金鹰节“变样”的杨紫,印证了宋丹丹的话

医美是个无底洞,这次金鹰节“变样”的杨紫,印证了宋丹丹的话

谢葅解说
2026-10-01 05:56:58
泽连斯基抵达前线!部署维瓦尔第行动第四阶段,已收复176平方公里

泽连斯基抵达前线!部署维瓦尔第行动第四阶段,已收复176平方公里

项鹏飞
2026-10-01 20:32:47
当众拒唱国歌不认中国籍,把两个孩子全送出国,如今报应终于来了

当众拒唱国歌不认中国籍,把两个孩子全送出国,如今报应终于来了

鹤羽说个事
2026-09-02 16:51:59
日本亚运会举重项目全部结束,16枚金牌被瓜分。

日本亚运会举重项目全部结束,16枚金牌被瓜分。

有态度网友19ILam
2026-10-01 15:46:40
气候大局定了,不出意外,从国庆开始,中国天气或迎“3个变数”

气候大局定了,不出意外,从国庆开始,中国天气或迎“3个变数”

李博世财经
2026-10-01 10:08:01
球报:热苏斯的言论激怒了C罗,他突然离开的决定让队友震惊

球报:热苏斯的言论激怒了C罗,他突然离开的决定让队友震惊

懂球帝
2026-10-01 03:15:21
2026-10-01 21:32:49
侃故事的阿庆
侃故事的阿庆
几分钟看完一部影视剧,诙谐幽默的娓娓道来
832文章数 9580关注度
往期回顾 全部

科技要闻

5999元起!华为Mate 90系列发布

头条要闻

足够先进可以展示 191式自动步枪硬核开箱视频首次披露

头条要闻

足够先进可以展示 191式自动步枪硬核开箱视频首次披露

体育要闻

“今天的表现,我们可以昂首离开球场”

娱乐要闻

奚梦瑶晒四太豪礼!22只龙凤镯近300万

财经要闻

智谱发上亿Token 能挽回开发者信任吗?

汽车要闻

2027款极氪001将于明年一季度上市 现款猎装同步推新配色

态度原创

数码
旅游
艺术
公开课
军事航空

数码要闻

受内存成本影响 树莓派5 2GB版本价格再次上涨至77.5美元

旅游要闻

长风公园焕新开园,长风海洋世界明星企鹅茂茂迎来一岁派对

艺术要闻

云南最美烂尾楼!砸几十亿的“山顶神仙住处”,让人心疼!

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

美防长宣布组建“自主作战司令部”

无障碍浏览 进入关怀版