网易首页 > 网易号 > 正文 申请入驻

AI知道你懂多少,但要过多久才会真的"用上"这个判断?

0
分享至


你有没有遇到过这种同事:他明明知道你是新人,但直到项目做到一半才开始放慢语速、少用术语跟你解释。前半程他脑子里其实早就贴好了"这人是菜鸟"的标签,可这个判断迟迟没有体现在他说话的方式上。

这篇论文研究的就是AI身上一模一样的现象。只不过这次的"同事"是语言模型,它在跟你聊天的过程中,会不断判断你到底是什么水平,然后呢,这个判断被它写进了脑子里很浅的地方,但真正拿出来用,却要等到聊了很久之后。

**核心问题:AI记住的东西,不等于AI在用的东西**

要理解这篇论文在做什么,得先搞懂一个技术圈里越来越被重视的区分:可解码(decodable)和可因果作用(causally active)完全是两码事。

Transformer*:目前主流大语言模型(比如ChatGPT、Llama)背后的神经网络架构,由很多层堆叠而成,信息从输入的第一层一路传递到输出的最后一层。

残差流*:Transformer内部信息传递的一条"主干道",每一层处理完之后,会把结果加到这条主干道上,而不是完全替换掉之前的内容,这意味着前面层写下的信息,理论上可以一路带到很后面的层。

残差流的这个设计带来一个有意思的副作用:一层网络如果在很早期就把某个信息记下来了,这个信息哪怕之后完全没人用它,它依然可以在很晚的层里被读出来。研究者管这个叫"可解码",用一个探针(一个简单的分类器)去读某一层的内部状态,如果能准确猜出某个属性,就说这层"可解码"这个属性。但可解码不代表AI真的拿这个信息去做了什么决定,这就好比你办公桌抽屉里锁着一份重要文件,任何人打开抽屉都能看到它,但这不代表你今天的工作决策真的用到了它。

之前已经有几篇论文发现,对于那些直接写在输入里的属性(比如"这个用户是医生"这种明说的信息),AI经常出现早期就能读出来、但很晚才真正影响输出的情况。这篇论文想问的问题更进一步:如果这个属性不是明说的,而是AI需要在对话过程中一点点猜出来的呢?比如对方到底是新手还是专家,这种事没人会直接告诉你,得靠聊天过程中慢慢感觉出来。这种"需要推理才能得到"的信息,会不会表现出同样的滞后?

**用一场角色扮演对话来做实验:EXPERTCOLLAB数据集**

研究者设计了一个巧妙的实验场景,让同一个AI模型(Llama-3.3-70B)分别扮演两个角色,进行关于科研课题的多轮对话。

这两个角色分别来自四种身份设定:高中生、初级研究者、资深研究者、教授。研究者给每个身份写了详细的性格设定,高中生问的问题偏表面、喜欢用不太准确的类比;初级研究者容易被资深的人一压就退缩;教授则直接指出方案的致命缺陷,从不拐弯抹角。

关键的设计在这里:这些角色设定里绝对不允许出现"我是教授""我有十年经验"这种直接暴露身份的话。系统提示里明确写着"通过你参与对话的方式来体现你的专业水平,而不是直接声明它"。研究者还专门做了一个"泄露检测器",去扫描每一段对话,确认没有任何一句话直接透露了身份,28段对话全部通过检测。

这个设计的用意其实很实际。如果直接在对话里写"我是新手",那AI要做的事情就变成了简单的关键词匹配,跟"推理"没什么关系了。研究者想测的是那种更接近真实社交场景的能力:光靠对方说话的语气、用词、提问方式,AI能不能在心里悄悄给对方打分,以及这个打分到底什么时候真正开始影响它自己怎么回话。

四个身份等级、四个科研话题(图神经网络鲁棒性、投机解码、缩放定律、土壤微生物组),组合出28段完整对话,每段12轮。这个规模不算大,论文自己也承认这只是一次初步验证,而不是一个铁板钉钉的定论。

**探针实验:专业水平信息藏在第8层,但很快就消失了**

研究者从AI每次即将说话前的那个瞬间去读取它内部的状态,一共读了80层里的20个采样层(每隔4层读一次)。然后用一个简单的线性分类器(也就是"探针")去尝试从这个状态里读出两件事:AI自己扮演的角色是什么水平,以及AI判断对方是什么水平。

结果分成两条完全不同的曲线。

AI对自己身份的判断,从第0层开始就能以100%的准确率被读出来,而且一路保持到最后一层都没掉过。这很好理解,因为AI自己的身份是系统提示里写死的,属于"直接给出"的信息,架构完全有能力把这种信息原封不动地传到底。

AI对对方专业水平的判断则完全不同。准确率在第8层达到峰值0.79(满分是1.0,四选一蒙对的概率是0.25),然后一路下滑,到第40层左右就已经掉到接近随机蒙对的水平了。也就是说,AI确实很早就"感觉"出对方是什么水平了,但这个感觉越往后传,越被冲淡,到网络中段基本就找不着了。

研究者还做了个对照实验,防止这个早期信号只是某种"字面小把戏"。他们用一个只看表面语言特征的分类器(比如犹豫词的使用频率、句子长短、疑问句比例、词汇复杂度)去做同样的判断,结果只有0.32的准确率,比蒙的高一点,但远远不如神经网络探针的0.79。这说明AI在第8层记下的东西,不只是简单的"这人说话啰嗦所以是新手"这种表面统计,而是更深层的东西。

**反转发生:真正决定输出的层,是第36层之后**

如果故事到这里结束,那结论会是"AI很早就懂了,但后面忘了"。但研究者接下来做的因果实验,揭示了一个更有意思的真相:AI并没有忘,它只是把这个判断压着没用,直到很晚才开始真正调用它。

这里用到的方法叫反事实激活拼接(counterfactual patching)。

反事实激活拼接*:一种因果验证手段,找两段场景几乎一样、只有一个变量不同的对话(这里是对方的专业水平不同),计算它们在某一层内部状态的差异,然后把这个差异"注入"到另一段对话的对应位置,看看这个改动会不会一路传导到最终输出。

具体操作是这样的:研究者找了48组"配对对话",这些对话场景相同,唯一的区别是对方角色的专业水平不一样。他们计算出这个专业水平差异在某一层残差流里对应的向量差,然后把这个差值硬塞进另一段对话在同一层的状态里,让AI继续往后跑完整个网络,最后看输出端的判断有没有跟着变。

结果用一个叫"归一化因果效应"的指标来衡量,数值接近1代表这个改动完全传导到了最终判断,接近0代表这个改动几乎被网络"无视"了。

在第8层,也就是探针准确率最高的那一层,注入这个专业水平差异,因果效应只有0.01。几乎等于没有任何作用。这就好比你在一份文件上悄悄改了一个关键数字,但审批链条上的每一个人都对这个数字视而不见,最后批下来的结果跟你没改之前一模一样。如果不做这个因果实验,只看探针的解码准确率,研究者很可能会误以为"AI在第8层就已经用上了这个判断",但实际情况恰恰相反:那里的信息虽然存在,却对后续处理毫无影响力。

而当研究者把同样的注入操作放到第36层往后,因果效应飙升到0.86,第40层之后更是超过0.90。这意味着,同一份"专业水平差异"信息,在浅层几乎是死信息,到了网络后半段却几乎能完全左右最终判断,差距超过一个数量级。

为了排除这只是"随便改一下深层状态都会有大影响"这种巧合,研究者还做了一个对照:换成一个跟专业水平毫无关系、只是长度相同的随机向量去做同样的注入。结果这个随机向量在任何层都没有制造出类似的上升曲线,效应始终在0附近晃荡,波动区间也宽得多。这说明第36层之后那条清晰的上升曲线,确实是"专业水平"这个方向本身带来的,不是随便扰动残差流就能出现的假象。

**两种完全独立的检验方法,指向同一个转折点**

科学结论最怕只靠一种方法撑着。研究者又加了一个完全不需要训练任何探针的检验手段:直接算patch前后最后一层激活值的余弦不相似度(可以简单理解成"改动前后输出内部状态差了多少")。

这个不需要任何分类器的指标,同样在第8层附近开始明显上升,到第32层左右趋于饱和,跟因果效应曲线的转折点几乎重合。两种完全独立的方法(一种靠训练好的探针,一种完全不用探针,纯靠数学距离)竟然指向同一个层区间,这大大增加了这个发现不是偶然巧合的可信度。

在实际输出层面,研究者还统计了patch前后AI给出的"最可能的5个下一个词"重合了多少。浅层patch几乎不改变这5个候选词(重合率高达0.97),而深层patch会让大约三分之一的候选词发生变化。换句话说,在AI真正要开口说话的那一刻,浅层的那个"专业水平判断"根本没有参与决策,而深层的判断实实在在地在左右它要说的话。

**这一切合起来意味着什么**

回到开头那个同事的比喻。这篇论文告诉我们的东西,其实可以这样理解:AI并不是"忘了"对方是新手这件事,它更像是把这个判断先记在了一张便签纸上(浅层),但真正翻出这张便签、拿来决定该怎么说话的,是很晚以后(深层)才发生的事情。如果一个产品经理只看AI"知不知道"某件事(也就是探针能不能解码出来),却不去验证"AI有没有真的用上",很可能会对AI的能力产生错误的信心。

研究者把这个转折点和另一篇论文(Lad等人2025年的工作)发现的现象联系了起来。那篇论文发现,Transformer网络在中点附近会出现一个"阶段转换":表示开始向词汇空间对齐,也就是网络开始为最终输出做准备。这篇论文观察到的因果转折点(约第36层,网络一共80层,差不多正好是中点偏后)跟那个转换点对上了号。这提示我们,"需要推理得到的信息几时才真正被使用",可能不是随机分布在网络各处的,而是跟网络本身的功能分区有关系。

论文最后提出了一个可以被验证或推翻的猜想:一个属性越是需要靠推理才能得到(而不是直接说出来),它从"能被读出"到"真正被使用"之间的层数差距就越大。这个猜想目前只有一个对照组的数据支撑(AI自身身份vs对方身份),研究者自己也承认,要真正验证这条规律,需要系统地控制"信息明确程度",从直接说明、到有暗示线索、到完全靠推断,逐档去测,看因果起效的层数是不是真的跟着单调后移。

这篇论文也坦诚地列出了自己的局限:只用了一个模型(Llama-3.3-70B),只有28段对话的小规模合成语料,而且扮演双方角色的是同一个模型,这意味着AI某种程度上可能只是在"认出自己生成内容的模式",而不是真正在做通用的社交推理。层数的具体边界(第8层、第36层)大概率也是这款模型特有的,换个架构未必是同样的数字。

对于关心AI对齐和安全的人来说,这个发现有一个挺直接的应用提示:如果你想去"读出"或者"引导"AI对用户的隐含判断(比如它是不是在迎合用户、是不是因为觉得对方懂得少就简化了回答),你不能只盯着那个探针准确率最高的层去下手,因为在那一层,这个信息虽然存在,却根本不参与决策。真正要干预,得去网络的后半段。

写在后面

读这篇论文的时候,我一直在想一件事:探针能读出来的东西,到底算不算AI"知道"的东西?

这其实是个挺哲学的问题。人类心理学里也有类似的争论,你脑子里存在的记忆,跟你在做决定那一刻真正调用的信息,从来就不是一回事。心理学家管这个叫"内隐知识"和"可及知识"的区别,你可能知道某件事,但那件事在当下这个决策场景里根本没被激活。AI的这个发现,某种程度上是这个现象在神经网络里的一个具体、可测量的版本。

论文里有个细节我觉得特别值得单独拎出来说:错误的混淆矩阵显示,AI搞错专业水平时,几乎全部错在相邻等级之间(比如把初级研究者错认成资深研究者),几乎不会把高中生和教授搞混。这说明AI对"专业水平"的内部表征其实是连续的、有梯度的,不是简单粗暴的四个孤立标签。这跟人类判断陌生人专业水平时的直觉其实挺像的,我们很少会把一个新手和专家完全搞反,但经常分不清"有点经验"和"很有经验"之间的那条线。

还有一个问题这篇论文没有回答,但我觉得特别值得追问:这个"早知道、晚使用"的模式,是不是AI在训练过程中学到的一种"谨慎"策略?会不会是模型在训练时被隐性地鼓励不要过早对用户下判断,直到积累了足够多的证据才敢真正调整自己的行为?如果真是这样,这不是bug,而是一种某种意义上"合理"的保守主义。这个问题留在那里,没有答案,但值得继续想下去。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
追到机场挽留!曝热苏斯和足协主席恳请C罗留下 但后者仍登上飞机

追到机场挽留!曝热苏斯和足协主席恳请C罗留下 但后者仍登上飞机

风过乡
2026-10-01 06:50:00
你最好确定以色列拿不到“证据”

你最好确定以色列拿不到“证据”

走读新生
2026-10-01 17:44:04
林诗栋4-0王楚钦夺冠,现场却齐喊“王皓下课”,王皓罕见连鼓两次掌回怼

林诗栋4-0王楚钦夺冠,现场却齐喊“王皓下课”,王皓罕见连鼓两次掌回怼

火锅局
2026-10-01 13:09:57
重磅!北大法学院赵宏教授大放厥词,公开场合胡言乱语

重磅!北大法学院赵宏教授大放厥词,公开场合胡言乱语

平老师666
2026-10-01 13:28:41
深圳网友称高铁候补订单0:38兑现成功,早上睡醒发现车已开走,12306回应:候补时可设置截止兑现时间,系统默认截止兑现时间为开车前6小时

深圳网友称高铁候补订单0:38兑现成功,早上睡醒发现车已开走,12306回应:候补时可设置截止兑现时间,系统默认截止兑现时间为开车前6小时

潇湘晨报
2026-10-01 10:53:13
伊朗总统归国后,致美信件曝光:最高领袖已阵亡,停战对双方都好

伊朗总统归国后,致美信件曝光:最高领袖已阵亡,停战对双方都好

云上乌托邦
2026-10-01 22:42:18
“我们自愿有何罪”?三男三女聚众淫乱,三亚高知换妻游戏案始末

“我们自愿有何罪”?三男三女聚众淫乱,三亚高知换妻游戏案始末

易玄
2026-09-13 11:43:30
4天后终服软?曝葡萄牙主帅本轮赛后公开向C罗道歉!疑遭总理施压

4天后终服软?曝葡萄牙主帅本轮赛后公开向C罗道歉!疑遭总理施压

我爱英超
2026-10-01 22:21:08
“足够先进,可以展示”

“足够先进,可以展示”

都市快报橙柿互动
2026-10-01 18:13:31
武契奇最后一天冲进中国使馆!外媒急了:这是要当第二个普京?

武契奇最后一天冲进中国使馆!外媒急了:这是要当第二个普京?

旧史新谭
2026-10-01 16:03:20
上海52岁炒股冠军罕见发声:目前A股想逢低建仓,建议只磕123原则

上海52岁炒股冠军罕见发声:目前A股想逢低建仓,建议只磕123原则

股经纵横谈
2026-10-01 17:25:48
上海94岁阿婆独自外出,摔倒流血,坚持不肯去医院!检查结果让所有人后怕…

上海94岁阿婆独自外出,摔倒流血,坚持不肯去医院!检查结果让所有人后怕…

上观新闻
2026-10-01 08:54:39
10月1日,财政部发布重要消息,2026年养老金调整确定了吗?

10月1日,财政部发布重要消息,2026年养老金调整确定了吗?

虎哥闲聊
2026-10-01 14:23:06
离职高管向寒武纪索赔278亿元:一纸上市前的约定,如何变成一场豪赌

离职高管向寒武纪索赔278亿元:一纸上市前的约定,如何变成一场豪赌

红星新闻
2026-10-01 18:14:23
原央视主持人阿丘,被通报

原央视主持人阿丘,被通报

上观新闻
2026-10-01 06:37:01
人人人人人人人人人人

人人人人人人人人人人

上海黄浦
2026-10-01 17:20:20
越扒越有!C罗风波发酵,葡媒曝猛料,不止要求主帅认错这么简单

越扒越有!C罗风波发酵,葡媒曝猛料,不止要求主帅认错这么简单

旧史新谭
2026-10-01 13:19:38
张继科训练基地学费曝光:月收费980元到4400元,学员水平越高收费越低;学员:这个资源收这个费用算很低了,“张继科亲自下场指导训练”

张继科训练基地学费曝光:月收费980元到4400元,学员水平越高收费越低;学员:这个资源收这个费用算很低了,“张继科亲自下场指导训练”

极目新闻
2026-10-01 21:40:09
喋血航班、真人真事:一个普通人可以勇敢冷静到何种程度?

喋血航班、真人真事:一个普通人可以勇敢冷静到何种程度?

呦呦鹿鸣
2026-10-01 15:15:53
装都不装了!林诗栋官宣退赛后,离谱一幕出现,与樊振东处境一样

装都不装了!林诗栋官宣退赛后,离谱一幕出现,与樊振东处境一样

十点街球体育
2026-10-01 22:42:07
2026-10-02 05:51:00
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
10040文章数 569关注度
往期回顾 全部

科技要闻

5999元起!华为Mate 90系列发布

头条要闻

桂林市文促会深夜发布致歉信:向阿丘诚恳致歉

头条要闻

桂林市文促会深夜发布致歉信:向阿丘诚恳致歉

体育要闻

“今天的表现,我们可以昂首离开球场”

娱乐要闻

奚梦瑶晒四太豪礼!22只龙凤镯近300万

财经要闻

智谱发上亿Token 能挽回开发者信任吗?

汽车要闻

2027款极氪001将于明年一季度上市 现款猎装同步推新配色

态度原创

数码
教育
游戏
手机
公开课

数码要闻

亚马逊发布全新Kindle:取消传统边框 正面屏幕实现全面平整化

教育要闻

爱国主义教育应该在文化课之上

我在不被「心」偷走我的心挑战中取得了0.01秒的好成绩

手机要闻

瑞银:iPhone18Pro系列等待期表现平平予苹果“中性”评级

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版