网易首页 > 网易号 > 正文 申请入驻

Meta「透视」AI思维链:CRV推理诊断,准确率达 92%!

0
分享至


新智元报道

编辑:倾倾

【新智元导读】 在最近一篇来自Meta FAIR团队的论文里,研究者找到了一种前所未有的方式——他们能实时看到AI的思考过程。这项名为CRV的方法,通过替换模型内部的MLP模块,让每一步推理都变得「可见」。这不是隐喻,而是可量化的现象。Meta用它让错误检测精度提升到92.47%,也让人类第一次得以窥见AI是怎么想错的。

「Meta刚刚找到一种方法,可以实时观察AI的思维过程崩溃。」

一条看似寻常的推文,在AI圈炸开了锅。


发帖人是研究员@JacksonAtkinsX,他称Meta的新技术能让机器的思维「透明化」——不仅能看到模型在想什么,还能看见它在哪一步彻底「想错」。

在Meta FAIR团队刚发布的论文中,这项被称为CRV(Circuit-based Reasoning Verification)的新方法,就像一台「AI脑部X光机」:

它能追踪语言模型的每一次推理、记录每一条电流路径,甚至捕捉到思维崩溃的瞬间。


论文链接:https://arxiv.org/abs/2510.09312?utm_source

当屏幕上那张电路图突然从整洁的网状,变成混乱的线团——研究者第一次,看见了AI的思维是怎么崩溃的。

Meta「看见」了AI是怎么想错的

Meta刚刚找到一种方法,可以实时观察AI的思维过程崩溃。

当研究员Jackson Atkins发出这条推文时,AI社区瞬间沸腾了

乍一听像科幻小说的桥段。AI在思考的时候忽然断链、炸裂,而研究者却说能直接看到那一刻。

但这不是夸张。在Meta FAIR团队刚发表的论文 《Verifying Chain-of-Thought Reasoning via Its Computational Graph》 中,他们提出了一种新方法:CRV(Circuit-based Reasoning Verification)。

这项技术能让研究者在模型「思考」的过程中,看到它的推理电路。

当模型推理正确时,它的「内部电路图」干净、有条理;一旦模型犯错,电路图立刻变得纠缠、杂乱。


推理指纹特征对比图。错误推理在这些特征上普遍更加分散、混乱。

研究团队将这种电路结构称为模型的「推理指纹(reasoning fingerprint)」。

他们发现,错误并不是随机的,而是有形、有迹可循:只要读取这张「电路指纹图」,就能预测模型是否即将犯错。


在算术推理实验中,CRV 的检测精度(AUROC)从76.45提升至92.47,误报率从63.33%降至37.09%。

更令人震撼的是,当研究者关闭一个错误激活的乘法特征神经元后,模型立即修正了计算。


例如在表达式 (7 × ((5 + 9) + 7)) 中,模型原本输出105,干预后改为147——完全正确。

错误推理并非随机,而是电路执行过程中的结构性失败。

Meta FAIR的研究者用一句话概括他们的目标:要让AI不仅能「给出答案」,更能「证明自己想得对」。

重塑推理结构

给机器装上「透明大脑」

要想让AI的思维过程变得「可见」,Meta做了一件几乎颠覆常识的事:他们重新改造了语言模型的大脑结构。

这项被命名为CRV(Circuit-based Reasoning Verification)的方法,核心思想不是提升模型性能,而是让AI的每一步推理都能被验证、被追踪。

我们的目标不是让模型更聪明,而是让它的思考过程本身变得可验证。

AI的大脑不再是黑盒:每个「神经元」都能被看见

研究团队首先将模型中的传统MLP模块替换为一种可解释的稀疏结构——Transcoder层。

在不同层将MLP替换为Transcoder后,模型的损失值在短时间内迅速下降并趋于稳定。


Transcoder层的训练稳定性证明。CRV 不是理论概念,而是可以在大模型上稳定运行的真实工程结构。

每个Transcoder都像一组带标签的神经元,能代表特定的语义特征,例如「加法」「乘法」「括号」或「进位」。

这样一来,研究者就能在推理过程中,看到哪些神经元被激活、何时点亮、如何传递。

论文把这一步称为「X-Ray」,即为模型安装一层「透视皮肤」。

研究者形容它像「在黑箱里装上摄像机」:每一层的计算过程不再是难以解读的向量,而是清晰的电路信号。

AI的思维可以画出来:Meta让推理变成一张电路图

当模型执行一步推理时,系统会绘制出一张归因图(Attribution Graph),节点代表被激活的特征,边表示它们之间的信息流动。

每一次逻辑跳转、每一个概念结合,都会在图上留下痕迹。

这张图不是静态的,而是随推理动态变化的「思维轨迹」。

当模型看到「3+5=」时,研究者可以实时看到「加法特征」从底层被点亮、信息如何层层汇聚到输出。

而当模型出错时,路径就会打结、分叉、环绕——像一条错乱的神经信号。


CRV 方法流程示意图中展示了从「替换MLP模块」、构建归因图、提取结构特征,到最后交由诊断分类器判定「正确/错误」的全过程。

让AI自己暴露错误:Meta发现「思维崩溃」的指纹

当思维电路图生成后,Meta提取了大量结构特征:节点数量、图密度、平均边权、路径长度、中心性……

这些数据构成了模型的「思维指纹

接着,他们训练了一个分类器——它不读文字,也不看答案,只看结构。在实验中,研究者发现:

当图结构纠缠、分布混乱时,模型几乎一定在推理出错。

也就是说,模型是否思考正确,不必等它说完答案,只要观察那张「电路图」的形态,就能提前判断。

CRV的出现,让语言模型第一次拥有了「可诊断的神经结构」。

Meta并没有让AI更聪明,而是让人类第一次能看见AI是如何出错的。

黑箱不再完全密封,智能第一次露出了自己的「电路断层」。

不止是论文,更是AI研究的分水岭

在Meta公布实验结果后,最直观的震撼来自这组对比图:

CRV与多种验证方法的性能对比。图中展示了不同方法在算术推理任务下的检测表现。

红线代表 CRV,无论是在AUROC(检测精度)、AUPR(正确预测率) 还是FPR@95(误报率)上,都远高于或低于其他方法。

这意味着它不仅能看见推理电路的结构,更能精准判断模型是否会想错。


这样的结果让许多研究者意识到:CRV不只是一次模型改造,而是一次观念的翻转。

过去,我们判断一个模型是否推理正确,只能看它的答案。

它写出一段chain-of-thought,人类再去揣测逻辑是不是连贯,结论是不是对的。

这一切都发生在黑箱之外——我们只能看到输出,却无法追踪「它是怎么想的」。

而Meta的CRV,把这条思维链第一次摊在显微镜下。研究者不再靠猜,而是能直接看到模型内部的逻辑路径:

每一次特征被点亮,每一条信号被传递,都能在图上找到对应的「电路」。

他们不是在评估答案,而是在验证思维的结构本身。


更重要的是,CRV让「可解释性」和「可靠性」第一次真正接上了。

在过去的研究里,前者关注看懂模型,后者追求信得过模型,两条路几乎平行——我们能看到热力图,却依然不知道为什么模型会错。

而在Meta的实验中,研究者既能解释模型为什么出错,也能预测下一步它可能在哪出错。

CRV也许是通向「可控智能」的第一步。当推理错误能被结构化地识别,就意味着它可以被预测、干预,甚至被修复。

论文中有一个著名的例子——关闭一个错误激活的神经特征后,模型立刻修正答案。

这说明错误并非偶然,而是电路级的故障。如果未来能实时监测这些特征,我们或许能在幻觉发生前按下「刹车」。

从这一刻起,AI的错误不再是神秘的灵异事件。它们是有形的、可诊断的。


不同任务中正确与错误推理的拓扑特征分布图中蓝色表示正确推理,红色表示错误推理。

Meta把黑箱的盖子掀开了一条缝——让人类第一次有机会,不只是造出智能,而是看懂智能本身。

能看懂AI的那天

我们离「可控智能」还有多远?

就算Meta已经能「看见AI在想什么」,这项技术距离真正落地,仍有一段漫长的路要走。

在论文结尾部分,研究团队自己就坦率地写下了「局限与未竟之处」。

我们的方法目前需要大量计算资源,因为必须将所有MLP层替换为Transcoder层,并计算完整的归因图。

也就是说,要让模型变得可见,代价是巨大的:每一层都要被重建,每一个特征都要被追踪。

光是绘制一次完整的归因图,就可能消耗掉普通训练的数十倍算力。这不是能随意做出的功能,而是需要投入巨大的工程。


更现实的问题是——规模。

实验仅在最大8B参数规模的模型上进行,将其扩展到更大模型仍需后续研究。

CRV目前只在中等体量的模型上被验证,而如今主流的大语言模型动辄上百亿、甚至上千亿参数,要让整个推理电路都能被看见,几乎不可能在短期内完成。

更棘手的是泛化问题。

CRV在算术任务上表现亮眼,但一旦换到自然语言推理、常识问答、代码生成这类复杂任务时,归因图结构的规律会完全不同,错误特征不再稳定,诊断效果明显下降。

最后,Meta团队也提醒读者:

Transcoder架构只是原始MLP的一种近似,并非完美替代。

这意味着,研究者看到的那些「电路轨迹」,其实是经过重新投影后的近似结构。

Meta的CRV不是让机器更聪明,而是让人类第一次得以窥见智能的内部结构。

那些曾被称为「幻觉」的错误、不确定的跳跃、莫名的偏差,如今都能被描摹成一张电路图,被一点点拆解、理解、修复。

或许距离真正「可靠」的AI还很远,但这一步已经改变了方向。

人类不再只是 AI 的使用者,而是它的读者、医生,也是见证者。

当机器的思维第一次被照亮,这束光也照进了我们自己的认知——照见了我们对智能的渴望、恐惧,以及那句始终悬在科学尽头的问题:

我们究竟是在教会机器思考,还是在学会看懂自己?

参考资料:

https://x.com/JacksonAtkinsX/status/1977721832909177032

https://arxiv.org/abs/2510.09312?utm_source=chatgpt.com

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
S家又开始了!全家上阵使出三连招,就为榨干大S一周年忌日热度

S家又开始了!全家上阵使出三连招,就为榨干大S一周年忌日热度

萌神木木
2026-02-01 17:01:19
中华曲艺学会换届,周炜当选会长,程野当选副会长!

中华曲艺学会换届,周炜当选会长,程野当选副会长!

达文西看世界
2026-02-01 18:04:32
委内瑞拉向美国供应石油,加拿大这才发现,自己是最大受害者

委内瑞拉向美国供应石油,加拿大这才发现,自己是最大受害者

碳基生物关怀组织
2026-01-18 22:55:02
胆大包天!国家军队内部反腐打贪力度这么大,竟然还有人顶风作案

胆大包天!国家军队内部反腐打贪力度这么大,竟然还有人顶风作案

百态人间
2026-01-28 15:39:47
左派叙事持续崩塌:爱泼斯坦文件公开,左派精英集体塌方

左派叙事持续崩塌:爱泼斯坦文件公开,左派精英集体塌方

斌闻天下
2026-02-01 06:15:03
原来,女人这样看待男女关系:真心从不是“搞定”,而是彼此滋养

原来,女人这样看待男女关系:真心从不是“搞定”,而是彼此滋养

青苹果sht
2026-01-30 05:20:41
资深班主任才敢告诉你:小学成绩好的,到初中还是好,差的还是差

资深班主任才敢告诉你:小学成绩好的,到初中还是好,差的还是差

好爸育儿
2026-01-18 22:10:41
《科学》证实:熬夜,其实是大脑在“吃屎”!

《科学》证实:熬夜,其实是大脑在“吃屎”!

徐德文科学频道
2025-12-22 20:33:40
全球唯一一只不属于中国的熊猫,叫欣欣,吃不到竹子吃的是仙人掌

全球唯一一只不属于中国的熊猫,叫欣欣,吃不到竹子吃的是仙人掌

西楼知趣杂谈
2026-01-31 13:18:43
山东大学齐鲁医院德州医院未按规定填写病历被行政处罚10000元

山东大学齐鲁医院德州医院未按规定填写病历被行政处罚10000元

感知山东
2026-02-01 10:19:31
天助阿森纳:0-1,英超第3遭10人英超第8掀翻,3连胜终结,差榜首7分

天助阿森纳:0-1,英超第3遭10人英超第8掀翻,3连胜终结,差榜首7分

侧身凌空斩
2026-02-02 00:11:44
还让他罚?尼科-帕斯三次在意甲主罚点球无一命中

还让他罚?尼科-帕斯三次在意甲主罚点球无一命中

懂球帝
2026-02-02 00:39:37
30岁男子家中如厕突发不适,从异常倒地到失去意识仅1分钟,送医后确认死亡

30岁男子家中如厕突发不适,从异常倒地到失去意识仅1分钟,送医后确认死亡

上观新闻
2026-02-01 11:03:25
新华社消息|伊朗总统:战争既不符合伊朗利益也不符合美国利益

新华社消息|伊朗总统:战争既不符合伊朗利益也不符合美国利益

新华社
2026-02-01 10:37:07
北京输球揪出最大毒瘤!他投篮8中1,正负值-11,最后纯瞎打啊

北京输球揪出最大毒瘤!他投篮8中1,正负值-11,最后纯瞎打啊

篮球专区
2026-02-01 22:03:41
上海交大:每次起床后大量喝水的人,用不了多久,身体或有7变化

上海交大:每次起床后大量喝水的人,用不了多久,身体或有7变化

读懂世界历史
2025-11-23 11:18:04
由于暴风雪,马刺队被困在夏洛特,与魔术队的比赛将再次延期

由于暴风雪,马刺队被困在夏洛特,与魔术队的比赛将再次延期

好火子
2026-02-02 04:45:32
央视实锤!成本2元卖价19800元!不少人被骗,赶紧别用了

央视实锤!成本2元卖价19800元!不少人被骗,赶紧别用了

素衣读史
2026-01-28 17:22:30
日本秋叶原咖啡店关门,门口用多国语言表示感谢,但是中文却只写“请勿入内

日本秋叶原咖啡店关门,门口用多国语言表示感谢,但是中文却只写“请勿入内

日本物语
2026-01-31 20:34:19
小鼠研究表明,挖鼻孔与阿尔茨海默病之间存在令人惊讶的联系

小鼠研究表明,挖鼻孔与阿尔茨海默病之间存在令人惊讶的联系

心中的麦田
2026-01-21 20:18:15
2026-02-02 05:59:00
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
14457文章数 66560关注度
往期回顾 全部

科技要闻

10亿元宝红包突袭 复刻微信支付还是微视?

头条要闻

特朗普又有疯狂想法:白宫格斗赛 首都飙赛车

头条要闻

特朗普又有疯狂想法:白宫格斗赛 首都飙赛车

体育要闻

德约大度祝贺阿卡 幽默互动逗笑纳达尔

娱乐要闻

春晚第三次联排阵容曝光:全是实力派

财经要闻

黄仁勋台北"夜宴":汇聚近40位台企高管

汽车要闻

岚图汽车1月交付10515辆 同比增长31%

态度原创

教育
本地
亲子
数码
旅游

教育要闻

语不惊人死不休,立刚反对学英语有些着魔了,又出新谬论

本地新闻

云游中国|拨开云雾,巫山每帧都是航拍大片

亲子要闻

兰姐带玥儿看北京新学校,玥儿一待俩小时,筱梅的话终于有人信了

数码要闻

显存稀缺暴涨:三款RTX 50 GPU将占一季度总供应量75%!

旅游要闻

春节必打卡10大榜单聚焦“京味年味”

无障碍浏览 进入关怀版