网易首页 > 网易号 > 正文 申请入驻

从数据分布视角重新审视大模型推理,马斯克回复,Grok破防

0
分享至

本文作者来自亚利桑那州立大学数据挖掘与机器学习实验室 (Data Mining and Machine Learning Lab),包括博士研究生赵成帅、谭箴、马平川、李大卫、蒋博涵以及指导老师刘欢教授。Statistical Deep Learning Lab 王砚丞、杨颖振教授。

思维链 (CoT) 提示技术常被认为是让大模型分步思考的关键手段,通过在输入中加入「Let’s think step by step」等提示,模型会生成类似人类的中间推理步骤,显著提升复杂任务的表现。然而,这些流畅的推理链条是否真的反映了模型的推理能力?

亚利桑那州立大学的一项最新研究却发现,CoT 推理可能并不是真正的推理,而更像是对训练数据分布内模式的复现。一旦输入任务与训练数据分布存在差异,这种看似稳固的推理链条就会迅速失效,呈现出类似「海市蜃楼」的脆弱性。

  • 论文标题:Is Chain-of-Thought Reasoning of LLMs a Mirage? A Data Distribution Lens
  • 论文链接:
  • https://arxiv.org/pdf/2508.01191
  • 项目开源:
  • https://github.com/ChengshuaiZhao0/DataAlchemy
  • 推特讨论:https://x.com/ChengshuaiZhao/status/1953291261999497258
  • 领英推广:
  • https://www.linkedin.com/feed/update/urn:li:activity:7359056339228090368/

在这篇工作里作者探究了 CoT 的泛化性和 Out-of-Distribution (OOD) 问题,马斯克看当场测试 Grok 是否会生成 OOD 的内容,直接「强迫」Grok 生成粗俗的脏话锐评,节目效果拉满!

推理的「幻象」

研究团队在论文开头给出了一个典型的例子:问题是:「美国建国年是闰年还是平年?」,模型的回答是:「美国建于 1776 年,1776 能被 4 整除,又不是世纪年,所以是闰年。因此,美国建国那一年是平年。」这一回答中的推理步骤和知识点看似正确,但结论却与前提自相矛盾。这表明模型虽然会复述逻辑规则,却未必真的用这些规则来推导答案。

事实上,已有相关研究表明,CoT 的性能提升往往源于表层语义匹配。一旦问题稍作改写,或者引入与结论无关的内容,模型的表现便会显著下降。

数据分布视角下的 CoT 假设

在这项研究中,作者提出了一个新的解释框架,即从数据分布的角度来理解 CoT。他们认为,CoT 的有效性主要来源于模型在训练分布内学到的「结构性归纳偏差」(structured inductive bias)。

换句话说,所谓的推理链只是对训练数据中常见模式的复现,而非真正的逻辑推演。当测试任务与训练数据之间的分布差异增大时,这种「推理」表现会迅速崩塌。

研究团队还用理论公式刻画了这种关系,并引入了一个可计算的分布差异指标,从而能够在实验中估计分布偏移对推理性能的影响。

可控实验平台:数据炼金术

为了避免大规模预训练模型中复杂因素的干扰,团队选择从零训练语言模型,并搭建了一个名为数据炼金术 (DataAlchemy) 的可控实验环境。

在该框架中,作者将广泛意义上的各种 NLP 下游任务抽象成不同「元素」和「变换」的组合。基本「元素」是由 26 个字母原子组成的固定长度序列。作者设计了两种基本「变换」:一种是 ROT 变换,即将字母表循环位移若干位;另一种是循环位置平移,将序列整体向右移动指定位置。

在此基础上,他们构造了各种组合变换,通过将不同变换按顺序和参数串联,形成推理链。每个任务的正确推理链可以被精确生成,这使得模型输出与标准答案之间的差异能够被逐步对照评估。

三类泛化实验的发现

首先在「任务泛化」方面,作者分别考察了「变换泛化」和「元素泛化」两种情形。「变换泛化」测试了模型在面对新的变换组合,甚至完全陌生的变换类型时的表现;「元素泛化」则涉及模型遇到新的字母组合,或者训练过程中从未见过的字母。

在分布内的情况下,模型的准确率接近 100%。然而,只要分布稍有偏移,例如变换顺序被重新组合,准确率便会骤降至 0.01%;当测试中出现全新「变换」时,性能更是几乎完全丧失。

作者还发现,虽然在少量新数据上进行监督微调 (SFT) 可以迅速恢复性能,但这只是在原有分布边界上做了扩展,并未真正提升模型的抽象泛化能力。

在「长度泛化」方面,研究团队分别考察了「文本长度」变化和「推理步数」变化的影响。实验结果表明,即使输入序列长度仅比训练时多或少一个单位,模型的表现也会显著下降。它往往会生成与训练长度一致的推理链,并通过添加或删除词元来「凑长度」。当推理步数与训练设置不一致时,模型几乎完全无法泛化,除非它在训练中显式地见过相应步数的样例。

在「格式泛化」方面,作者通过插入、删除、替换等方式扰动输入提示,以模拟现实场景中的多样的格式。他们发现,模型对格式的变化极为敏感,尤其是当变化发生在「元素」或「变换」部分时,即使逻辑内容不变,仅仅提示形式不同,也可能导致推理彻底失败。

温度、规模与泛化脆弱性的普遍性

作者进一步测试了不同采样温度和模型规模下的表现。在合理的温度范围内,CoT 的脆弱性模式保持一致。模型规模的变化同样不影响这一趋势。这表明,这种对分布偏移的敏感性并非个别模型的特性,而是一种普遍现象。

研究的现实意义

这项研究对实际应用提出了多项警示。

首先,在医疗、金融和法律等高风险领域,不能盲目依赖 CoT 作为稳健推理的保证。流畅但逻辑有误的推理链可能比直接给出错误答案更具误导性。

其次,现有的评测方法往往依赖与训练分布高度一致的验证集,这会严重高估模型的鲁棒性。为了更准确地评估系统性能,必须引入严格的分布外测试。

最后,虽然在少量新数据上进行监督微调可以迅速提升特定任务下的表现,但这种方法只是对原有分布的局部扩展,不能赋予模型真正的抽象推理能力。

结论

通过数据分布的视角,这项研究揭示了 CoT 推理的本质:它更像是对训练中出现过的模式的结构化复现,而不是真正的逻辑推理。一旦任务结构、推理链长度或输入格式超出了训练分布的范围,模型的表现便会迅速崩溃。

在未来的发展中,研究者和工程师需要在充分利用 CoT 在分布内的优势的同时,正视其在泛化能力上的瓶颈,并在评测和部署中保持足够的谨慎。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
889万腰斩起拍,87轮出价后5.84万/㎡成交!5年前摇号时的“天选之子”,杭州一高端小区终于卖掉了第一套二手房

889万腰斩起拍,87轮出价后5.84万/㎡成交!5年前摇号时的“天选之子”,杭州一高端小区终于卖掉了第一套二手房

都市快报橙柿互动
2026-07-21 00:07:56
中美再突发重大事情,特朗普向中国传递信号,林剑:中方不感兴趣

中美再突发重大事情,特朗普向中国传递信号,林剑:中方不感兴趣

蜉蝣说
2026-07-21 10:47:59
天天锻炼不等于长寿,专家忠告:年过60,只适合三种运动方式

天天锻炼不等于长寿,专家忠告:年过60,只适合三种运动方式

华庭讲美食
2026-07-02 00:12:22
网传90后1.7亿人口多达1亿未婚,评论区炸锅…

网传90后1.7亿人口多达1亿未婚,评论区炸锅…

慧翔百科
2026-07-20 17:31:27
上千公里只停一站!京广高铁第一王牌列车,到底有多牛?

上千公里只停一站!京广高铁第一王牌列车,到底有多牛?

翱翔先驱者
2026-07-21 11:20:53
陈数首谈14年婚姻,盲目听从丈夫安排,身患重病后现状如何?

陈数首谈14年婚姻,盲目听从丈夫安排,身患重病后现状如何?

生命之泉的奥秘
2026-07-21 10:07:40
73岁港星遭弃养!一年半没洗澡肉烂见骨,老艺人有娃却在养老院等死

73岁港星遭弃养!一年半没洗澡肉烂见骨,老艺人有娃却在养老院等死

头号电影院
2026-07-21 13:38:48
婚外的男女,一旦发生关系过后,大部分都走不下去了

婚外的男女,一旦发生关系过后,大部分都走不下去了

叶飞飞情感屋
2026-07-21 15:08:29
31岁女博士被婆婆连砍12刀,丈夫签了谅解书,凶手2035年才到期

31岁女博士被婆婆连砍12刀,丈夫签了谅解书,凶手2035年才到期

法纪实录簿
2026-07-22 00:05:08
3.2亿灵活就业,意味着什么?

3.2亿灵活就业,意味着什么?

点评校尉
2026-06-14 21:13:41
美网公布单打正赛名单:王欣瑜、张帅、王曦雨直接入围,商竣程凭借保护排名进入正赛;郑钦文因止步雅典赛八强错失直接晋级美网正赛资格

美网公布单打正赛名单:王欣瑜、张帅、王曦雨直接入围,商竣程凭借保护排名进入正赛;郑钦文因止步雅典赛八强错失直接晋级美网正赛资格

鲁中晨报
2026-07-22 11:20:07
带火“前额叶育儿”,这位神经科学博士爸爸,让全网百万粉丝破防

带火“前额叶育儿”,这位神经科学博士爸爸,让全网百万粉丝破防

阅读第一
2026-07-16 08:35:25
新手妈妈在地铁上喂奶被指责不礼貌,大妈霸气反击,网友:真解气

新手妈妈在地铁上喂奶被指责不礼貌,大妈霸气反击,网友:真解气

大果小果妈妈
2026-07-19 21:12:52
江西“气功大师”王林:落网以后,情妇为救他,竟包养了办案民警

江西“气功大师”王林:落网以后,情妇为救他,竟包养了办案民警

独坐山巅前
2026-06-01 20:42:55
反复横跳,C罗取消了对“FIFA保送梅西”切片的点赞

反复横跳,C罗取消了对“FIFA保送梅西”切片的点赞

懂球帝
2026-07-22 09:35:07
上海炒股冠军罕见发声:换手率,一旦大于25%就是主力叫你进场!

上海炒股冠军罕见发声:换手率,一旦大于25%就是主力叫你进场!

股经纵横谈
2026-07-21 21:27:36
火箭次轮状元落选夏联二阵!美媒晒数据抱不平 队记:他在斯通蓝图之中

火箭次轮状元落选夏联二阵!美媒晒数据抱不平 队记:他在斯通蓝图之中

颜小白的篮球梦
2026-07-22 10:30:03
女儿男友让我家全款支持他读研,承诺学成就娶女儿,我提出3个要求后,他彻底消失不见

女儿男友让我家全款支持他读研,承诺学成就娶女儿,我提出3个要求后,他彻底消失不见

呆子的故事
2026-07-12 13:44:38
高铁惨遭烂尾,印度狠宰日本,中方重拳断供,日本产业面临停摆

高铁惨遭烂尾,印度狠宰日本,中方重拳断供,日本产业面临停摆

记得那片海辛
2026-07-22 07:22:32
俄媒警告:一旦冲突爆发,中国面临全面围攻,但最危险的不是战争

俄媒警告:一旦冲突爆发,中国面临全面围攻,但最危险的不是战争

瓦伦西亚月亮
2026-07-21 10:28:03
2026-07-22 14:44:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13575文章数 142698关注度
往期回顾 全部

科技要闻

怕了?美财长扬言:严查中国AI

头条要闻

媒体:特朗普若承认伊朗海峡管理权 会被喷"丧权辱国"

头条要闻

媒体:特朗普若承认伊朗海峡管理权 会被喷"丧权辱国"

体育要闻

“不会进球”的前锋,在世界杯决赛进球了

娱乐要闻

谢贤离世风波再起!王菲探望细节曝光

财经要闻

被误伤的A股:韧性、预期与底气

汽车要闻

WAIC专访|易启未来余志勇:网易孵化按摩机器人 能识穴会“手法”

态度原创

手机
时尚
旅游
游戏
公开课

手机要闻

机构看好苹果折叠屏 预测市场份额超越华为

整容、断骨、换血,欧美白男正扎堆服美役

旅游要闻

“禁团令”难阻赴陆热潮

给我整好的啊!《老滚5》被低质AI色情mod淹没

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版