网易首页 > 网易号 > 正文 申请入驻

涌现观点|GPT们为何“想太少”?DeepSeek们又为何“想太多”?一份来自AI大脑深处的诊断报告

0
分享至

一个“想太多”,一个“想太少”。我们过去只能将AI模型的不同行为归结为“脾气”,但现在,一把来自顶尖研究的“手术刀”,让我们首次能像诊断“认知病”一样,解剖它们思考方式的根本缺陷。
两大AI巨头的“认知病”:我们用一张“思维地图”,首次诊断出它们的思考缺陷

你一定遇到过这两种让你既熟悉又无奈的AI。

第一个瞬间,你可能只是想让AI帮你算一个简单的数学题,比如:“一个泳池长50米,宽25米,深2米,注满水需要多少立方米的水?”

你期待一个数字,但你得到的是一篇小论文。那个被称为“话痨学究”的AI,比如DeepSeek-R1系列[1]或Claude 3,不仅给出了“2500立方米”的答案,还详细地为你复习了一遍长方体体积公式V=l*w*h,严谨地探讨了单位换算的重要性,甚至热情地要帮你计算水的密度和质量。

你一边盯着屏幕,一边忍不住内心独白:“兄弟,我上过小学……我只想知道答案而已…你是不是想太多了?”

第二个瞬间,你可能正向另一个以速度著称的AI(比如OpenAI的o1系列)抛出一个稍微复杂的逻辑题:“我有红、黄、蓝三个盒子,只有一个盒子里有奖品。提示1:奖品不在红盒子里。提示2:奖品在黄盒子或蓝盒子里。提示3是假话:奖品在黄盒子里。请问奖品在哪里?”

它几乎在瞬间给出了答案:“在蓝盒子里。”你惊叹于它的速度,但当你追问它的推理步骤时,却发现它可能完全混淆了“提示3是假话”这个最关键的逻辑,只是简单地做了个排除法。

这时,你的内心独白又来了:“这么快?但你真的想明白了吗?万一我信了你,结果错了怎么办?”

这种无奈与怀疑,几乎是每个深度AI用户的日常。一个“想太多”,一个“想太少”。我们过去只能将这些行为归结为不同公司的“模型脾气”或是难以捉摸的“个性”。我们一直凭感觉猜测,却无法深入探究其背后的原因。

但现在,情况变了。

这些看似相反的“毛病”——“过度思考 (Overthinking)”“欠思考 (Underthinking)”——并非随机的,而是一种更深层次的、由模型内部结构决定的系统性“认知偏差”。我们敢于做出诊断的底气,来自一把刚刚被递到手中的“手术刀”。

一把“手术刀”:如何科学解剖AI的思考过程?

如果说AI的思考过程是一场迷雾中的神秘旅行,那么东京大学与Google DeepMind在2025年6月发表的一篇名为《推理的拓扑学》[2]的重磅论文,就是我们第一次拿到的GPS轨迹图。

这项研究开创性地提出了一个名为“推理图” (Reasoning Graph)的概念,让我们第一次能“看见”AI的思考路径。

这把“手术刀”用起来其实不难理解:

  • 思维节点 (Node):AI在解决问题时,其庞大的神经网络会形成不同的“想法”或“计算状态”。研究人员用算法将这些状态聚类,每一个聚类中心,就代表一个具体的“思维节点”,比如“正在做加法”、“正在识别关键词”或“正在进行逻辑判断”。

  • 思维路径 (Edge):AI的思考从一个“想法”跳到下一个“想法”,就在这些节点之间连成了一条线。把所有这些线连起来,就构成了一张独一无二的“思维地图”。

Illustration of reasoning graphs

这张图的形状,或者说“拓扑结构”,泄露了AI思考方式的秘密。通过观察这张图,研究人员发现,聪明的推理模型与普通模型相比,在思考方式上存在着肉眼可见的差异。

上图:基础模型的推理路径(上排)与增强推理模型(下排)的对比。来源:Topology of Reasoning[3]

就像给大脑做一次CT扫描,我们现在有了三个关键的诊断指标,来量化AI的思维品质:

有了这套诊断工具,我们终于可以从一个只能抱怨AI“脾气怪”的用户,变成一个能分析其“病理”的诊断师。现在,让我们正式出具诊断报告。

诊断报告:两大“病症”首次被清晰归因诊断报告一:“过度思考”——源自一种对确定性的偏执

  • 病症名称:认知洁癖型过思症 (Cognitive-Perfectionism Overthinking)——这是一种为了追求绝对正确,而不惜一切计算代价的思维模式。

  • 典型模型:DeepSeek-R1系列,部分场景下的Claude 3 Opus等

当你抱怨一个模型太“啰嗦”时,你实际上是在观察一种对确定性的极致追求。它的“病理”根源,正是其推理图谱中过多、过密的“循环”异常大的“图直径”

《推理的拓扑学》论文用冰冷的数据证实了这一点:尤其是在处理像AIME 2024这类顶级数学竞赛难题时,像DeepSeek-R1这样经过推理能力强化的模型,其推理图中包含的循环数量平均是基础模型的5倍,其思维探索的广度(图直径)也显著更大。

这就像一个极度谨慎、有“洁癖”的学霸。为了确保答案100%正确,他会反复检查自己的每一步推导,探索每一个可能的陷阱,即便面对的是一道“1+1”级别的简单问题。这种思考方式保证了极高的可靠性,但代价是牺牲了巨大的效率。真实世界用户的反馈也印证了这一点,在Reddit社区的讨论[4]中,用户普遍认为R1模型“在思考阶段花费更多时间”,导致响应延迟,甚至有评测[5]直接指出了其“冗长输出”的问题。

但“循环”并非总是好事。当它变成无意义的空转时,就从“谨慎”滑向了“病态”。论文就发现,14B参数版本的模型在推理中出现了“语言混淆”的现象——在不同语言之间来回切换。这表明,过多的、无效的循环,已经成为了一种需要被“治疗”的真正缺陷。

诊断报告二:“欠思考”——效率陷阱下的思维捷径

  • 病症名称:启发式捷径依赖症 (Heuristic-Shortcut Underthinking)——这是一种为了追求极致的响应速度,而倾向于采用思维捷径的模式。

  • 典型模型:o1-mini及部分追求极致响应速度的模型

与“过度思考”相对的,是“欠思考”。当你觉得一个AI“反应快但不过脑子”时,你可能正在与一个“启发式捷径依赖症”患者打交道。

需要明确的是,原论文并未直接对o1模型进行“推理图”分析。但基于海量的公开报告和我们的用户体验,我们可以构建一个合理的“反向诊断”:o1系列模型的推理图,很可能呈现出一种“线性、短直径、少循环”的特征。

这背后的诊断逻辑是清晰的。一篇名为《Thoughts Are All Over the Place: On the Underthinking of o1-Like LLMs》[6]的学术研究,直接将矛头指向了这种现象,指出o1这类模型倾向于在不同的推理思路间频繁切换,而没有充分探索真正有希望的路径。

这种“思维捷径”在第三方独立评测中暴露无遗。在一个名为SimpleBench的常识推理测试中——这个测试专门用于评估模型是否具备人类的基本常识——人类的平均成功率是83.7%,而o1-preview的得分仅有惨淡的41.7%。正如一篇GeekWire的分析文章[7]所言,这一巨大差距表明其在类人常识推理方面存在根本性缺陷。在广为流传的“弹珠包谜题”[8]中,o1也因无法正确处理语言逻辑而给出错误答案。

这就像一个极其依赖直觉(启发式)的“快枪手”。他追求用最快的速度给出那个“看上去很美”的答案。这背后,正是其“效率优先”的设计哲学。正如OpenAI官方所强调的[9],o1的设计理念是“花更多时间思考”,但这种“慢思考”似乎更多地体现在了计算时间的延长上,而非思维深度的拓展上。在面对需要审视和修正的复杂逻辑时,它为了效率而牺牲了可靠性,最终陷入了“欠思考”的陷阱。

归根结底,我们诊断的并非AI的bug,而是它被赋予的“世界观”——是选择不计成本的绝对严谨,还是效率至上的快速迭代。

从“诊断”到“治疗”:这不只是问题,更是通往下一代AI的路线图

揭示病因的目的,是为了治愈。幸运的是,“推理图”这把手术刀不仅能做诊断,还能指导“靶向治疗”。AI训练,正在从过去的“大水漫灌”,走向未来的“精准调理”。

《推理的拓扑学》论文就进行了一次漂亮的“临床试验”。研究人员用一个名为“s1”的高质量微调数据集,对一个基础模型进行“靶向治疗”。结果显示,经过训练,模型的推理图直径被显著“拉长”了,这直接证明了高质量的数据可以有效“治疗”欠思考,提升模型的思维探索能力。

方法

效果

含义

SFT with s1 Dataset增大图直径定向提升思维探索广度Reinforcement Learning (RLHF)优化奖励过程鼓励更优的思维结构High-Quality Datasets (LIMO)激活已有能力用少量“认知模板”唤醒推理潜能
上表:几种提升AI推理能力的“治疗方案”

这只是一个开始。放眼整个行业,更前沿的“治疗方案”正在涌现。研究者们正在探索通过强化学习(如DPO[10]或过程监督[11])来奖励那些具有更优“思维结构”的模型。同时,以LIMO数据集[12]为代表的新一代训练数据,秉持着“少即是多”的理念,用几百个精心设计的“认知模板”就能激活模型深层的推理能力。这些都预示着,未来我们可以像配药一样,精准地塑造AI的思考方式。

那么,在“完美AI”诞生之前,我们这些用户该怎么办?

答案是:成为一个善用“偏科”AI的高手。

理解了这些模型的“认知偏差”,我们就能扬长避短,把它们用到最合适的地方。一份来自专业写作者的用户研究[13]就显示,他们会根据不同的创作阶段选择不同的AI工具。而针对程序员的调研[14]也表明,开发者们正在开发复杂的工作流,将不同模型的优势整合起来。

我们可以借鉴这种智慧,形成自己的“AI使用手册”:

  • 当你需要【严谨与可靠】时,比如写代码、做科学计算、审阅法律合同,请毫不犹豫地选择那些“过度思考”的AI。把它当成你最不知疲倦、甚至有点强迫症的专业助理。

  • 当你需要【效率与灵感】时,比如进行头脑风暴、构思营销文案、寻找创意突破,不妨试试那些“欠思考”的AI。它那看似不靠谱的思维跳跃,有时反而能给你带来意想不到的惊喜(Serendipity)。

结语:我们正在成为AI的“认知神经科学家”

这项来自东京大学和DeepMind的研究,其真正的价值,远不止于诊断了几个模型的“毛病”。它给了我们一个全新的“镜头”和一套科学的“语言”,让我们得以谈论、度量和干预AI的“思维品质”。

“推理图”让我们从AI的“驯兽师”,第一次有机会成为它的“脑科医生”。

我们正处在一个历史性的转折点。正如AI教父Geoffrey Hinton和Yoshua Bengio所强调的[15],AI领域正在从纯粹追求性能的“黑箱”工程,转向深入理解其内部机制的科学探索。有研究者将这个新领域称为“机制化可解释性”或“AI神经科学”[16]。

这个转变的意义是深远的。我们正在从一个只能在外部观察AI行为的“心理学家”,逐步转变为一个能够探究其内部心智结构的“神经科学家”。

今天我们诊断AI的“认知病”,正是为了明天能创造出更健康、更强大、也更值得我们信赖的超级智能。而我们每一个人,都是这场伟大变革的见证者和参与者。

那么,在你日常的使用中,你更偏爱“过度思考”的严谨,还是“欠思考”的效率?你还观察到AI有哪些有趣的“认知偏差”?

欢迎在评论区分享你的洞察。

参考资料

DeepSeek-R1系列: https://huggingface.co/deepseek-ai/deepseek-coder-6.7b-instruct

《推理的拓扑学》: https://arxiv.org/abs/2506.05744v2

Topology of Reasoning: https://arxiv.org/abs/2506.05744v2

Reddit社区的讨论: https://www.reddit.com/r/LocalLLaMA/comments/1i8rujw/notes_on_deepseek_r1_just_how_good_it_is_compared/

[5]

评测: https://blog.promptlayer.com/openai-vs-deepseek-an-analysis-of-r1-and-o1-models/

[6]

《Thoughts Are All Over the Place: On the Underthinking of o1-Like LLMs》: https://arxiv.org/pdf/2501.18585.pdf

[7]

GeekWire的分析文章: https://www.geekwire.com/2024/buyer-beware-openais-o1-large-language-model-is-an-entirely-different-beast/

[8]

“弹珠包谜题”: https://www.ccn.com/news/technology/openai-o1-complex-reasoning/

[9]

OpenAI官方所强调的: https://openai.com/index/introducing-openai-o1-preview/

[10]

DPO: https://www.superannotate.com/blog/direct-preference-optimization-dpo

[11]

过程监督: https://arxiv.org/abs/2410.09671

[12]

LIMO数据集: http://arxiv.org/pdf/2502.03387.pdf

[13]

专业写作者的用户研究: https://arxiv.org/html/2310.12953v3

[14]

针对程序员的调研: https://arxiv.org/pdf/2312.15223.pdf

[15]

Geoffrey Hinton和Yoshua Bengio所强调的: https://www.youtube.com/watch?v=G5c4CqmlEWs

[16]

“机制化可解释性”或“AI神经科学”: https://arxiv.org/html/2501.16496v1

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
夏朝考古彻底陷悖论!石峁DNA结果颠覆认知,郭德纲相声梗成真了

夏朝考古彻底陷悖论!石峁DNA结果颠覆认知,郭德纲相声梗成真了

小豫讲故事
2026-08-15 06:00:19
为什么你随手挂断的陌生来电,反而成了诈骗的入场券?

为什么你随手挂断的陌生来电,反而成了诈骗的入场券?

笔墨V
2026-08-17 10:37:40
藏了19年!那英女儿金发亮相演唱会,紧挨宋丹丹气质绝了

藏了19年!那英女儿金发亮相演唱会,紧挨宋丹丹气质绝了

陈意小可爱
2026-08-24 00:55:45
王毅离韩当天,朝鲜连发10枚导弹示威,想见金正恩的特朗普该懂了

王毅离韩当天,朝鲜连发10枚导弹示威,想见金正恩的特朗普该懂了

谛听骨语本尊
2026-08-23 21:45:35
亚运博物馆撤下王楚钦夺冠照,换成亚军樊振东照片,官方回应来了

亚运博物馆撤下王楚钦夺冠照,换成亚军樊振东照片,官方回应来了

风过乡
2026-08-23 09:29:53
刚到手的房子竟发霉发臭!一家五口绷不住了

刚到手的房子竟发霉发臭!一家五口绷不住了

看看新闻Knews
2026-08-23 19:38:06
半年净赚超千亿!销量是比亚迪的近3倍,“日系神车”闷声发大财

半年净赚超千亿!销量是比亚迪的近3倍,“日系神车”闷声发大财

你在偷看谁
2026-08-18 20:49:05
业内称预冷保鲜成本比甲醛白菜高十倍,甲醛厂家:用在圈舍消毒

业内称预冷保鲜成本比甲醛白菜高十倍,甲醛厂家:用在圈舍消毒

福建第一帮帮团
2026-08-23 18:07:14
2021年陕西女子给外甥补课,不料引狼入室,停电后外甥果断出手

2021年陕西女子给外甥补课,不料引狼入室,停电后外甥果断出手

纪实文录
2025-02-28 16:24:01
「他」接住染毒刘亚仁!宣布签约新东家 公司承诺:陪他重新开始

「他」接住染毒刘亚仁!宣布签约新东家 公司承诺:陪他重新开始

ETtoday星光云
2026-08-24 11:27:04
谷建芬也没料到,郭兰英离世仅1天,蔡国庆竟因一个行为口碑暴涨

谷建芬也没料到,郭兰英离世仅1天,蔡国庆竟因一个行为口碑暴涨

乡野小珥
2026-08-24 00:04:17
史上最强升级!iPad mini 8最快10月发布:首次OLED屏+A20 Pro

史上最强升级!iPad mini 8最快10月发布:首次OLED屏+A20 Pro

快科技
2026-08-21 16:15:22
泽连斯基承认:欺骗了特朗普

泽连斯基承认:欺骗了特朗普

上观新闻
2026-08-24 12:17:27
余文乐宣布离婚

余文乐宣布离婚

扬子晚报
2026-07-20 14:21:04
开国上将家中逝世, 死后无人吊唁,老战友:我们没有收到任何消息

开国上将家中逝世, 死后无人吊唁,老战友:我们没有收到任何消息

大运河时空
2026-08-23 17:15:04
宇宙中心龙华,房价为什么回不去了?

宇宙中心龙华,房价为什么回不去了?

爱看剧的阿峰
2026-08-23 03:06:50
李书福卸任前炮轰某些车企:不懂装懂,后患无穷

李书福卸任前炮轰某些车企:不懂装懂,后患无穷

财通社
2026-08-22 15:28:32
为什么马雷斯卡会把格伊放在后腰的位置,他战术上调整的目的是什么?

为什么马雷斯卡会把格伊放在后腰的位置,他战术上调整的目的是什么?

隐于山海
2026-08-24 10:56:10
丁俊晖输球没关系,可怕是中国龙的赛后发言,他已经没有心气了

丁俊晖输球没关系,可怕是中国龙的赛后发言,他已经没有心气了

南海浪花
2026-08-24 00:47:46
大家发现没,王楚钦越来越不对劲,不是球技断崖下滑,也不是长相变化,而是精气神肉眼可见地被透支

大家发现没,王楚钦越来越不对劲,不是球技断崖下滑,也不是长相变化,而是精气神肉眼可见地被透支

乒乓助手
2026-08-21 00:37:44
2026-08-24 12:55:00
人工智能学家 incentive-icons
人工智能学家
人工智能领域权威媒体
4997文章数 37516关注度
往期回顾 全部

科技要闻

“捂脸跑”机器人火出圈,它自己想出来的

头条要闻

牛弹琴:日理万机的特朗普久久不能入睡 凌晨1点发飙

头条要闻

牛弹琴:日理万机的特朗普久久不能入睡 凌晨1点发飙

体育要闻

42张照片 珍藏世界杯的热辣滚烫

娱乐要闻

张韶涵演唱会突发不适,本人发文道歉

财经要闻

泡泡玛特,最大的问题才刚显现

汽车要闻

智能超混 国民家轿 上汽大众ID. ERA 5S上市 限时8.99万元起

态度原创

房产
亲子
健康
教育
军事航空

房产要闻

两大热盘即将入市!三亚又一批安居房狠货要炸场了!

亲子要闻

四十多万幼师含泪离场:比失业更狠的,是全社会的偏见。

孩子有脊柱侧弯,还能正常运动吗?

教育要闻

把孩子时间精确安排到分钟,我亲手养出了一个“空心孩子”

军事要闻

美国与以色列发生“罕见冲突”

无障碍浏览 进入关怀版