一个“想太多”,一个“想太少”。我们过去只能将AI模型的不同行为归结为“脾气”,但现在,一把来自顶尖研究的“手术刀”,让我们首次能像诊断“认知病”一样,解剖它们思考方式的根本缺陷。两大AI巨头的“认知病”:我们用一张“思维地图”,首次诊断出它们的思考缺陷
你一定遇到过这两种让你既熟悉又无奈的AI。
第一个瞬间,你可能只是想让AI帮你算一个简单的数学题,比如:“一个泳池长50米,宽25米,深2米,注满水需要多少立方米的水?”
你期待一个数字,但你得到的是一篇小论文。那个被称为“话痨学究”的AI,比如DeepSeek-R1系列[1]或Claude 3,不仅给出了“2500立方米”的答案,还详细地为你复习了一遍长方体体积公式V=l*w*h,严谨地探讨了单位换算的重要性,甚至热情地要帮你计算水的密度和质量。
你一边盯着屏幕,一边忍不住内心独白:“兄弟,我上过小学……我只想知道答案而已…你是不是想太多了?”
第二个瞬间,你可能正向另一个以速度著称的AI(比如OpenAI的o1系列)抛出一个稍微复杂的逻辑题:“我有红、黄、蓝三个盒子,只有一个盒子里有奖品。提示1:奖品不在红盒子里。提示2:奖品在黄盒子或蓝盒子里。提示3是假话:奖品在黄盒子里。请问奖品在哪里?”
它几乎在瞬间给出了答案:“在蓝盒子里。”你惊叹于它的速度,但当你追问它的推理步骤时,却发现它可能完全混淆了“提示3是假话”这个最关键的逻辑,只是简单地做了个排除法。
这时,你的内心独白又来了:“这么快?但你真的想明白了吗?万一我信了你,结果错了怎么办?”
这种无奈与怀疑,几乎是每个深度AI用户的日常。一个“想太多”,一个“想太少”。我们过去只能将这些行为归结为不同公司的“模型脾气”或是难以捉摸的“个性”。我们一直凭感觉猜测,却无法深入探究其背后的原因。
但现在,情况变了。
这些看似相反的“毛病”——“过度思考 (Overthinking)”和“欠思考 (Underthinking)”——并非随机的,而是一种更深层次的、由模型内部结构决定的系统性“认知偏差”。我们敢于做出诊断的底气,来自一把刚刚被递到手中的“手术刀”。
一把“手术刀”:如何科学解剖AI的思考过程?
如果说AI的思考过程是一场迷雾中的神秘旅行,那么东京大学与Google DeepMind在2025年6月发表的一篇名为《推理的拓扑学》[2]的重磅论文,就是我们第一次拿到的GPS轨迹图。
这项研究开创性地提出了一个名为“推理图” (Reasoning Graph)的概念,让我们第一次能“看见”AI的思考路径。
这把“手术刀”用起来其实不难理解:
思维节点 (Node):AI在解决问题时,其庞大的神经网络会形成不同的“想法”或“计算状态”。研究人员用算法将这些状态聚类,每一个聚类中心,就代表一个具体的“思维节点”,比如“正在做加法”、“正在识别关键词”或“正在进行逻辑判断”。
思维路径 (Edge):AI的思考从一个“想法”跳到下一个“想法”,就在这些节点之间连成了一条线。把所有这些线连起来,就构成了一张独一无二的“思维地图”。
这张图的形状,或者说“拓扑结构”,泄露了AI思考方式的秘密。通过观察这张图,研究人员发现,聪明的推理模型与普通模型相比,在思考方式上存在着肉眼可见的差异。
上图:基础模型的推理路径(上排)与增强推理模型(下排)的对比。来源:Topology of Reasoning[3]
就像给大脑做一次CT扫描,我们现在有了三个关键的诊断指标,来量化AI的思维品质:
有了这套诊断工具,我们终于可以从一个只能抱怨AI“脾气怪”的用户,变成一个能分析其“病理”的诊断师。现在,让我们正式出具诊断报告。
诊断报告:两大“病症”首次被清晰归因诊断报告一:“过度思考”——源自一种对确定性的偏执
病症名称:认知洁癖型过思症 (Cognitive-Perfectionism Overthinking)——这是一种为了追求绝对正确,而不惜一切计算代价的思维模式。
典型模型:DeepSeek-R1系列,部分场景下的Claude 3 Opus等
当你抱怨一个模型太“啰嗦”时,你实际上是在观察一种对确定性的极致追求。它的“病理”根源,正是其推理图谱中过多、过密的“循环”和异常大的“图直径”。
《推理的拓扑学》论文用冰冷的数据证实了这一点:尤其是在处理像AIME 2024这类顶级数学竞赛难题时,像DeepSeek-R1这样经过推理能力强化的模型,其推理图中包含的循环数量平均是基础模型的5倍,其思维探索的广度(图直径)也显著更大。
这就像一个极度谨慎、有“洁癖”的学霸。为了确保答案100%正确,他会反复检查自己的每一步推导,探索每一个可能的陷阱,即便面对的是一道“1+1”级别的简单问题。这种思考方式保证了极高的可靠性,但代价是牺牲了巨大的效率。真实世界用户的反馈也印证了这一点,在Reddit社区的讨论[4]中,用户普遍认为R1模型“在思考阶段花费更多时间”,导致响应延迟,甚至有评测[5]直接指出了其“冗长输出”的问题。
但“循环”并非总是好事。当它变成无意义的空转时,就从“谨慎”滑向了“病态”。论文就发现,14B参数版本的模型在推理中出现了“语言混淆”的现象——在不同语言之间来回切换。这表明,过多的、无效的循环,已经成为了一种需要被“治疗”的真正缺陷。
诊断报告二:“欠思考”——效率陷阱下的思维捷径
病症名称:启发式捷径依赖症 (Heuristic-Shortcut Underthinking)——这是一种为了追求极致的响应速度,而倾向于采用思维捷径的模式。
典型模型:o1-mini及部分追求极致响应速度的模型
与“过度思考”相对的,是“欠思考”。当你觉得一个AI“反应快但不过脑子”时,你可能正在与一个“启发式捷径依赖症”患者打交道。
需要明确的是,原论文并未直接对o1模型进行“推理图”分析。但基于海量的公开报告和我们的用户体验,我们可以构建一个合理的“反向诊断”:o1系列模型的推理图,很可能呈现出一种“线性、短直径、少循环”的特征。
这背后的诊断逻辑是清晰的。一篇名为《Thoughts Are All Over the Place: On the Underthinking of o1-Like LLMs》[6]的学术研究,直接将矛头指向了这种现象,指出o1这类模型倾向于在不同的推理思路间频繁切换,而没有充分探索真正有希望的路径。
这种“思维捷径”在第三方独立评测中暴露无遗。在一个名为SimpleBench的常识推理测试中——这个测试专门用于评估模型是否具备人类的基本常识——人类的平均成功率是83.7%,而o1-preview的得分仅有惨淡的41.7%。正如一篇GeekWire的分析文章[7]所言,这一巨大差距表明其在类人常识推理方面存在根本性缺陷。在广为流传的“弹珠包谜题”[8]中,o1也因无法正确处理语言逻辑而给出错误答案。
这就像一个极其依赖直觉(启发式)的“快枪手”。他追求用最快的速度给出那个“看上去很美”的答案。这背后,正是其“效率优先”的设计哲学。正如OpenAI官方所强调的[9],o1的设计理念是“花更多时间思考”,但这种“慢思考”似乎更多地体现在了计算时间的延长上,而非思维深度的拓展上。在面对需要审视和修正的复杂逻辑时,它为了效率而牺牲了可靠性,最终陷入了“欠思考”的陷阱。
归根结底,我们诊断的并非AI的bug,而是它被赋予的“世界观”——是选择不计成本的绝对严谨,还是效率至上的快速迭代。
从“诊断”到“治疗”:这不只是问题,更是通往下一代AI的路线图
揭示病因的目的,是为了治愈。幸运的是,“推理图”这把手术刀不仅能做诊断,还能指导“靶向治疗”。AI训练,正在从过去的“大水漫灌”,走向未来的“精准调理”。
《推理的拓扑学》论文就进行了一次漂亮的“临床试验”。研究人员用一个名为“s1”的高质量微调数据集,对一个基础模型进行“靶向治疗”。结果显示,经过训练,模型的推理图直径被显著“拉长”了,这直接证明了高质量的数据可以有效“治疗”欠思考,提升模型的思维探索能力。
方法
效果
含义
SFT with s1 Dataset增大图直径定向提升思维探索广度Reinforcement Learning (RLHF)优化奖励过程鼓励更优的思维结构High-Quality Datasets (LIMO)激活已有能力用少量“认知模板”唤醒推理潜能
上表:几种提升AI推理能力的“治疗方案”
这只是一个开始。放眼整个行业,更前沿的“治疗方案”正在涌现。研究者们正在探索通过强化学习(如DPO[10]或过程监督[11])来奖励那些具有更优“思维结构”的模型。同时,以LIMO数据集[12]为代表的新一代训练数据,秉持着“少即是多”的理念,用几百个精心设计的“认知模板”就能激活模型深层的推理能力。这些都预示着,未来我们可以像配药一样,精准地塑造AI的思考方式。
那么,在“完美AI”诞生之前,我们这些用户该怎么办?
答案是:成为一个善用“偏科”AI的高手。
理解了这些模型的“认知偏差”,我们就能扬长避短,把它们用到最合适的地方。一份来自专业写作者的用户研究[13]就显示,他们会根据不同的创作阶段选择不同的AI工具。而针对程序员的调研[14]也表明,开发者们正在开发复杂的工作流,将不同模型的优势整合起来。
我们可以借鉴这种智慧,形成自己的“AI使用手册”:
当你需要【严谨与可靠】时,比如写代码、做科学计算、审阅法律合同,请毫不犹豫地选择那些“过度思考”的AI。把它当成你最不知疲倦、甚至有点强迫症的专业助理。
当你需要【效率与灵感】时,比如进行头脑风暴、构思营销文案、寻找创意突破,不妨试试那些“欠思考”的AI。它那看似不靠谱的思维跳跃,有时反而能给你带来意想不到的惊喜(Serendipity)。
这项来自东京大学和DeepMind的研究,其真正的价值,远不止于诊断了几个模型的“毛病”。它给了我们一个全新的“镜头”和一套科学的“语言”,让我们得以谈论、度量和干预AI的“思维品质”。
“推理图”让我们从AI的“驯兽师”,第一次有机会成为它的“脑科医生”。
我们正处在一个历史性的转折点。正如AI教父Geoffrey Hinton和Yoshua Bengio所强调的[15],AI领域正在从纯粹追求性能的“黑箱”工程,转向深入理解其内部机制的科学探索。有研究者将这个新领域称为“机制化可解释性”或“AI神经科学”[16]。
这个转变的意义是深远的。我们正在从一个只能在外部观察AI行为的“心理学家”,逐步转变为一个能够探究其内部心智结构的“神经科学家”。
今天我们诊断AI的“认知病”,正是为了明天能创造出更健康、更强大、也更值得我们信赖的超级智能。而我们每一个人,都是这场伟大变革的见证者和参与者。
那么,在你日常的使用中,你更偏爱“过度思考”的严谨,还是“欠思考”的效率?你还观察到AI有哪些有趣的“认知偏差”?
欢迎在评论区分享你的洞察。
参考资料
DeepSeek-R1系列: https://huggingface.co/deepseek-ai/deepseek-coder-6.7b-instruct
《推理的拓扑学》: https://arxiv.org/abs/2506.05744v2
Topology of Reasoning: https://arxiv.org/abs/2506.05744v2
Reddit社区的讨论: https://www.reddit.com/r/LocalLLaMA/comments/1i8rujw/notes_on_deepseek_r1_just_how_good_it_is_compared/
[5]
评测: https://blog.promptlayer.com/openai-vs-deepseek-an-analysis-of-r1-and-o1-models/
[6]
《Thoughts Are All Over the Place: On the Underthinking of o1-Like LLMs》: https://arxiv.org/pdf/2501.18585.pdf
[7]
GeekWire的分析文章: https://www.geekwire.com/2024/buyer-beware-openais-o1-large-language-model-is-an-entirely-different-beast/
[8]
“弹珠包谜题”: https://www.ccn.com/news/technology/openai-o1-complex-reasoning/
[9]
OpenAI官方所强调的: https://openai.com/index/introducing-openai-o1-preview/
[10]
DPO: https://www.superannotate.com/blog/direct-preference-optimization-dpo
[11]
过程监督: https://arxiv.org/abs/2410.09671
[12]
LIMO数据集: http://arxiv.org/pdf/2502.03387.pdf
[13]
专业写作者的用户研究: https://arxiv.org/html/2310.12953v3
[14]
针对程序员的调研: https://arxiv.org/pdf/2312.15223.pdf
[15]
Geoffrey Hinton和Yoshua Bengio所强调的: https://www.youtube.com/watch?v=G5c4CqmlEWs
[16]
“机制化可解释性”或“AI神经科学”: https://arxiv.org/html/2501.16496v1
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.