网易首页 > 网易号 > 正文 申请入驻

大模型“推理”是推理吗 | 社会科学报

0
分享至



大语言模型已深度嵌入知识生产与日常交流,语言表达精湛,却常在基础数理与逻辑推演中出现偏差。实际上,大模型推理是统计驱动的模式匹配,与人类自上而下的规则化推理存在根本差异。唯有正视推理的多元形态,方能探寻人机优势互补、共思共生的智能新范式。

原文 :《大模型“推理”是推理吗》

作者 |中国科学院大学人文学院教授 张立英

图片 |网络

近年来,以大语言模型为代表的人工智能技术飞速发展,ChatGPT、DeepSeek、Claude等模型已深度嵌入人类的知识生产与日常交流之中。然而,这些模型一方面能写出流畅的文章、回答复杂的问题,另一方面却频频在简单的数学推理、符号计数、逻辑判断上“翻车”。这种“聪明又愚钝”的双面性,迫使我们从逻辑学的角度重新审视一个根本问题:大模型的“推理”究竟是不是推理?如果是,它与人类推理有何本质不同?我们又该如何提升其推理能力?


1

大模型“推理”:表象之下的模式匹配

要理解大模型的推理表现,首先要看清其本质。大模型技术主要由预训练、监督细调和强化学习三个板块组成。其中,预训练作为大模型的主体和特色所在,其核心机制是语元(token)关联度预测模型:通过海量文本训练,学习不同语元(字、词、标点等)之间在语境中共同出现的概率。当我们向大模型提问时,它并不是在“思考”或“推导”,而是在逐字预测“最(较)可能出现”的下一个语元。

这种机制决定了大模型的回答本质上是模式匹配,而非逻辑推导。它并不理解问题背后的数学概念、逻辑结构或语义关系,而是依赖训练数据中语元之间的统计规律。因此,当问题形式与训练数据中的样本高度相似时,它表现出色;一旦问题稍作修改,比如更换数字、添加无关信息,模型性能就可能断崖式下降。例如,在苹果公司发布的GSM-Symbolic测试中,仅仅改变题目中的数字,就导致大模型在数学推理任务中的准确率下降高达65%。这说明,大模型并未掌握数学运算背后的抽象规则,而是依赖对训练数据的表面记忆。


2

人类推理:自上而下的规则体系

与“自下而上”的大模型形成鲜明对比的是,人类的推理是“自上而下”的。我们不仅依赖具体的经验事实,更依赖抽象的逻辑规则、语义理解、缺省预设和自我评价机制。

人类在进行推理时,能够从具体实例中抽象出一般性规则(如传递性、交换律、结合律、分配律等),并通过替换机制将这些规则应用于新情境。我们还能识别和调用隐含的背景知识,比如“爱丽丝是女孩,因此她的姐妹不包括她自己”。更重要的是,人类具备对推理结果的自我检验能力:我们知道自己是否满足前提条件,能否得出必然结论,甚至承认“推不出”。这套复杂的内在工作机制,使得人类推理具有高度的灵活性、共识性和解释性。而大模型恰恰缺乏这些能力:它暂时没有抽象—替换机制,不预设共识,也没有自我评价机制。

3

大模型“推理”算不算推理?

如果我们严格按照传统逻辑学对“推理”的定义——从若干前提出发,依据一定规则得出结论的思维过程,那么大模型的行为似乎并不符合。它不依赖逻辑规则,不进行抽象,不涉及语义理解。然而,如果我们将“推理”理解为一种从输入到输出的信息转换过程,那么大模型的运作确实可被看作一种新型推理。它的“规则”不是经典逻辑的公理,而是语元关联度的统计规律;它的“前提”不是命题,而是海量的语料和上下文中的语元序列;它的“结论”则是通过概率最大化生成的语元串。

这种推理机制不同于人类,但它并非没有逻辑结构。中国科学技术大学陈小平教授提出的形式公理系统Lc,就精确刻画了大模型关联度预测的底层逻辑。Lc仅含一条推理规则(综合单调性),却拥有海量推理前提(语元关联度)。其关键特征包括:所有关联度取值在[0,1]区间;预测遵循比较原则;推理具有实例性和语境相关性,但不遵循传统的一般传递性。这一公理化工作表明,大模型推理虽然不同于经典逻辑系统,却具有自身统一的形式结构。


4

人类与大模型对立还是互补?

将人类推理与大模型推理并置比较,我们不难发现,两者各有所长,也各有所短。人类推理的特点在于擅长抽象、规则应用、语义理解、缺省推理和自我评价,但受限于计算能力、记忆容量和信息处理速度。而大模型推理的特点则在于擅长海量信息的统计关联、快速生成语言流畅的输出,但缺乏抽象能力、规则意识、共识预设和可靠性判断。

这种对比让人联想到人工智能史上的符号主义与联结主义之争。符号主义强调规则与形式逻辑,试图自上而下地构建智能;联结主义则依赖数据和统计,自下而上地涌现智能。长期以来,这两大范式被视为对立,但它们并非不可调和。一方面,以往人工智能的符号主义进路所使用的主要是演绎逻辑(如谓词逻辑)的规律,但人类推理中还包含了归纳、类比等非演绎推理。这意味着,也许不是符号主义的路径本身有问题,而是目前符号主义所使用的逻辑基底不够合适或不够充分。另一方面,以数据分析和统计方法为主导的联结主义,其原理虽仍有一定灰箱性,但这种方法的确在很多时候“行之有效”,具有一定参考作用。这两个进路,一个从内而外,一个从外而内,从不同角度出发,实际上是在共同推进对智能深层机制的探索。

在此基础上,也许我们应进一步思考如何找到两种方式的共同基底要素。人类推理中大量使用类比、归纳等非演绎推理,这些推理本身就包含了分类与比较等要素。而大模型的语元关联度预测,本质上也是在不断进行比较(比较不同语元的共现概率),而如何分类也正是当下人工智能领域专家攻坚的方向之一。这表明,分类和比较也许正是人类推理与大模型推理的共同底层机制。


5

大模型推理增强的可能路径

基于上述比较,我们可以提出三条增强大模型推理能力的路径。

一是还原分类认知架构。人类推理中的类比、举例、比喻等非演绎推理,都可以还原为“分类”与“比较”两个基本要素。大模型如果能在底层引入分类架构,则可能更好地促进应用海量数据资源,而不必依赖人类的语义体系,就可能更好地模拟这些推理形式。分类并不一定依赖科学概念,而是可以基于语元之间的统计聚类,在保持非概念化优势的同时,增强推理的结构性。

二是考虑引入自然逻辑的规则。自然逻辑是一种基于自然语言表层语法的推理系统,它不需要将语言翻译为谓词逻辑,而是直接在自然语言形式上运行单调性、保守性、对称性等推理规则。这种逻辑更贴合大模型的语言处理方式,有可能在不破坏其语元关联机制的前提下增强其推理能力。

三是增加外部评价机制。大模型缺乏自我评价能力,这是其“胡言乱语”的根源之一。我们可以在模型之外增加一套推理结果的评价标准,用于检验输出是否满足给定的逻辑约束。这套评价机制不必内嵌于模型,而是作为外部模块运行,类似于人类对推理结果进行“元逻辑”审视。


6

对人类推理的再思考

大模型的兴起,不仅挑战了我们对“什么是智能”的理解,也促使我们重新审视人类推理的独特性与局限性。人类推理并非完美无缺。我们在面对复杂统计信息时,容易受到认知偏误的影响;我们在进行抽象推理时,也常常依赖教育和社会共识的支撑。大模型的出现恰恰提示我们,人类推理中那些被视为“自然”的能力,至少有一部分是在长期文化、教育和实践中逐步建构出来的。因此,提升人类推理能力,同样是一个值得关注的议题。在大模型可以快速生成语言、模拟对话的时代,人类更需要掌握的是逻辑抽象能力、批判性思维、信息筛选与验证能力,以及对推理过程本身的元认知控制。

大语言模型的“推理”不同于人类,但它并非没有规律。它代表了一种自下而上的、基于统计关联的新型推理机制。与其简单否定它“不会推理”,不如认真思考:我们能否在人类推理与大模型推理之间搭建一座理解与互补的桥梁?这不仅是技术问题,更是逻辑学、认知科学与人工智能交叉的前沿课题。在未来的智能社会中,人类与机器的“共思”与“共生”或许正取决于我们能否真正理解:推理,不止一种方式。

文章为社会科学报“思想工坊”融媒体原创出品,原载于社会科学报第2004期第5版,未经允许禁止转载,文中内容仅代表作者观点,不代表本报立场。

本期责编:程鑫云


《社会科学报》2026年征订

点击下方图片网上订报↓↓↓



特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
主动投案,山东省烟台市委常委、副市长李金涛接受审查调查

主动投案,山东省烟台市委常委、副市长李金涛接受审查调查

新京报
2026-07-24 10:51:07
回顾谢贤生前的两次低头,曾欠1600万赌债,狄波拉深夜找赌王求助

回顾谢贤生前的两次低头,曾欠1600万赌债,狄波拉深夜找赌王求助

小椰的奶奶
2026-07-23 17:05:12
伤员被送医后,菲对华开第二枪,黄岩岛爆发新冲突,中方喷射水炮

伤员被送医后,菲对华开第二枪,黄岩岛爆发新冲突,中方喷射水炮

风信子的花
2026-07-24 05:11:26
骑士B计划曝光!签不到詹姆斯就追海佐尼亚:上赛季西班牙联赛MVP

骑士B计划曝光!签不到詹姆斯就追海佐尼亚:上赛季西班牙联赛MVP

罗说NBA
2026-07-24 07:31:40
顶级数学家有多么厉害多么离谱 看网友讲述我和他们真是云泥之别

顶级数学家有多么厉害多么离谱 看网友讲述我和他们真是云泥之别

侃神评故事
2026-06-17 14:45:10
中国女排战土耳其时间确定,输赢皆是大分,王梦洁发文盛赞队友

中国女排战土耳其时间确定,输赢皆是大分,王梦洁发文盛赞队友

历史缝隙里的猹
2026-07-24 00:08:08
1450万一台还要排队,B300凭什么…

1450万一台还要排队,B300凭什么…

至顶AI实验室
2026-07-21 21:45:03
《功夫女足》13天连冠被终结,追不上吴京,周星驰导演票房破百亿没戏了

《功夫女足》13天连冠被终结,追不上吴京,周星驰导演票房破百亿没戏了

靠谱电影君
2026-07-24 08:48:50
周星驰剧组的“霸王条款”,开饭哨响,导演也得靠边站

周星驰剧组的“霸王条款”,开饭哨响,导演也得靠边站

可乐谈情感
2026-07-24 06:51:16
德拉帕蒂是谁,为何俄罗斯军事博主对他出任乌军总司令愤怒?

德拉帕蒂是谁,为何俄罗斯军事博主对他出任乌军总司令愤怒?

山河路口
2026-07-22 12:33:55
长沙曾琦医生入职浙大四院,担任专科专家,引发争议!网友:曾医生也算是因祸得福,看中她的“知名度”

长沙曾琦医生入职浙大四院,担任专科专家,引发争议!网友:曾医生也算是因祸得福,看中她的“知名度”

火山詩话
2026-07-22 08:09:06
市长让我扫厕所,他不知道我是组织部下来暗访的,半年后他被逮捕

市长让我扫厕所,他不知道我是组织部下来暗访的,半年后他被逮捕

千秋文化
2026-07-23 19:14:33
重庆挡车吐沫姐社死!三项罪名坐实,全网呼吁警方严惩,恐要坐牢

重庆挡车吐沫姐社死!三项罪名坐实,全网呼吁警方严惩,恐要坐牢

萧祃记录风土人情
2026-07-23 13:47:47
润人丁一多的白日梦:十几年后,当我作为议员访问中国,看到破产的中国人求我施舍

润人丁一多的白日梦:十几年后,当我作为议员访问中国,看到破产的中国人求我施舍

怪味历史连连看
2026-07-17 21:49:27
建国后外逃级别最高的贪官!至今未落网,23年来逃跑方式仍是谜

建国后外逃级别最高的贪官!至今未落网,23年来逃跑方式仍是谜

铁血江湖人
2026-04-23 22:21:26
中美闭门密会,鲁比奥突然变了个人,不再无脑反华,记者全被请走

中美闭门密会,鲁比奥突然变了个人,不再无脑反华,记者全被请走

论事的老枢
2026-07-24 03:37:58
未来十年足坛四王出炉!亚马尔19岁夺冠,第五人会是谁?

未来十年足坛四王出炉!亚马尔19岁夺冠,第五人会是谁?

涵有话说
2026-07-23 10:46:51
谢贤御用医生公开生前居家照 摘掉墨镜眼神浑浊 一年前已认不得人

谢贤御用医生公开生前居家照 摘掉墨镜眼神浑浊 一年前已认不得人

小椰的奶奶
2026-07-23 18:10:08
官宣定局!7月22日人社发布会完整结果,2026养老金真相大白

官宣定局!7月22日人社发布会完整结果,2026养老金真相大白

普陀动物世界
2026-07-24 00:47:13
1937年陈独秀刑满出狱后想要奔赴延安携手抗日,中央得知此事,毛泽东与张闻天磋商,应允接纳并定下三条要求

1937年陈独秀刑满出狱后想要奔赴延安携手抗日,中央得知此事,毛泽东与张闻天磋商,应允接纳并定下三条要求

磊子讲史
2026-07-22 14:14:19
2026-07-24 14:00:49
社会科学报 incentive-icons
社会科学报
社会科学院主办社会科学报
4342文章数 23472关注度
往期回顾 全部

科技要闻

中国等了90年,王虹邓煜同时摘下菲尔兹奖

头条要闻

39岁女子在杭州跑网约车 找相亲机构要求对方年薪百万

头条要闻

39岁女子在杭州跑网约车 找相亲机构要求对方年薪百万

体育要闻

小布泽:越看越不像他爸爸

娱乐要闻

陈妍希姐姐到场追星张凌赫

财经要闻

美国对数十个国家加征10%-12.5%的关税

汽车要闻

满配华为乾崑六件套 东风奕派M8限时权益价16.58万起

态度原创

艺术
手机
本地
房产
公开课

艺术要闻

被建筑学“劝退”的王虹,拿了数学界诺贝尔奖!

手机要闻

iQOO 15 mini手机被砍,原因可能与小屏性能机市场认可度不够有关

本地新闻

跟着影视去旅行:西游篇

房产要闻

狂抢111轮,溢价39%,楼面价刺破9500!海口土拍杀疯了!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版