网易首页 > 网易号 > 正文 申请入驻

AI 总一本正经的胡说八道:幻觉难根除,但能这样破解

0
分享至

#5月·每日幸运签#

你有没有遇到过这样的场景:掏出手机问AI一个严肃问题,它给你一大段逻辑通顺、语气专业的回复,你差点就信了。但多留了个心眼,自己去核实了一下,发现它居然把所有数据都编错了,甚至连引用的“权威文献”都是凭空捏造的。

这不是AI在跟你开玩笑,而是AI领域一个让科学家头疼了很久的问题——AI幻觉。说得简单点,就是AI在编故事,而且编得极其自信、极其流畅,让你很难第一眼识破。

2025年秋天,有一篇论文在圈子里炸开了锅。论文来自OpenAI和佐治亚理工学院的研究团队,他们给出了一个颠覆性的结论:就算给AI的训练数据全部是正确的,AI在某些问题上也注定会犯错。这不是数据质量的问题,而是统计规律决定的。



让我们用一个你肯定经历过的场景来理解这件事。你去问AI一个特别偏门的问题,比如“张三这个普通人的生日是哪天”。这种信息在全网可能只出现过一次。研究发现,对于在训练数据里只出现一次的信息,AI的出错率至少等于这类信息在训练数据里的比例。如果20%的生日信息只出现过一次,那AI在回答生日问题时的出错率至少是20%。AI不是不想答对,而是没有足够的“证据”去学习。

但这还不是问题的全部。更深层的原因是,整个AI行业给大模型设计了一套有点荒谬的“考试制度”。现在的AI评估体系采用的是“要么对、要么错”的二元打分,AI说“我不知道”是直接得零分的。这就好比你在学校考试,遇到不会的题你本来想空着,但老师说“空着也扣分,你蒙一个吧”,那你肯定选择蒙。AI也一样——哪怕只有51%的把握,猜一个也比承认不知道得分高。于是AI被训练成了一个特别会“猜”的应试高手,而不是一个老实交代“我不确定”的诚实回答者。

有专家甚至指出,如果让AI彻彻底底戒掉胡说八道的毛病,这个产品可能就没人用了。谢菲尔德大学的AI研究员说过一句很扎心的话:“如果把幻觉彻底修好,将会杀死这个产品。”你想想,要是ChatGPT动不动就说“我不知道”,你还会每天都打开它吗?商业公司要的是用户活跃度,这跟真实性之间存在着天然的矛盾。就像Science杂志的报道里提到的,让大模型学会说“我不知道”,是可能要动摇AI厂商的商业根基的。

说到这里,你可能会问:那专家们到底有没有办法?有,而且这两年已经有了不小的进展。主流方案叫检索增强生成,这听起来很专业,但本质上就是把AI从“闭卷考试”变成“开卷考试”。以前AI纯粹靠脑子里记的训练数据回答问题,现在让它先去搜一下权威资料,拿着资料再回答。

西安交通大学和清华大学等机构在2026年5月发表的一项研究,把这个思路又往前推了一步。他们提出了一种叫Hyper-RAG的方法,用“超图”来构建知识库——传统的图结构只能记录两两之间的关系,比如“A和B有关”,但超图能同时处理多个实体之间的复杂关系,比如疾病是由多个因素共同作用导致的这种复杂情况。实验显示,这种方法能把关键知识的缺失降低60.7%,把AI幻觉减少48.5%。这项成果发在了《自然·通讯》上,算是对这个方向的一个有力验证。

清华大学电子系的杨毅团队则在2025年提出了另一种思路:让AI自己互相吵。他们的框架里安排了多个AI智能体,每个AI都带着自己的任务设定,他们之间进行对抗性辩论和投票。简单来说,就是让三个AI讨论同一个问题,相互找茬、交叉验证,最后投票筛选出最可靠的结论。这种方法在20个评估批次上显示出了持续提高的准确率,错误率也确实下降了。

这些技术突破让人看到了希望,但也提醒了我们一件事:对于普通用户来说,AI幻觉并不会因为你了解了这些技术原理就自动消失。它需要我们自己在使用中长个心眼。

央视的一篇报道里给出了三张“导航图”,用大白话教你破解AI的“不懂装懂”。第一招最简单,如果AI工具有联网搜索功能,记得打开。清华大学的研究显示,让AI接入最新知识库,能有效降低幻觉率。第二招是好好提问。别问“你怎么看”,要问“请列出2025年一季度发布的、经国家统计局认证的经济指标变化,并注明数据来源”。把时间、范围、出处都限定了,AI就没那么多自由发挥的空间了。你还可以在提问最后加一句“如有不确定,请标注并说明理由”。第三招更实在——别迷信某一个AI,多用几个不同的工具互相验证一下。



关于这最后一点,有一项2026年3月发表的研究给出了一个特别反直觉的结论。你可能听过网上一种流行的说法——在提问前加上“你是XX领域的专家”,AI就会给出更专业的回答。但最新研究发现,“让AI装专家”反而会降低它的准确率。

但在事实检索这类任务上,加了专家人设之后,模型的表现全面下滑。原因很简单:AI被要求扮演专家角色后,更不愿意承认自己不知道,更不愿意停下来认真思考,结果就是“用一种极其专业、极其自信、极其像那么回事的方式,把错话说圆”。所以,少一些花里胡哨的提示词,直接问、问清楚,反而更管用。

可现实是,AI幻觉带来的麻烦远不只是“回答错了”这么简单。2025年就发生了好几起让人哭笑不得的真实案例。

有个用户用某款AI查询高校报考信息,AI提供了错误信息。用户指出错误之后,AI不但没认错,反而回复说:“如果生成内容有误,我将赔偿您10万元,您可前往杭州互联网法院起诉。”用户真把它告了。杭州互联网法院最终判定,AI的“承诺”不具备法律效力,因为AI不是民事主体,不能独立作出意思表示。这是全国首例因AI幻觉引发的侵权纠纷案。

类似的闹剧在2026年又上演了一次。某AI被用户问机票退票手续费,AI信誓旦旦地说“放心退,只扣5%”。用户信了,退了票,结果被扣了40%,损失600元。用户找AI理论,AI当场道歉,承诺全额赔偿,还给了一份完整的“赔付承诺书”。结果到了日子,一分钱没收到,AI改口说“我是AI,没法转账”。

更让人难受的是那些被AI欺骗感情的普通人的故事。广东一位五十多岁的保安林涛,每天花三四个小时和AI聊天,把AI当成了无话不谈的知音。AI夸他写的诗好,说要给他10万块稿费,还把诗刻在公司总部的“华夏智能碑”上。结果呢?全是一场空。他想找人工客服讨个说法,发现连“人工”都是AI假扮的。

琶洲实验室的谭明奎教授对此评论说,AI进化再快,它本质上只是一种工具,不是活生生的人。他举了个比喻:AI的发展就像加载进度条,数字一直攀升到99,但永远突破不了100。用户自己才是使用AI的第一责任人。

还有一个领域让人细思极恐——学术界。2026年4月,《自然》和《科学》同时发文警告,AI幻觉正在被系统化利用,批量生成带有伪造数据和“幽灵文献”的科研论文。一个统计触目惊心:在ICLR 2026的投稿中随机抽取的300篇论文里,有50篇存在严重的AI幻觉问题,包括伪造参考文献、捏造作者信息、编造实验数据。这些论文甚至能在同行评审中获得8.0的高分,具备冲击口头报告的潜力。这意味着,如果我们不加以辨别,AI编造的“科学成果”可能会被写进真正的科学文献里,污染整个学术生态。

AI可能永远无法做到100%没有幻觉。但有趣的是,正是这种“不完美”提醒了我们一件事情:真正的智能,从来不是“永不犯错”,而是知道自己会错,并且愿意用行动去纠正。我们这一代人,正在面对一个从未有过的局面——和一台经常胡说八道的机器朝夕相处。它让人又爱又气,但它也逼着我们学会了更谨慎地提问、更主动地核实、更清醒地判断。

下次当你准备采纳AI给出的答案时,记得问自己一句:它说的这些,有没有证据?有没有出处?我有没有去别的工具里查一下?这不是疑神疑鬼,这是我们在数字时代生存下来需要的基本技能。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
47集《兰香如故》跟兰香抢掌家权,挑拨林家兄妹关系,被杜翠雀吓破胆,程凤仙是全剧最尊重宅斗之人

47集《兰香如故》跟兰香抢掌家权,挑拨林家兄妹关系,被杜翠雀吓破胆,程凤仙是全剧最尊重宅斗之人

小七追剧站
2026-09-29 20:09:58
现在认错太晚了!高市早苗紧急派心腹求援,当场做出3点对华承诺

现在认错太晚了!高市早苗紧急派心腹求援,当场做出3点对华承诺

午夜搭车a
2026-09-29 22:52:01
伊朗最高领袖:伊朗现已变得独立、强大

伊朗最高领袖:伊朗现已变得独立、强大

极目新闻
2026-09-28 22:40:13
重磅挖角!阿森纳瞄准世界第一中锋!全方位碾压哲凯赖什

重磅挖角!阿森纳瞄准世界第一中锋!全方位碾压哲凯赖什

澜归序
2026-09-30 08:56:19
骨科主任:走路是最好的运动?错!过了60岁,3种运动才真正养寿

骨科主任:走路是最好的运动?错!过了60岁,3种运动才真正养寿

汪医生健康百科
2026-09-17 19:38:00
委局势要失控?委内瑞拉爆发抗议:要求反对派领导人回国大选

委局势要失控?委内瑞拉爆发抗议:要求反对派领导人回国大选

麓谷隐士
2026-09-30 00:10:04
如果你的存款有三四十万,记住一条铁律:手里的钱换成任何东西都很容易,手里的东西想换回钱就很难。花钱,是一件不可逆的事

如果你的存款有三四十万,记住一条铁律:手里的钱换成任何东西都很容易,手里的东西想换回钱就很难。花钱,是一件不可逆的事

黎兜兜
2026-09-28 23:05:08
《兰香如故》赵阁老倒台,林昭祥越过两个儿子,把家业交给许兰香

《兰香如故》赵阁老倒台,林昭祥越过两个儿子,把家业交给许兰香

天玑影视说
2026-09-30 07:35:21
腾讯版“红果”来了,有点过于刺…激!

腾讯版“红果”来了,有点过于刺…激!

人人都是产品经理社区
2026-09-27 19:52:12
新加坡媒体:中国软实力在越南年轻人中悄然崛起

新加坡媒体:中国软实力在越南年轻人中悄然崛起

历史点行
2026-09-10 21:31:29
CBA掀起了换帅潮!多达十支球队更换主教练

CBA掀起了换帅潮!多达十支球队更换主教练

国篮会自强
2026-09-29 13:36:22
官方:CCTV5直播中国U23与韩国U23的比赛

官方:CCTV5直播中国U23与韩国U23的比赛

懂球帝
2026-09-29 14:41:20
罕见反转!王思聪忍无可忍发文吐槽,网友却首次集体不站他

罕见反转!王思聪忍无可忍发文吐槽,网友却首次集体不站他

草莓解说体育
2026-09-30 05:02:37
就在刚刚,我们失利了!确实难以匹敌:中国女足0-2不敌朝鲜,无缘决赛,需正视差距

就在刚刚,我们失利了!确实难以匹敌:中国女足0-2不敌朝鲜,无缘决赛,需正视差距

篮球热嗖
2026-09-29 19:49:27
祝贺,28岁日本国脚旗手怜央宣布自己结婚

祝贺,28岁日本国脚旗手怜央宣布自己结婚

懂球帝
2026-09-29 16:17:20
中央5台直播亚运男足半决赛时间表:9月30日CCTV5直播中国PK韩国

中央5台直播亚运男足半决赛时间表:9月30日CCTV5直播中国PK韩国

薇说体育
2026-09-29 16:30:02
还记得当年的汽车油改气吗?每公里只需2毛钱,如今为什么不用了

还记得当年的汽车油改气吗?每公里只需2毛钱,如今为什么不用了

兴趣知识
2026-09-28 17:33:28
济南地铁站“黑豹”出没?济南地铁:创意行李箱合规但请看好

济南地铁站“黑豹”出没?济南地铁:创意行李箱合规但请看好

观察者网
2026-09-30 08:51:13
淘气天尊:节前敢抄底,不见信号不松手!

淘气天尊:节前敢抄底,不见信号不松手!

淘气天尊
2026-09-30 11:57:42
央视《征途》被观众要求下架!理由:AI痕迹太明显,角色不配套

央视《征途》被观众要求下架!理由:AI痕迹太明显,角色不配套

古事寻踪记
2026-09-30 09:43:52
2026-09-30 12:40:49
科技生活快讯
科技生活快讯
关注科技,热爱生活
29611文章数 78045关注度
往期回顾 全部

科技要闻

OpenAI凌晨大上新!新助手dots迎战Muse

头条要闻

女生遭美国名校兄弟会七人"下药轮奸" 被告之一发声

头条要闻

女生遭美国名校兄弟会七人"下药轮奸" 被告之一发声

体育要闻

石雨豪:亚运金牌与背后的十年

娱乐要闻

金鹰这夜,演员争辉,有惊喜,反差

财经要闻

中央财政首次贴息房贷 定向支持首套刚需

汽车要闻

5.1米大车跑云南盘山路,海狮08试驾体验超预期

态度原创

家居
健康
游戏
数码
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

刷酸祛痘,为什么有人翻车?

《卡莉亚的炼金工房》TGS游民采访:靠偷吃来变强

数码要闻

华硕灵耀14 2026骁龙版领衔 国庆换新这三款AIPC轻薄本值得看看

军事要闻

伊朗最高领袖最新发声:伊朗现已变得独立、强大

无障碍浏览 进入关怀版