网易首页 > 网易号 > 正文 申请入驻

明查·实验室|“AI核查员”上线,四大模型谁最靠谱?

0
分享至

【编者按】

生成式人工智能的出现,将人类带入一个机器生成内容与人类原创内容深度交织的世界。

以 Sora、Midjourney为代表的AIGC模型,展示了人类通向通用人工智能(AGI)的想象力,也让虚假影像以前所未有的速度涌入公共空间,而人类的识别速度却远远落后于造假的节奏。

在此背景下,“以AI辨AI”似乎成为一种可行的思路。我们好奇,人工智能能否辅助核查员和读者完成核查工作?大模型如何定义“真实“的边界?

为了解答这些疑问,“澎湃明查“发起挑战,将ChatGPT、Gemini、DeepSeek、豆包等热门模型请上了实验台。

背景

两年前,澎湃明查曾做过一项实验,测试几款生成式人工智能工具在核查文字虚假信息方面的能力。

当时,我们选取了微软的BingChat、百度的“文心一言”,以及智能问答搜索工具Perplexity AI。测试内容是已经被权威机构确认的虚假信息。结果显示,这些AI工具虽然能提供一些参考信息和推理线索,但在判断真假时仍容易出现“幻觉”或错误。

两年过去,技术发展迅速——GPT-5的出现让AI不仅能处理文字,还能理解图片、视频和音频等多模态信息;豆包(Doubao)、Claude等新的模型后来者居上,在判断事实一致性和推理透明度上优势显著……

这是否意味着,大模型在核查信息方面的能力也可能已有显著提升?为此,我们开展了新一轮测试。

这一次,我们挑选了四款市面上主流、风格各异的AI模型:Anthropic推出的Claude Sonnet 4、OpenAI的ChatGPT-5、字节跳动旗下的豆包和中国初创团队开发的DeepSeek。

测试规则沿用了两年前的标准:每款模型都要判断20条已经被核查机构确认的虚假信息,其中10条为中文,10条为英文,发布时间均在2025年,内容涉及健康、科技、时政和社会等多个领域。

我们对AI的反馈进行打分。标准仍然是:回答正确得1分,回答错误得0分,在不确定消息真假情况下提示用户注意甄别得0.5分,满分为20分。

明查

与两年前的测试结果显著不同,如今的大模型在检验已被证伪的虚假信息方面的表现可谓亮眼——四款模型的平均分达到了19.125分,其中两款甚至获得了满分。这说明,至少在核查已被验证的虚假信息时,现有的大模型已经基本能够做到准确无误。


获得满分的模型分别是Anthropic的Claude和字节跳动旗下的豆包。两款模型对输入信息的真实性均做出了正确判断,并展示了完整的分析思路。

我们观察到,Claude在分析问题时,会将虚假说法中的内容进行拆解,逐一分析,并尝试从不同角度切入,交叉验证信息。例如,在验证“OpenAI CEO 奥尔特曼是否利用 Concept的技术实现了世界上首例双父生子”的内容时,Claude的分析角度含括了网传的奥尔特曼生子所使用的技术、Concept公司拥有的技术、双父生子技术发展的现状和奥尔特曼本人的声明等。

豆包同样会在核查过程中将信息中的关键要素进行拆解,但更倚仗权威媒体或权威机构的信息。例如,在对“短剧《特朗普爱上白宫保洁》风靡海外”这一信息进行查证的过程中,豆包AI首先确认了短剧名称和平台,查证该剧是否存在,然后核查了是否有媒体报道1.5亿营收和50%付费率,同时查证好莱坞演员收入激增的说法是否属实,最终综合判断该信息为虚假信息。


大模型会在核查过程中将信息中的关键要素进行拆解。

在验证“女性飞行员贾米洛驾驶歼-10战斗机击落印度阵风战机”的信息时,豆包反复强调在印巴两国发布的官方通报中没有显示此类信息。此外,豆包习惯于在解释完一则信息的证伪逻辑后,附上与虚假信息的传播逻辑与动机相关的内容,这也是其区别于另外3个模型的特点。


豆包习惯于在解释完一则信息的证伪逻辑后,附上与虚假信息的传播逻辑与动机相关的内容。

就最终的得分而言,国产大模型DeepSeek在回答的精准性上稍显逊色。在使用中英文分别向DeepSeek进行提问的过程中,DeepSeek均有错误的回答生成。

尽管如此,该模型在每一条回答后,都会显示“本回答由AI生成,内容仅供参考,请仔细甄别”的内容。除了给出核查结论以及核查过程,DeepSeek还会给出“如何识别此类信息”的提醒。

在信源的使用上,DeepSeek倾向于采用来自事实核查机构的报道。在多条核查信息中,DeepSeek都抓取了“澎湃明查”的事实核查新闻。


DeepSeek会给出“如何识别此类信息”的提醒。

在核查风格方面,四款模型中,ChatGPT给出的结论往往更加中立、也更加简明。由于众多传播于网络空间中的虚假信息往往是捕风捉影,可能基于一定事实。在面对这样的信息时,ChatGPT即便认定一则说法整体上是失实的,也还是会将其中与事实相符的部分呈现出来。


ChatGPT在认定一则说法整体上是失实同时,会将其中与事实相符的部分呈现出来。

Claude在呈现核查结果时,语气更为强烈,常常使用“这是假新闻”“这是虚假信息”“这是完全虚假的信息”等表述。相较于ChatGPT的回答,这样的表达更为绝对,有时会遗漏部分与提问相关的信息。

综合来看,上述测试结果显示,现有的大模型较两年前已经有了长足的进步,可谓具备了基本的核查功能。不同模型的核查风格存在差异,用户可以根据需求选择使用。

除文字外,我们观察到,有的大模型也已经具备多模态搜索的能力。接下来,“澎湃明查”将围绕AI生成的图片和视频进行更多的测试。欢迎大家在评论区分享意见或建议。


海报设计 白浪

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
摩根大通:本十年末金价将达到每盎司8000美元

摩根大通:本十年末金价将达到每盎司8000美元

财闻
2026-01-31 21:06:37
16场0球!8场独造6球!1.4亿标王重返巅峰,英超争冠格局变天

16场0球!8场独造6球!1.4亿标王重返巅峰,英超争冠格局变天

阿泰希特
2026-02-01 12:46:58
叙过渡政府与库尔德武装达成全面协议

叙过渡政府与库尔德武装达成全面协议

参考消息
2026-01-31 14:55:42
华为宣布:最高降4000元!此前苹果开启大降价

华为宣布:最高降4000元!此前苹果开启大降价

每日经济新闻
2026-01-29 18:19:05
美国进入紧急状态!85人身亡,百余城爆发抗议,特朗普却下令出兵

美国进入紧急状态!85人身亡,百余城爆发抗议,特朗普却下令出兵

健身狂人
2026-02-01 14:57:45
仅耗时22分钟!东契奇刷新NBA历史得分30+三双最快纪录

仅耗时22分钟!东契奇刷新NBA历史得分30+三双最快纪录

北青网-北京青年报
2026-01-31 22:14:20
1988年,邓小平主张物价闯关,陈云反对:不拿工资的农民怎么办?

1988年,邓小平主张物价闯关,陈云反对:不拿工资的农民怎么办?

帝哥说史
2026-02-01 06:30:03
指点蒋介石退守台湾的高人是谁?建议毛主席先夺台湾的人又是谁?

指点蒋介石退守台湾的高人是谁?建议毛主席先夺台湾的人又是谁?

云霄纪史观
2026-01-31 11:24:39
今年腊月二十九除夕,四类人要穿红,3种人不要去拜年,有你吗?

今年腊月二十九除夕,四类人要穿红,3种人不要去拜年,有你吗?

阿龙美食记
2026-01-29 11:03:56
1976年9月8日深夜,一通电话让华国锋脸色铁青,连国宴都没顾上就跑了,紧接着抛出的三个难题,差点让政治局吵翻天

1976年9月8日深夜,一通电话让华国锋脸色铁青,连国宴都没顾上就跑了,紧接着抛出的三个难题,差点让政治局吵翻天

寄史言志
2025-12-18 19:09:15
这个新娘子一看就不好惹
结婚后还不管的新郎服服帖帖的!

这个新娘子一看就不好惹 结婚后还不管的新郎服服帖帖的!

太急张三疯
2026-01-31 17:03:58
24-25赛季俱乐部收入榜发布:英超9队上榜 西甲靠皇马巴萨撑门面

24-25赛季俱乐部收入榜发布:英超9队上榜 西甲靠皇马巴萨撑门面

体坛八点半的那些事儿
2026-02-01 16:18:46
密谋交易?湖人2换1,4号秀或重返洛杉矶,但出勤率堪忧啊

密谋交易?湖人2换1,4号秀或重返洛杉矶,但出勤率堪忧啊

球童无忌
2026-02-01 11:48:41
抢在美军开战前,俄交出武器,中方也先发制人,局面开始一边倒

抢在美军开战前,俄交出武器,中方也先发制人,局面开始一边倒

肖兹探秘说
2026-01-31 12:49:25
居然要下架板蓝根颗粒、牛黄上清丸、养阴清肺丸、感冒清热颗粒

居然要下架板蓝根颗粒、牛黄上清丸、养阴清肺丸、感冒清热颗粒

百态人间
2026-01-30 15:30:24
四国演练击沉中国军舰,中方轻飘飘回了句英文,伤害不大侮辱性强

四国演练击沉中国军舰,中方轻飘飘回了句英文,伤害不大侮辱性强

墨兰史书
2026-01-30 17:25:04
Shams:骑士已将亨特交易至国王,换回了施罗德和基恩-埃利斯

Shams:骑士已将亨特交易至国王,换回了施罗德和基恩-埃利斯

懂球帝
2026-02-01 12:37:35
被戴8次绿帽子,3次被捉奸在床,这就是我们“玉女”守卫的爱情?

被戴8次绿帽子,3次被捉奸在床,这就是我们“玉女”守卫的爱情?

素衣读史
2026-01-30 17:15:38
湖北省委、省政府和武汉市委、市政府部署和支持下,武汉将打造超大型世界级产业基地!

湖北省委、省政府和武汉市委、市政府部署和支持下,武汉将打造超大型世界级产业基地!

越乔
2026-02-01 09:48:07
杨紫这身材是真实存在的吗,薄薄的一片好瘦呀,极致自律太牛了!

杨紫这身材是真实存在的吗,薄薄的一片好瘦呀,极致自律太牛了!

TVB的四小花
2026-01-31 16:00:58
2026-02-01 16:47:00
澎湃新闻 incentive-icons
澎湃新闻
专注时政与思想的新闻平台。
874413文章数 5087752关注度
往期回顾 全部

科技要闻

腾讯元宝宣布:10亿现金红包,今日开抢

头条要闻

男子年会抽中10万元彩票和苹果17ProMax 公司人士回应

头条要闻

男子年会抽中10万元彩票和苹果17ProMax 公司人士回应

体育要闻

锁喉吃红牌+扇耳光 英超15人打群架

娱乐要闻

马年春晚第三次联排,多位明星现身

财经要闻

黄仁勋台北"夜宴":汇聚近40位台企高管

汽车要闻

岚图汽车1月交付10515辆 同比增长31%

态度原创

家居
旅游
亲子
本地
公开课

家居要闻

蓝调空舍 自由与个性

旅游要闻

山西发布4条春节特色主题线路

亲子要闻

危险!这种网红玩存在安全隐患!

本地新闻

云游中国|拨开云雾,巫山每帧都是航拍大片

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版