一个让放射科医生暂时松一口气的最新测试是:AI看片子确实越来越准了,但犯起错来也格外理直气壮。印度阿育王大学 CRASH 实验室推出的 RadLE 2.0 基准测试,专门衡量大模型在放射学诊断中的可靠程度。他们让 16 个模型跑了 200 个病例,不光看答案对错,还要看它给自己的判断打几分信心分,以及能不能在被难住时大方承认“我不知道”。
结果有点反直觉。得分最高的 AI 模型只拿到 758 分,而人类专家组成的评审团拿下了 988.7 分——满分是 2000。拉开差距的并不是掌握知识的多少,而是出错了还嘴硬的程度。根据论文团队的观察,不少模型如果能在拿不准时选择闭嘴而不是硬猜,成绩反而会大幅跃升,尤其是在一些开源权重模型和专为医疗场景训练的模型身上,这种“什么都要答”的冲动特别明显。
![]()
这套打分体系的逻辑很清晰:答对了且信心高,拿满分;答错了却极度自信,被扣掉的分数和它吹过的牛成正比;老老实实说不知道,不扣分也不加分。所以表面上看着命中率还不错的模型,一旦它习惯在错误答案上押重注,排名就会直接跳水。研究团队直言,只要基准测试只奖励“做对”,AI 就会被驯化成赌徒——而在医学里,一个坚信自己没错的误诊,远比一个诚实的“我没把握”要危险得多。
单打独斗的成绩单上其实没有常胜将军。Anthropic 的 Claude Fable 5 在“给出可靠且安全的回答”这个主指标上最稳,Google 的 Gemini 3 Pro 则顶着最高的原始准确率。而 Meta 的 Muse Spark 1.1 最会看人下菜碟:知道什么时候该把案子转交人类医生。巧合的是,Meta 最近刚把 Muse Spark 1.1 的幻觉率砍了将近一半,秘诀就是让它多拒绝、少硬编。
但这条更谨慎的路,并不是所有前沿模型都在走。比如 Grok 4.5,它的幻觉反而比前代更多了。背后的原因很黑色幽默:懂得越多,越容易坚定地错下去。它因为“知道”了更多信息,反而对自己那些错误的推论深信不疑。反观第一版 RadLE 测试,三个月前放射科医生准确率 83%,最好的模型才勉强摸到 30%。如今 Gemini 3 Pro 已经超过住院医师水平,但模型对自己能力边界的感知力,依然没有跟上技术进步的速度。
另一个让研究者们警觉的趋势是:已经有越来越多的人开始把自己的磁共振片子直接喂给聊天机器人,并期待得到一个“更懂自己”的解读。速度是上来了,但最后那道关于信心的安全带,还没扣好。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.