网易首页 > 网易号 > 正文 申请入驻

斯坦福临床医疗AI横评,DeepSeek把谷歌OpenAI都秒了

0
分享至

西风 发自 凹非寺
量子位 | 公众号 QbitAI

斯坦福最新大模型医疗任务全面评测,DeepSeek R1以66%胜率拿下第一

歪国网友纷纷被惊艳住了,原因在于该评测重点聚焦临床医生的日常工作场景,而非仅局限于传统医疗执照考试题。

要评测就要全 方 位。

团队构建了含35个基准测试的综合评估框架,覆盖22个子类别医疗任务。

整个评测的分类体系还经过了临床医生验证,由29名来自14个医学专科的执业医师共同参与开发

光作者名单就老长,斯坦福大学医学院、斯坦福医疗中心、斯坦福大学基础模型研究中心(CRFM)、微软的研究人员均在列。

31页论文最终得出,DeepSeek R1、o3-mini、Claude 3.7 Sonnet等在内的9个前沿大模型,DeepSeek R1以66%胜率、0.75宏观平均分领先。

为当前的基准测试结果,团队还打造了一个可公开访问的排行榜。

除DeepSeek R1领先外,o3-mini紧随其后,以64%胜率及最高0.77宏观平均分紧追;Claude 3.5和3.7 Sonnet则达到了63%、64%的胜率。

看了具体研究,网友表示这些评估很有帮助。

下面来看更多细节。

大模型临床医疗任务大考

此综合评估框架名为MedHELM,受到了之前斯坦福HELM项目标准化跨领域评估思路的启发。

研究核心贡献之一是构建了一个经过临床医生验证的分类体系。

该体系模拟了临床医生日常工作逻辑,包含三个层级:

  • 类别:医疗活动的广泛领域(如“临床决策支持”);
  • 子类别:类别下的相关任务组(如“支持诊断决策”);
  • 任务:医疗服务中的离散操作(如“生成鉴别诊断”)。

在初步拟定分类体系时,一名临床医生基于《美国医学会杂志》(JAMA)综述中梳理的任务,将这些任务重组为反映真实医疗活动的功能主题,形成了一个含5个类别、21个子类别、98项任务的框架。

然后团队对这个初始分类体系进行验证。

来自14个医学专科的29名执业临床医生参与问卷调研,从分类逻辑和覆盖全面性两方面评估体系合理性。

根据反馈,体系最终扩展为5 个类别、22 个子类别、121 项任务,全面覆盖临床决策支持、临床病例生成、患者沟通与教育、医学研究辅助、管理与工作流程等医疗实践的各个方面,且26位临床医生对子类别分类达成96.7%的一致性

核心贡献二,在分类体系基础上,团队构建了一个含35个基准测试的综合评估套件,包括:

  • 17个现有基准测试
  • 5个基于现有数据集重新构建的基准测试
  • 13个全新开发的基准测试

值得一提的是,13个全新开发的基准测试中有12个基于真实的电子健康记录数据,有效弥补了现有评估中真实医疗数据使用不足的问题。

最终这整套基准测试,完全覆盖了分类体系中的所有22个子类别,同时根据数据的敏感性和访问限制,这些基准测试被划分为14个公开、7个需要审批和14个私有的不同访问级别。

考试题准备就绪后,研究团队对9个前沿大语言模型进行了系统性评估。

评测结果如何?

评估显示,模型表现存在显著差异。

DeepSeek R1表现最佳,在两两对比中以66%的胜率领先,宏观平均分为0.75,且胜率标准差较低(0.10)

其中胜率指模型在全部35个基准测试的两两对比中表现更优的比例。胜率标准差(SD)衡量模型获胜的稳定性(值越低=稳定性越高)。宏观平均分是所有35个基准测试的平均性能得分。标准差(SD)反映模型在不同基准测试中的性能波动(值越低=跨基准一致性越高)

o3-mini紧随其后,在临床决策支持类别基准中表现较优,以64%的胜率和最高宏观平均分0.77位居第二。

Claude 3.7 Sonnet、3.5 Sonnet胜率分别为64%、63%,宏观平均分均为0.73;GPT-4o胜率为57%;Gemini 2.0 Flash和GPT-4o mini胜率较低,分别为42%、39%。

另外,开源模型Llama 3.3 Instruct胜率为30%;Gemini 1.5 Pro以24%的胜率排名末位,但其胜率标准差最低(0.08),显示出最稳定的竞争表现。

团队还以热图形式展示了每个模型在35个基准测试中的标准化得分,深绿色表示性能更高,深红色表示低性能。

结果显示,模型在以下基准测试中表现较差:

  • MedCalc-Bench(从患者病历中计算医学值)
  • EHRSQL(根据自然语言指令生成用于临床研究的SQL查询——原设计为代码生成数据集)
  • MIMIC-IV Billing Code(为临床病例分配ICD-10代码)

在NoteExtract基准测试(从临床病历中提取特定信息)中表现最佳。

更深入的分析显示,不同类别的任务中模型表现呈现明显的层次性差异。

在临床病例生成任务中,大多数模型达到了0.74-0.85的高分表现;在患者沟通教育任务中表现同样出色,得分在0.76-0.89之间;在医学研究辅助(0.65-0.75)和临床决策支持(0.61-0.76)类别中表现中等,而在管理与工作流程(0.53-0.63)类别中的得分普遍较低。

这种差异反映了自由文本生成任务(如临床病例生成、患者沟通)更适合发挥大语言模型的自然语言优势,而结构化推理任务则需要更强的领域特定知识整合和逻辑推理能力

对于13个开放式基准测试,团队采用了大语言模型评审团(LLM-jury)评估方法。

为评估该方法的有效性,团队收集了临床医生对部分模型输出的独立评分。其中,从ACI-Bench中选取了31个实例,从MEDIQA-QA中选取了25个实例,以比较临床医生给出的分数与评审团的综合评分。

结果显示,LLM陪审团方法与临床医生评分的一致性达到0.47的组内相关系数,不仅超过了临床医生之间的平均一致性(ICC=0.43),也明显优于传统的自动化评估指标如ROUGE-L(0.36)和BERTScore-F1(0.44)

团队由此认为,大语言模型评审团比标准词汇指标更能反映临床医生的判断,证明了其作为临床医生评分替代方法的有效性。

成本效益分析是该研究的另一个创新,基于2025年5月12日的公开定价,团队结合基准测试运行和大语言模型评审团评估过程中消耗的输入总token数和最大输出token数,估算了每个模型所需的成本。

正如预期,非推理模型GPT-4o mini(805美元)和Gemini 2.0 Flash(815美元)成本更低,胜率分别为0.39和0.42。

推理模型成本较高,DeepSeek R1(1806美元)和o3-mini(1722美元)的胜率分别为0.66和0.64。

综合来看,Claude 3.5 Sonnet(1571美元)和Claude 3.7 Sonnet(1537美元)在性价比上表现良好,以较低成本实现了约0.63的胜率。

更多详情感兴趣的童鞋可查看原论文。

论文链接:https://arxiv.org/pdf/2505.23802
Blog链接:https://hai.stanford.edu/news/holistic-evaluation-of-large-language-models-for-medical-applications
排行榜链接:https://crfm.stanford.edu/helm/medhelm/latest/#/leaderboard

参考链接:https://x.com/iScienceLuvr/status/1929388406032810046

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
大跳水!Shams:詹姆斯若加盟勇骑热等任意一队 都只能拿老将底薪

大跳水!Shams:詹姆斯若加盟勇骑热等任意一队 都只能拿老将底薪

醉卧浮生
2026-07-24 08:34:23
以色列曝光12名加沙球星,甩出铁证怒揭加沙体坛老底:全参与过恐怖袭击?

以色列曝光12名加沙球星,甩出铁证怒揭加沙体坛老底:全参与过恐怖袭击?

全球吃瓜现场
2026-07-23 12:03:30
扎心了!“我生君未富”,一博主举出大厂大量现实案例,评论沸腾

扎心了!“我生君未富”,一博主举出大厂大量现实案例,评论沸腾

另子维爱读史
2026-07-23 20:38:26
名记:詹姆斯没在等待浓眉交易发生再做决定

名记:詹姆斯没在等待浓眉交易发生再做决定

体坛周报
2026-07-24 09:20:11
王毅一句“坐太远了”把菲律宾外长逗笑,可后面的话让她笑不出来

王毅一句“坐太远了”把菲律宾外长逗笑,可后面的话让她笑不出来

呼呼历史论
2026-07-24 03:38:04
“还不如贾浅浅!这分明是一篇日记啊”!汤家凤怒批海南作协副主席的现代诗,引热议

“还不如贾浅浅!这分明是一篇日记啊”!汤家凤怒批海南作协副主席的现代诗,引热议

火山詩话
2026-07-23 07:57:53
巴萨暴怒!29岁队长重伤休战6个月:带伤踢世界杯 无脑上“屠宰场”

巴萨暴怒!29岁队长重伤休战6个月:带伤踢世界杯 无脑上“屠宰场”

风过乡
2026-07-24 07:23:33
甄珍哭着说:谢贤去年就认不得人了,反复问同一个问题,连老朋友都叫不出名字

甄珍哭着说:谢贤去年就认不得人了,反复问同一个问题,连老朋友都叫不出名字

情感大头说说
2026-07-23 17:39:55
3岁中国籍男童在日本独自横穿马路时被货车撞击身亡,52岁肇事司机涉嫌过失驾驶致伤罪被当场逮捕,其称“没有注意到小男孩突然冲到车前”

3岁中国籍男童在日本独自横穿马路时被货车撞击身亡,52岁肇事司机涉嫌过失驾驶致伤罪被当场逮捕,其称“没有注意到小男孩突然冲到车前”

都市快报橙柿互动
2026-07-23 01:43:43
黄渤不甘2亿亏损,集结17星力战周星驰新片

黄渤不甘2亿亏损,集结17星力战周星驰新片

孤傲何妨初
2026-07-22 05:38:58
危险的非洲大蜗牛正在扩张,北方也可能失守

危险的非洲大蜗牛正在扩张,北方也可能失守

南风窗
2026-07-23 15:07:43
总决赛用人引发巨大争议!张籽萱失势,教练组的选择该如何解读

总决赛用人引发巨大争议!张籽萱失势,教练组的选择该如何解读

金毛爱女排
2026-07-24 00:00:06
随着朱芳雨卸任,广东宏远新的总经理,99%在以下三人之间产生

随着朱芳雨卸任,广东宏远新的总经理,99%在以下三人之间产生

砚底沉香
2026-07-24 04:55:49
新疆旅行生图流出,倪妮文艺穿搭翻车,辛芷蕾赢麻了,高叶的鞋子更是让人一言难尽

新疆旅行生图流出,倪妮文艺穿搭翻车,辛芷蕾赢麻了,高叶的鞋子更是让人一言难尽

动物奇奇怪怪
2026-07-23 16:48:06
红姐,咱以后尽量少说点话,1995年的3万元存款是普通职工不吃不喝5年多的全部工资呢。

红姐,咱以后尽量少说点话,1995年的3万元存款是普通职工不吃不喝5年多的全部工资呢。

问道求真
2026-07-23 01:28:34
告别17年蓝白生涯!38岁铁卫宣布退出阿根廷队:139场8球3冠军

告别17年蓝白生涯!38岁铁卫宣布退出阿根廷队:139场8球3冠军

风过乡
2026-07-24 06:29:03
694万悬赏背后:从射日英雄到失信人,寇占文输掉的到底是什么?

694万悬赏背后:从射日英雄到失信人,寇占文输掉的到底是什么?

记录生活日常阿蜴
2026-07-24 03:57:00
安徽进出口股份有限公司第一事业部副总经理王青峰接受纪律审查和监察调查

安徽进出口股份有限公司第一事业部副总经理王青峰接受纪律审查和监察调查

界面新闻
2026-07-23 16:01:11
“牡丹花下死,做鬼也风流”!这一次,75岁的张纪中彻底成了笑话

“牡丹花下死,做鬼也风流”!这一次,75岁的张纪中彻底成了笑话

小鱼爱鱼乐
2026-07-15 12:14:00
连续轰炸大型物流中心,原来背后牵涉到克里姆林宫和俄罗斯经济

连续轰炸大型物流中心,原来背后牵涉到克里姆林宫和俄罗斯经济

鹰眼Defence
2026-07-23 15:30:21
2026-07-24 10:03:00
量子位 incentive-icons
量子位
追踪人工智能动态
13010文章数 176522关注度
往期回顾 全部

科技要闻

北大发文祝贺校友王虹、邓煜荣获菲尔兹奖

头条要闻

马克龙致电菲尔兹奖得主王虹:干得好

头条要闻

马克龙致电菲尔兹奖得主王虹:干得好

体育要闻

勇士24岁的MVP,也是个勒布朗?

娱乐要闻

梁朝伟汤唯19年后境遇反转

财经要闻

美国对数十个国家加征10%-12.5%的关税

汽车要闻

满配华为乾崑六件套 东风奕派M8限时权益价16.58万起

态度原创

本地
亲子
时尚
健康
军事航空

本地新闻

跟着影视去旅行:西游篇

亲子要闻

47岁汤唯二胎产子,57岁金泰勇全程陪伴,一家四口手握手好幸福

今年夏天最时髦的穿法:衬衫+牛仔裤,太高级了!

我是不是中风高风险人群?快速自测

军事要闻

"镐山"之后美再威胁袭伊基础设施 伊朗:将以牙还牙

无障碍浏览 进入关怀版