网易首页 > 网易号 > 正文 申请入驻

Cell子刊:龙尔平/万沛星团队发布大模型“圆桌会议”框架,大幅提升医疗AI推理能力

0
分享至

编辑丨王多鱼

排版丨水成文

医疗人工智能快速发展的当下,GPT-4、Med-PaLM2 等大型语言模型在医学问答与考试中不断刷新纪录,展现出接近人类的认知能力。然而,单一模型固有的“黑箱”局限、缺乏多视角校验的推理机制,已成为其在真实、高风险临床场景中安全落地的关键瓶颈。如何让 AI 像多学科专家会诊一样,实现交叉质证、协同决策,是医疗 AI 走向可信、可靠必须跨越的科学鸿沟。

2026 年 1 月 5 日,中国医学科学院基础医学研究所龙尔平团队与北京大学基础医学院万沛星团队合作(中国医学科学院基础医学研究所博士生孙欣提洪奇阳为论文共同第一作者),在Cell Reports Medicine期刊在线发表了题为:Model confrontation and collaboration: a debate intelligence framework for enhancing medical reasoning in large language models 的研究论文。

该研究提出了“模型对抗与协作”(Model confrontation and collaboration,MCC)框架,推动医疗 AI 从“单点智能”迈向“协同推理”的范式跃迁,通过构建可辩论、可追溯、动态协作的模型圆桌,从根本上促进了医疗 AI 向可靠、可解释、可协作的下一代形态演进。

MCC 框架:模型对抗与协作

在这项最新研究中,研究团队提出了“模型对抗与协作”(Model Confrontation and Collaboration,MCC)框架,将不同的大型语言模型组合成一个动态的、具备“推理-行动-反思”的圆桌式智囊团。MCC 引入共享的“上下文工作区”(shared context):将问题、已生成的候选答案、关键证据点与各模型的立场变化以结构化方式写入同一上下文记忆,并在每一轮辩论中保持对完整对话历史的可见性,从而确保批判与修正始终基于同一事实与语境。

其核心流程可概括为——

第一步,独立推理(Reason):GPT-o1、Qwen-QwQ、DeepSeek-R1 在同一问题上并行生成答案与关键论证点;随后引入分歧门控(Gate):系统/主持 LLM 对候选答案进行一致性检测,仅在出现分歧时激活辩论,从源头控制额外计算开销。

第二步,对抗辩论(Debate as Action):进入多轮消息传递,每轮中模型执行“质疑-举证-反驳-修正”四类动作,围绕共享上下文中的证据缺口与推理断点开展交叉验证:定位论证中的跳步、证据不足或概念混淆,进一步补充指南、机制与鉴别诊断依据;随后进行自我反思,审计自身推理链与关键假设,并以可解释方式更新立场与结论。

第三步,共识优化(Consensus Optimization):每轮结束后进行共识判定与早停;若三轮内仍不收敛,则以多数投票作为保底输出策略。与传统“静态集成/硬投票”不同,MCC将多模型互补性显式转化为“基于上下文的迭代纠错”协作过程,使异构模型在知识覆盖与推理偏好上的差异得以用于错误定位与证据对齐,从而显著提升难题场景下的收敛质量与输出稳定性。

MCC 在 MedQA 基准上的表现与决策动态

多项医学基准测试获得 SOTA 表现

MCC 在多项代表性医学基准上展现出一致而稳定的性能:在 MedQA 上取得 92.6%(±0.3)的平均准确率,并在多次独立运行中显示出稳定性。PubMedQA 达到 84.8%;在 MMLU 医学子集中覆盖遗传学、解剖学等多个科目,整体维持 90%+,并在其中五个科目获得 SOTA 表现。

更重要的是,MCC 不仅在“常规题”上提升准确率,也在“更难、更接近真实风险”的评测中保持稳健:在 MedXpertQA 上准确率约 40%,在该基准的对比评测中表现位居前列。在 MetaMedQA 中能够识别不确定或无明确标准答案的情形并给出“未知/需补充信息”的保守处理,体现出更强的元认知边界管理能力。此外,在 RABBITS 鲁棒性测试中,面对药物商品名与学名的混用与替换,MCC 性能几乎不受影响,显示其对临床语言变体具有更强的泛化与稳定性。

长文本问答:综合回答水平更高

在开放式长问答任务中,研究团队使用 MultiMedQA 基准并邀请医生与非专业评审开展双视角盲评,以评估模型在真实医疗咨询中的综合表达与建议能力。结果显示,MCC 在所有维度上均优于 GPT-o1、Qwen、DeepSeek-R1 以及 Med-PaLM2:医生评审的 12 项指标中,MCC 在病情要点提取、推理正确性与偏差控制等关键维度提升 8–12 个百分点且错误内容率更低;在另一组 9 项综合质量指标中,其缺陷率下降 3%–9%,一致性与知识覆盖更为稳定。进一步在 HealthBench 上,MCC 在与临床专家共识对齐的任务中取得 92.1 的综合评分,并在更高难度的 HealthBench Hard 中保持领先,体现出在复杂场景下的稳健性与安全性优势。

开放式医学问答输出的多维度评估

模拟诊断对话:对话版“诊疗小组”

为评估 MCC 在交互式诊疗场景中的能力,研究团队构建了类医学院 OSCE 的模拟病例对话测试:模型作为医生与模拟患者实时交互,在完成病史采集后给出诊断与鉴别诊断。结果显示,MCC 在病史采集阶段平均可捕获 80% 以上的关键患者信息点;在 16 个病例中,有 14 例的信息覆盖率超过 80%,而单一模型在同等标准下难以稳定达到该水平。与此同时,MCC 提出的问题与患者主诉的相关性更高(多数病例>80%),提示其问诊路径更聚焦关键线索、减少遗漏。在诊断结论阶段,在 15 个可判定病例中,MCC 的首选诊断正确率达到 80%(12/15),并在鉴别诊断的完整性上呈现优势。典型案例是一位 56 岁女性出现多饮多尿、乏力与体重下降,既往以 2 型糖尿病处理但血糖控制不佳。辩论过程中,模型间交叉质询促使补问胰腺相关病史与上腹痛向背部放射等线索,进而将诊断从“糖尿病本身”推进至“胰腺肿瘤相关继发性糖尿病”的更深层解释,体现出“圆桌式会诊”对关键线索召回与深入诊断推理的促进作用。

MCC 在诊断对话任务中的表现

展望与意义

这项研究表明,多模型对抗与协作可作为医疗推理能力增强的一种通用范式:在不引入额外任务训练与外部知识库的条件下,借助结构化辩论将不同模型的知识覆盖与推理偏好差异显式用于交叉核验、证据对齐与错误纠偏,从而提高复杂问题上的推理收敛质量与输出稳定性。需要强调的是,MCC 并非替代医生,而是提供多角度论据与可追溯的辩论日志,帮助临床人员降低漏诊误判风险并提升决策透明度,同时亦具备教学示范意义。面向临床应用,仍需进一步推进与电子病历及检查结果的端到端集成、对不确定/冲突信息的处理策略,以及隐私合规与计算成本控制,使其能够以安全、高效的方式融入真实工作流。

论文链接

https://www.cell.com/cell-reports-medicine/fulltext/S2666-3791(25)00620-2

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
89套房产、37台豪车查封!63亿资产冻结,鼎益丰1300亿玄学骗局

89套房产、37台豪车查封!63亿资产冻结,鼎益丰1300亿玄学骗局

正经的烧杯1
2026-08-30 14:37:41
中国男篮晋级形势大反转,菲律宾又要搞事坑人,郭士强真该醒醒了

中国男篮晋级形势大反转,菲律宾又要搞事坑人,郭士强真该醒醒了

宗介说体育
2026-08-31 15:12:30
于东来直播连麦劝崩溃小伙:房贷压垮你就卖掉,补习班费钱就少报,很多苦是你自己攥着不放

于东来直播连麦劝崩溃小伙:房贷压垮你就卖掉,补习班费钱就少报,很多苦是你自己攥着不放

看晓天下事
2026-08-29 14:24:04
星宇股份劝退事件:绝非中国汽车行业灾难!而是千载难逢的机遇!

星宇股份劝退事件:绝非中国汽车行业灾难!而是千载难逢的机遇!

沙雕小琳琳
2026-08-31 10:53:03
真的哭死,每个“免死金牌”都相当给力!网友:学到了

真的哭死,每个“免死金牌”都相当给力!网友:学到了

另子维爱读史
2026-08-31 20:22:49
张柏芝亮相上海活动,香芋紫斗篷礼服引热议,网友:“也就女神的脸能撑起来​​​”

张柏芝亮相上海活动,香芋紫斗篷礼服引热议,网友:“也就女神的脸能撑起来​​​”

韩小娱
2026-08-29 08:29:30
曝景甜与孙宇晨闹掰的真相:男方设局想套牢她,5000万美金是房款

曝景甜与孙宇晨闹掰的真相:男方设局想套牢她,5000万美金是房款

生命之泉的奥秘
2026-08-29 20:53:20
这些东西,你敢在闲鱼买吗?

这些东西,你敢在闲鱼买吗?

闲搞机
2026-08-31 11:29:53
恩爱37年难抵残酷现实,79岁郑少秋现状曝光,4个未婚女儿成遗憾

恩爱37年难抵残酷现实,79岁郑少秋现状曝光,4个未婚女儿成遗憾

娱圈办事处
2026-08-31 16:20:24
真不怪梅拉尼娅恨死了特朗普!

真不怪梅拉尼娅恨死了特朗普!

小马姨
2026-08-31 09:18:45
14年赚2.24亿还不够!巴恩斯直接买银行,退役每年还有29万养老金

14年赚2.24亿还不够!巴恩斯直接买银行,退役每年还有29万养老金

锅子篮球
2026-08-30 17:22:26
孙宇晨3任女友,一个比一个漂亮,最泼辣的是马佳佳,最智慧的是曾颖,最肤浅的是景甜

孙宇晨3任女友,一个比一个漂亮,最泼辣的是马佳佳,最智慧的是曾颖,最肤浅的是景甜

江山挥笔
2026-08-29 17:39:51
记者:卡马文加、居莱尔和B席停赛无缘国米

记者:卡马文加、居莱尔和B席停赛无缘国米

懂球帝
2026-08-31 20:33:19
说美国不敢动委内瑞拉,结果马杜罗被抓走了;说美国不敢动伊朗,结果哈梅内伊被送走了;现在又说美国不敢动朝鲜,那特朗普真的敢吗?

说美国不敢动委内瑞拉,结果马杜罗被抓走了;说美国不敢动伊朗,结果哈梅内伊被送走了;现在又说美国不敢动朝鲜,那特朗普真的敢吗?

扶苏聊历史
2026-08-31 11:43:25
接吻为何不嫌弃口水脏?真相比生物学还冷酷,对方躲着你就真凉了

接吻为何不嫌弃口水脏?真相比生物学还冷酷,对方躲着你就真凉了

坠入二次元的海洋
2026-09-01 00:54:14
两个孩子病死,父母全程只祈祷不送医.... 美国这个州,生死全指望上帝

两个孩子病死,父母全程只祈祷不送医.... 美国这个州,生死全指望上帝

英国那些事儿
2026-08-30 23:20:35
陈雨菲、梁伟铿/王昶、韩悦、刘圣书/谭宁均退出中国大师赛

陈雨菲、梁伟铿/王昶、韩悦、刘圣书/谭宁均退出中国大师赛

极目新闻
2026-08-31 21:37:47
当年为景甜砸十几亿的大佬去哪了?连遇两个渣男,他都不露面

当年为景甜砸十几亿的大佬去哪了?连遇两个渣男,他都不露面

三分钟看大片
2026-08-31 20:53:24
姜潮婚礼上那个180斤的切糕真能顶上一套房?新疆朋友听完沉默了一下说:顶上一套房倒不至于,但这切糕确实不便宜!

姜潮婚礼上那个180斤的切糕真能顶上一套房?新疆朋友听完沉默了一下说:顶上一套房倒不至于,但这切糕确实不便宜!

黎兜兜
2026-08-31 08:13:32
作家列夫·托尔斯泰四世孙的罪恶言论:公然宣称彻底炸毁乌克兰

作家列夫·托尔斯泰四世孙的罪恶言论:公然宣称彻底炸毁乌克兰

巴雷文化
2026-08-30 05:02:19
2026-09-01 02:24:49
生物世界 incentive-icons
生物世界
最前沿、最有趣的生命科学研究
9969文章数 145160关注度
往期回顾 全部

科技要闻

起售不足18万!特斯拉在港澳推廉价Model 3

头条要闻

60米高空直击吉隆口岸 这就是泥石流曾吞噬的高度

头条要闻

60米高空直击吉隆口岸 这就是泥石流曾吞噬的高度

体育要闻

中国女婿用一份满分答卷,刺痛中国女排

娱乐要闻

女歌手陈粒疑被男子骚扰,本人回应

财经要闻

沃什美联储百日新政剧变:没有给答案

汽车要闻

A0级最长续航 极狐贝塔T1 550km版上市 7.68万起

态度原创

手机
教育
家居
数码
房产

手机要闻

荣耀MagicOS 11内测全量增推!最高省60GB存储 安卓首发动态液态玻璃

教育要闻

老师年年有九一,死心塌地爱自己

家居要闻

2026建博会(广州) 公装联探展交流活动

数码要闻

消息称长鑫存储开始试产HBM3E内存

房产要闻

稳住了!三亚最新房价,刺破3.5万元/m²!

无障碍浏览 进入关怀版