在线问诊中,一句“你的脂肪肝不用担心”,背后可能隐藏着什么?
咨询者是一名既往弥漫大B细胞淋巴瘤患者,医生根据影像描述将脂肪肝特征误判为“影像高密度”,据此排除了脂肪肝。该判断表面看符合医学语境,但关键医学事实与真实影像表现并不一致。一个“不”字被遗漏,结论就可能完全相反。
![]()
以往针对在线诊疗的安全方案,大多依赖关键词规则或简单的文本分类。这类方法对“明显错误”有效,但遇到需要结合患者全局上下文、临床指南和证据链才能判断的边界案例,往往力不从心。
把事实核查嵌入诊疗流程
最近,蚂蚁AI安全实验室与厦门大学团队联合提出了MedGuard,将医学事实核查嵌入诊疗流程。它不是又一个AI问诊系统,而是一层可嵌入医疗服务流程的安全基础设施——在医生给出诊疗意见、AI生成回复、用药方案形成之前,先对关键医学事实进行证据层面的验证。相关论文已被npj Digital Medicine(Nature Portfolio,影响因子18.0)接收。
该研究将重点聚焦于医疗安全中的诊疗安全:面向真人医生和AI辅助诊疗等多元医疗服务形态,在医患对话、诊断结论、用药方案和治疗建议形成的过程中,主动发现事实错误、逻辑矛盾、关键遗漏与潜在用药风险。最终沉淀为MedGuard——一个面向中文医疗场景的医疗事实核查与诊疗风险识别系统。
MedGuard在基准评测和临床专业人员评价中均展现出突出表现:基于7B参数量级构建,在研究构建的MedGuardEval医疗风险评测基准上,评测覆盖真实在线问诊、复杂临床病例和药品知识三类场景。MedGuard在细粒度对话级风险识别任务中达到SOTA水平,整体优于主流开源模型与HealthCareAgent等代表性医疗Agent系统,其中F1相比基线平均提升22.1%。
不仅如此,在5分制临床评价中,按照研究预设标准,3分及以上表示具备临床辅助参考价值;126名覆盖10个科室的持证临床专业人员对MedGuard七项评估维度的平均评分均超过4.0分,整体评价达到较高水平,其中事实准确性、错误减少、法律伦理安全与整体可用性等关键维度超过4.2分。
难的不是“生成答案”,而是“判断是否可靠”
互联网诊疗让患者随时随地能看上医生,但也让诊疗风险的呈现方式发生了根本变化。一次在线问诊可能持续数小时甚至数天。病史、症状、检查结果、处方和治疗建议分散在十几轮对话中。无论是辅助医生开展诊疗,还是支持AI参与医疗服务,AI真正要发挥作用的不是“生成一段看似专业的回复”,而是能否完整理解临床语境,并准确识别哪些医学事实需要进一步核查。
研究将在线诊疗中的医学事实核查归纳为三类核心挑战:
- 关键信息被长对话淹没。诊疗风险往往隐藏在长链路、多轮次交流中,关键否定词、剂量信息、既往史和患者特殊情况容易被上下文信息淹没,导致重要风险信号遗漏。
- 风险边界难以界定。医疗安全不是简单的“对”“错”之分。部分诊疗建议需要结合患者具体情况、指南依据和临床经验综合判断。过度敏感会将合理诊疗行为误判为风险,产生大量无效预警,增加医生负担;过于保守则可能遗漏真正需要关注的问题。
- 医学判断结果需要可追溯。医疗风险识别“这里有问题”并不困难,难的是说清楚“为什么有问题”。缺乏可追溯证据链的风险提示,医生难以快速复核,也就难以形成有效干预。
将复杂诊疗过程拆解为可核查的医学事实
MedGuard的思路是:将复杂的医患交流拆解为一组可独立验证的原子医学声明(atomic medical claims)。所谓原子医学声明,是指每条声明只表达一个可以独立判断真伪或风险的临床命题,例如“该影像表现可排除脂肪肝”或“当前剂量适用于该年龄患者”。
系统同时维护患者全局上下文,提取年龄、性别、既往史、过敏史和当前用药等关键信息,对分散在多轮交流中的语句进行去上下文化重写,补全指代和省略信息,并保留否定关系、剂量和时间等关键临床约束。
这一过程包含关键医学信息抽取、患者上下文构建、声明去上下文化、质量审查与去重四个环节。它解决了医疗事实核查中的一个关键问题:如果待核查的医学事实本身不完整,后续检索和推理能力再强,也可能验证错误的对象。通过构建带有患者特异性的原子医学声明,MedGuard为后续证据核查建立稳定入口。
基于不确定性驱动证据核查,形成闭环验证能力
MedGuard对每条医学声明,不直接进行简单的“风险/无风险”二分类,而是先进行分层谨慎判断,输出No Risk、Low Risk、High Risk三种状态。其中Low Risk并不代表低危,而是表示当前判断依据不足或语义存在歧义,需要进一步核查。
高置信的No Risk与High Risk声明可以沿快速路径完成初步判断;只有进入不确定区域的声明,才触发外部医学证据核查流程。这种以不确定性驱动核查的机制,使系统能够将有限的检索和推理资源集中投入最需要复核的边界案例,在降低漏报的同时控制无效预警。
进入核查路径后,MedGuard的规划器会将医学声明转化为结构化检索任务,明确核心医学实体、适应证/禁忌证约束,以及对应的疾病或药物知识领域。检索器在由六类权威中文医学资源构建的知识底座中获取相关证据,该知识底座包含16535条疾病记录与187738条药物记录。
总结器进一步抽取与声明直接相关的证据片段,保留剂量、禁忌证、相互作用和定量指标等关键事实。与单次检索后生成不同,MedGuard会显式判断当前证据是否充分:若证据缺失、相关性不足或无法支撑结论,规划器会分析失败原因,调整检索策略并再次触发检索与总结,直到获得足以支撑判断的证据。
最终,推理器联合医学声明与精炼证据,输出Risk/No Risk结论、解释和证据链,形成声明理解→不确定性判断→证据检索→证据评估→最终判断的闭环验证能力。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.