想象这样一个场景:你去看病,医生告诉你:“今天由医学生来负责你的诊疗。他们非常能干,医学院所有考试都拿了100分,一道题都没错过。你尽可以放心。”
是不是感觉哪里不对劲?
![]()
这正是AI进入医疗领域面临的核心难题。AI在那些可以用“标准答案”训练的任务上已经表现得极其出色——给它大量数据,让它学习,然后交付任务。训练数据和算力越多,它的表现就越好。“考试表现”和“实际能力”之间的差距越小,AI就越能胜任。
医疗AI的愿景很美好:用所有能找到的临床数据训练AI,让它比人类更擅长发现问题、给出建议。这个方向值得追求,但有一个比大多数领域都棘手的挑战——如何评估“这个AI到底行不行”?
评估医疗AI,难在哪?
至少有三个原因让这件事变得复杂。
第一,医学评估本质上是主观的。临床决策很难做成标准化的训练数据集。医生做决定时带有微妙的个人习惯,这些习惯很难统一成标准。如果你用临床数据训练AI,任何基准测试都暗含着主观倾向——它衡量的是“当时那位医生做了什么”,而不是“病人是否健康活到了最后”。你的评估反映的是你在那一刻会怎么做,而不是绝对正确怎么做——医学里没有统一的“标准答案”。
第二,底层数据是保密的。所有试图构建医疗AI模型的公司都获取了各种临床和行政数据集用于训练和评估设计——可以理解,他们对这些数据守得很紧。
第三,评估和基准测试不可避免地变成营销。这不是说公司在欺骗或耍手段,而是自然会发生的事。“模型在基准测试中表现良好”这句话,更多反映的是你如何设计了这个测试,而非它在临床上的真实价值——换个模型、换个评估方式,结论可能完全不同。这本质上是一种委托-代理问题。
唯一客观的评估方式是什么?
要客观衡量模型的决策是否正确,唯一的方法是长期跟踪病人的后续情况——而这本身又是一个主观决定。这比简单地创建基准测试并对照测试要困难得多。
这也意味着,医院网络和其他AI产品买家很难真正评估谁是最好的,尤其是在缺乏统一标准的情况下。考试满分不等于临床可靠,这个道理,医疗AI行业还需要很长时间才能真正消化。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.