人工智能驱动的聊天机器人在诊断某些疾病方面已经很擅长,就算是很复杂的病也能搞定。但在诊断后指导治疗和护理方面,聊天机器人表现如何?例如,病人手术前多久得停掉医生开的血液稀释剂?如果患者过去对同类药物有过不良反应,他们的治疗方案是否应该改变?
这类问题没有标准答案——得靠医生自己拿主意。
乔纳森·H·陈博士(医学与哲学)、医学助理教授及其研究团队正在探索聊天机器人(一种大型语言模型)是否能有效回答这种需要细琢磨的问题,以及有聊天机器人帮忙的医生是否表现更佳。
结果证明,两个问题的答案都是:能,而且效果更好。研究团队测试了聊天机器人在面对多种临床决策困境时的表现。单靠聊天机器人自己,其表现就优于只能上网查资料和翻医学书的医生;而来自美国多个地区和机构的医生,在拿到自己的LLM后,就能跟聊天机器人打个平手。
"多年来我一直说,人机结合会比任何单独一方做得更好,"陈说。"我认为这项研究促使我们更深入地反思,并问自己:'计算机擅长什么?人类擅长什么?'我们可能需要重新思考在哪些环节、怎么结合这些技能,以及为哪些任务用人工智能。"
一项详细阐述这些结果的研究发表在《自然·医学》上。陈与哈佛大学助理教授亚当·罗德曼博士为共同资深作者。博士后学者伊桑·高博士和罗伯特·加洛博士为共同第一作者。
聊天机器人的助力
2024年10月,陈和高带领团队进行了一项研究,该研究发表在《JAMA Network Open》上,测试了聊天机器人在诊断疾病时的表现,并发现其准确性高于医生,即便医生们自己也用聊天机器人,聊天机器人的准确性还是高于他们。
这篇论文深入探讨了医学中更难以捉摸的部分,评估了聊天机器人和医生在所谓"临床决策推理"这一类问题上的表现。
高博士这样解释其中的差异:想象你正在用手机上的地图应用导航到某个目的地。使用大语言模型诊断疾病有点像用地图定位正确的位置。而如何到达那里则是管理推理的部分——你是因为堵车而走小路吗?堵着车也继续往前开?或者干脆等着,盼着路能通?
在医疗场景中,这些决策可能变得棘手。假设一位医生偶然发现一名住院患者肺部上部有一个不小的肿块。那下一步该怎么办?
医生(或聊天机器人)应认识到,从统计上看,肺上叶的大结节具有较高的扩散到全身的概率。医生可以立即对肿块进行活检、安排稍后进行手术或安排影像检查以获取更多信息。
确定哪种方法最适合患者取决于一系列细节,首先要考虑患者已知的偏好。
患者是否不愿接受有创操作?患者病史是否显示经常不按时复诊?医院在安排复诊时是否可靠?转诊靠谱吗?陈表示,这些背景因素至关重要。
团队设计了一项试验,研究三组对象的临床决策推理能力:仅使用聊天机器人、46名有聊天机器人辅助的医生,以及46名只能使用互联网搜索和医学参考资料的医生。他们选取了五个匿名化的患者病例,将其提供给聊天机器人和医生,所有参与者均需提供书面回答,详细说明在每个病例中会采取的措施、原因以及决策时考虑的因素。
此外,研究人员邀请了一组委员会认证的医生制定评分标准,用于评估医疗判断或决策是否合理。随后根据该标准对决策进行评分。
让团队没想到的是,聊天机器人的表现优于只能上网和查医学资料的医生,它在评分表上打分项目比医生更多。不过,有聊天机器人帮忙的医生,表现和只用机器人差不多。
谁先来?
陈和同事接着研究了这一发现。光叫医生用AI还不够——关键是看怎么把这些工具融入到医疗流程里。换句话说,谁先来?医生先看,再问AI要第二意见?还是让AI先做个初步判断?
《npj数字医学》上的一篇论文里,研究团队详细介绍了随机对照试验的结果。这个试验有70名医生,他们和一个AI代理合作,评估了一堆医疗病例。团队发现,如果医生先给出判断,AI再评估,那么AI往往会顺着医生的意思,虽然让它独立判断。
结果发现,最好的办法是并行分析:医生和AI同时看病例,然后AI工具出一份摘要,对比两个判断,列出一样和不一样的地方。
斯坦福医学院的学生、这项研究的第一作者塞琳·埃弗雷特说:“基本想法就是怎么重新设计AI系统的运作,让医生和AI能更好地协作,让AI不再是工具,而是像临床队友一样合作。”
聊天机器人医生会是未来吗?
医生和聊天机器人协作到底为啥这么火,现在还有争议。使用大型语言模型会不会让医生对病例想得更深入?还是说,大型语言模型给了医生自己想不到的建议?陈说,这是未来的探索方向。
聊天机器人以及医生与聊天机器人协作取得的积极成果,引发了一个老生常谈的问题:AI医生要来了吗?
"这或许是AI的加分项,"陈说道。但结果说明医生不是被取代,而是可以欢迎AI帮忙。
"这并不意味着患者应该绕过医生,直接去找聊天机器人。不要这样做,"他表示。"网上有很多好信息,但也有坏信息。我们都得学会分辨哪些信息可信、哪些不对。这一点比以往任何时候都更重要。"
来自VA帕洛阿尔托医疗系统、贝斯以色列女执事医疗中心、哈佛大学、明尼苏达大学、弗吉尼亚大学、微软和凯撒医疗集团的研究人员共同参与了这项工作。
更多信息: 塞林·埃弗雷特等人,《从工具到搭档:医生和AI协作诊断的随机对照试验》,npj Digital Medicine(2026年)。DOI: 10.1038/s41746-026-02545-1
来源:斯坦福大学医学中心
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.