![]()
一个芬兰程序员,右肩疼了两三周。不算什么大事。可能就是健身拉伤了,或者睡觉姿势不对。他去看了骨科。
医生让他拍个核磁共振。刚好诊所里就有机器。拍完,医生告诉他:肩胛下肌腱III级撕裂,超过50%的宽度。严重。需要治。几分钟之内,治疗就开始了。
他走出诊所的时候,心里有点不踏实。太快了。从拍片到诊断到治疗,像一条提前铺好的流水线。他唯一做对的事,是在离开之前跟诊所要了MRI的原始文件。266MB,几百个没有任何后缀名的DICOM文件。他不知道自己接下来会拿它们干什么,但他要了。
先让GPT看一眼治疗清单
他没直接把MRI扔给AI。他先把医生做的治疗项目清单发给了GPT-5.5 Pro。几分钟后,GPT指出了两个问题。
具体什么问题他没展开说。但从他文章里的措辞能读出来。GPT的反馈没有让他更安心。相反,它让他更想搞清楚一件事:我到底是不是真的需要这些治疗。
这一步很关键。他不是在找一个比医生更强的AI。他只是在找第二个声音。
![]()
把266MB的MRI文件喂给Claude Code
他用的不是Claude.ai的聊天窗口。是Claude Code——那个给程序员写代码的工具。区别在哪?Claude Code可以运行代码、安装软件包、处理文件,像一个真正在干活的人,不是一个只负责聊天的对话框。
他选了Opus 4.8模型,开了最高推理强度。给AI的指令简单到只有一句话:"右肩疼痛2-3周。"比医生拿到的主诉还少。
然后Claude Code开始干活了。自己装了处理DICOM文件的Python包。读了几百张片子。一个小时后,出了一份报告。
报告说:肌腱完好。没有撕裂。零。
而他的人类医生说的是:III级撕裂,超过50%宽度。
这两个结论之间的距离,不是"轻微差异"能解释的。是"有病"和"没病"的区别。
让AI当裁判
他没有就此下结论。他又做了一轮"仲裁":把人类医生的报告发给AI,把之前跟ChatGPT讨论症状的对话也发给它,让AI重新分析。
这次他换了个策略:让AI启用多个"子代理"分别独立分析,避免它们被同一个上下文带偏。AI拆解了两份报告之间的分歧点,逐个比对,从一个更像"裁判"的视角重新走了遍流程。
又过了一个小时。仲裁报告出来了。
结论:"证据支持分析者A的判断(中高置信度)。轻度肌腱附着点病变。未发现独立的局部或全层撕裂,包括肩胛下肌腱附着处。"
翻译成人话:AI觉得肌腱有点小问题,但不严重。没有撕裂。医生的诊断,大概率是过度解读了。
现在他卡在中间了
所以怎么办。信医生?III级撕裂,治了三次了,花了不少钱。信AI?一个编码工具,读了几百张医学影像,用了一个小时,说没事。
他自己写的原话是:"我现在处于一种中间状态——要么再找另一个医生碰运气,要么等着看肩膀在做康复训练的过程中能不能自己好。"
这不是一个"AI赢了"或者"医生赢了"的故事。这是一个普通人被夹在两头、不知道该往哪边走的故事。
但有意思的是后面的数字。这篇博客发出去之后,Hacker News给了395个赞,514条评论。514条。这些评论大致分成两派:"AI迟早取代医生"和"AI没经过临床验证凭什么信它"。吵了500多条。
我在想的是另一件事。
AI不是来取代医生的,但医生再也回不到"我说了算"的时代了。
FDA这两年已经批了好几款AI辅助诊断工具。谷歌DeepMind的眼科AI在某些指标上超过了人类专家。中国的医疗AI创业公司——推想科技、数坤、联影智能——早就把AI读片送进了几百家医院。
![]()
但这些都不是这篇博客讲的这件事。博客里的这个人,不是医院的AI系统在帮他。是他自己。一个会写代码的普通人,在家里,用自己的电脑,把一个编程工具硬掰成了医学影像分析仪。然后这个临时拼凑出来的东西,给出了一个跟专业医生完全相反的结论。
这不是技术的胜利。也不是技术的失败。
这是一个信号。信号的意思是:当一个有基本技术能力的普通人,可以在家里用消费级的AI工具挑战一个专业医生的诊断。不管AI对还是不对。整个"专业知识只属于穿白大褂的人"的游戏规则,已经裂了一条缝。
如果你明天拍了个MRI
你会多看一个医生吗?会的吧,第二意见嘛,很正常。
你会把片子发给GPT看一眼吗?
我猜很多人已经在做了。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.