医疗AI的竞争格局,刚刚被改写。
8月19日,xAI旗下模型Grok 4.6在医疗智能体基准测试MedAgentBench上拿下第一名,得分约95.9%。这个基准专门评估AI在真实医疗任务中的执行能力,比如处理病历、安排检查、辅助临床决策等,比单纯问答更贴近实际应用场景。
排名公布后,xAI官方账号在社交平台发文确认了这一成绩,并称这是"最有趣的真实世界医疗智能体任务基准之一"。消息发出后迅速引发关注,相关推文浏览量已接近190万。
前三名竞争胶着,xAI占两席
从榜单数据看,前三名的差距并不大:
- 第1名:Grok 4.6,得分约95.9%
- 第2名:GPT-5.6 Sol,得分约94.7%
- 第3名:Grok 4.5,得分约93.4%
也就是说,xAI的两代模型同时进入了前三名,且与第二名OpenAI的GPT-5.6 Sol拉开了约1.2个百分点的差距。虽然幅度不算悬殊,但在医疗这类容错率极低的场景里,任何一点性能提升都可能影响实际部署决策。
为什么医疗智能体基准值得关注
MedAgentBench之所以被业内看重,在于它考察的不是模型"知道什么",而是模型"能做什么"。传统医疗问答测试往往只要求模型给出正确答案,而智能体类基准要求模型在模拟环境中完成多步骤任务——理解患者信息、调用工具、做出判断、输出可执行结果。这更接近医生助理或临床支持系统的工作方式。
Grok 4.6在这个维度上登顶,意味着它在任务规划、工具调用和医疗知识结合方面,已经具备了较强的综合能力。对于正在探索AI辅助诊疗落地的医院和医疗科技公司来说,这类成绩是评估模型实用性的重要参考。
竞争远未结束
值得注意的是,第二名GPT-5.6 Sol的得分也达到了94.7%,与榜首仅差1.2个百分点。OpenAI在医疗AI领域的积累深厚,后续版本迭代很可能进一步缩小差距。而xAI这边,Grok 4.5和4.6两代产品同时占据前三,说明其技术路线在医疗场景中具备持续竞争力。
医疗AI的竞赛,拼的不只是模型参数,更是对真实临床需求的理解深度。Grok 4.6这次登顶是一个信号,但远不是终局。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.