网易首页 > 网易号 > 正文 申请入驻

解放军总医院联合南大、吉大等机构,提出首个「脊柱诊疗大模型」

0
分享至

本研究由解放军总医院牵头,联合浙江大学医学院附属第二医院、复旦大学附属华山医院等共 11 家国内顶尖三甲医院,携手南京大学、吉林大学两所重点高校,并汇聚 Pi3Lab、上海三友医疗器械股份有限公司等产学研多方力量,共同完成了首个面向脊柱诊疗领域的大模型研发。

论文共同第一作者包括赵明、董文辉博士、张阳医生,核心贡献者包括来自浙江大学医学院附属第二医院的陈其昕教授、夏顺楷医生,以及复旦大学附属华山医院的马晓生教授、管韵致医生等。通讯作者为解放军总医院骨科医学部副主任孙天胜教授,共同通讯作者为南京大学智能科学与技术副院长单彩峰教授。

脊柱疾病影响全球 6.19 亿人,是致残的主要原因之一 。然而,现有 AI 模型在临床决策中仍存在「认知鸿沟」。缺乏椎体级别(level-aware)、多模态融合的指令数据和标准化基准,是制约 AI 辅助诊断的关键瓶颈。

本文提出了一套统性的解决方案,包括首个大规模、具有可追溯性的脊柱指令数据集 SpineMed-450K,以及临床级评测基准 SpineBench。基于此训练出的专科大模型 SpineGPT,在所有任务上均实现了显著提升,仅仅 7B 参数量,全面超越了包括 GLM-4.5V 和 Qwen2.5-VL-72B 在内的顶尖开源大模型 。

  • 论文地址:https://arxiv.org/pdf/2510.03160

临床痛点:通用 LVLM 的「认知鸿沟」

脊柱疾病的临床诊疗,需要复杂的推理过程:整合 X 光、CT、MRI 等多模态影像的发现,并将病灶精确定位到特定的椎体层面(Level-Aware Reasoning),以确定严重程度并规划干预措施 。这种集成推理能力,是现有通用视觉 - 语言大模型(LVLMs)的系统性弱点 。

在 SpineBench 的评测中,这一弱点暴露无遗 :

  • 性能差距明显:即使是参数量达 72B 的 Qwen2.5-VL-72B,平均性能也仅为 79.88%。领先的开源模型 GLM-4.5V (83.26%) 与顶尖专有模型 Gemini-2.5-Pro (89.23%) 之间仍存在近6 个百分点的差距。在医疗报告生成任务中,更是差距明显,Qwen2.5VL-72B 和 Gemini-2.5-pro 差 30%。
  • 跨模态对齐缺陷:几乎所有模型在多模态任务上的性能都有不同程度的下降 。例如,GPT5 在纯文本 QA (87.41%) 与图像 QA (79.97%) 之间的差距高达7.44 个百分点 。这反映了现有模型在医学图像理解和视觉 - 语言对齐上的根本不足,限制了它们在需要综合分析图像和文本的临床场景中的应用。

核心成果:构建临床级 AI 的「基础设施」

为填补现有数据与临床需求之间的认知鸿沟,研究团队与实践中的脊柱外科医生共同设计和构建了 SpineMed 生态系统。

1. SpineMed-450K:椎体级、多模态指令数据集

这是首个明确为椎体级推理而设计的大规模数据集。

  • 规模与来源:包含超过 450,000 条指令实例。数据来源极其丰富,包括教科书、外科指南、专家共识、开放数据集(如 Spark、VerSe 20202020),以及约 1,000 例去识别化的多模态医院真实病例。真实病例来源于国内 11 家知名医院,确保了患者来源的多样性 。
  • 生成管线:数据生成采用了严谨的「临床医生介入」(Clinician-in-the-loop)流程。该流程涉及:

——使用 PaddleOCR 提取图文信息;

——通过新型的图像 - 上下文匹配算法,将图像与其周围的文本上下文精确绑定,保证可追溯性;

——利用LLM 两阶段生成方法(起草和修订)来生成高质量的指令数据,且临床医生参与了提示词策略和修订标准的审查。

  • 任务多样性:涵盖四种类型——多项选择 QA(249k)、开放式 QA(197k)、多轮诊疗对话(1.1k)和临床报告生成(821 例)。数据覆盖七个骨科亚专科,其中脊柱外科数据占比 47%,并细分为 14 种脊柱亚疾病。

2. SpineBench:首个临床显著性评估基准

SpineBench 是一个与临床深度结合的评估框架,旨在评估 AI 在细粒度、以解剖为中心的推理中犯下的、在实践中至关重要的错误类型。

  • 基准构成:最终包含 487 道高质量多项选择题和 87 个报告生成提示 。
  • 严谨验证:为确保评估集的完整性,由17 名骨科外科医生组成的团队,分成三个独立小组进行了严格的验证和校正。
  • 报告评估:针对临床报告生成任务,设计了由专家校准的框架。评估从五大板块、十个维度进行:

  1. 结构化影像报告(SIP):评估发现的准确性、临床意义和定量描述 。
  2. AI 辅助诊断(AAD):评估主要诊断的正确性、鉴别诊断和临床推理 。
  3. 治疗建议(TR):分为患者指导(语言清晰度、共情、安抚)、循证计划(理由、指南一致性)和技术可行性(手术细节、并发症预防)。
  4. 风险与预后评估(RPM):评估围手术期管理、随访安排和潜在问题策略 。
  5. 推理与免责声明(RD):评估证据覆盖范围、相关性、细节粒度和逻辑连贯性。

实验结果:专科 AI 模型 SpineGPT 的突破性表现

SpineGPT 基于 Qwen2.5-VL-7B-Instruct 模型,通过课程学习(Curriculum Learning)框架,分三阶段在 SpineMed-450K 上进行微调,以逐步增强其在脊柱健康领域的适用性和专业性 。

1.超越开源,逼近顶尖专有模型:SpineGPT 达到了87.44%的平均分,大幅领先所有开源大模型 4.18 个百分点以上。在纯文本 QA 任务上(89.46%),SpineGPT 甚至超越了所有参评模型,包括 GPT5 (87.41%) 。

2.专科数据的重要性(消融实验):

  • 模型仅在通用医疗数据上训练时,性能显著下降(74.95% vs 65.31%)。
  • 纳入精心策划的非脊柱通用骨科数据后,性能得到大幅提升(82.14% vs 74.95%),验证了领域对齐训练数据的重要性。
  • 最终,纳入脊柱特异性训练数据(包括对话、报告生成和长链推理指令)后,模型性能进一步增强至 87.89%。

3.临床报告能力显著增强:SpineGPT 在医疗报告生成任务上的总分为87.24分,而 Qwen2.5-VL-72B 仅为 63.80 分,ChatGPT-4o 为 64.04 分。

  • 案例对比:在对「青少年特发性脊柱侧凸」病例的分析中,SpineGPT 提供了包含 72 个详细的临床处理流程,涵盖了完整的影像发现、AI 诊断、患者和医生导向的治疗建议、风险管理和术后问题管理。相比之下,ChatGPT-4o 的报告则更偏向于适合一般医疗文档的基本诊断和治疗建议。

4.人类专家高度认可:人类专家对报告评分与 LLM 自动评分之间的Pearson 相关系数达到 0.382 至 0.949,大多数维度相关性在 0.7 以上。这有力地验证了 LLM 自动评分作为专家判断代理的可靠性。

结论与展望

这项研究证明了:对于脊柱诊断这样需要复杂解剖推理的专业领域,专科指令数据和「临床医生介入」的开发流程是实现临床级 AI 能力的关键。

SpineMed-450K 和 SpineBench 的发布,为未来的 AI 研究提供了一个高实用性的基线。研究团队计划将拓展数据集、训练大于 7B 参数的模型,并结合强化学习技术,继续深化与领先专有模型的直接比较,以确立更清晰的性能基准。

Pi3Lab 介绍

Pi3Lab 专注于 AI Agent 的行业落地,致力于通过 RLaaS 平台让通用模型在实际业务中真正低成本、高效率地用起来。目前我们正在招聘 RL RA(强化学习研究助理),欢迎投递简历:wenhui.dong@pi3lab.com

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
王虹、邓煜获2026菲尔兹奖:两位北大同届生的数学之路

王虹、邓煜获2026菲尔兹奖:两位北大同届生的数学之路

DeepTech深科技
2026-07-23 22:20:29
事发上海市区!黄鼠狼频繁出没,专往私家车里钻,发动机盖板被咬出大洞,还啃断线路、放臭屁

事发上海市区!黄鼠狼频繁出没,专往私家车里钻,发动机盖板被咬出大洞,还啃断线路、放臭屁

新民晚报
2026-07-23 11:48:56
创造奇迹!随着中国3-2美国,女排总决赛四强出炉,具体对阵如下

创造奇迹!随着中国3-2美国,女排总决赛四强出炉,具体对阵如下

侃球熊弟
2026-07-23 21:45:30
电池界“卷王”来了!比亚迪把汽车电池塞进电驴,雅迪爱玛躲着走

电池界“卷王”来了!比亚迪把汽车电池塞进电驴,雅迪爱玛躲着走

沙雕小琳琳
2026-07-24 02:33:40
又一个泡沫破了!文旅,成了今年最难做的生意?

又一个泡沫破了!文旅,成了今年最难做的生意?

智谷趋势
2026-07-21 16:36:34
重磅!曝朱芳雨可能卸任广东男篮总经理 任期内曾助队完成3连冠

重磅!曝朱芳雨可能卸任广东男篮总经理 任期内曾助队完成3连冠

醉卧浮生
2026-07-23 19:56:10
王毅一句“坐太远了”把菲律宾外长逗笑,可后面的话让她笑不出来

王毅一句“坐太远了”把菲律宾外长逗笑,可后面的话让她笑不出来

呼呼历史论
2026-07-24 03:38:04
体育史上最伟大经纪人?富保罗理应位列顶端:詹姆斯始终信赖他

体育史上最伟大经纪人?富保罗理应位列顶端:詹姆斯始终信赖他

罗说NBA
2026-07-23 20:01:13
耐克收回线上“代理权”,滔搏暴力打折甩卖库存:原价999元/双的鞋降至599.4元/双,且能再叠加满减,“力度已超正常商业逻辑”

耐克收回线上“代理权”,滔搏暴力打折甩卖库存:原价999元/双的鞋降至599.4元/双,且能再叠加满减,“力度已超正常商业逻辑”

鲁中晨报
2026-07-23 10:00:05
出境自驾车机被锁30小时!极氪回应:不存在“车辆被锁”或“无法驾驶”等情况

出境自驾车机被锁30小时!极氪回应:不存在“车辆被锁”或“无法驾驶”等情况

每日经济新闻
2026-07-23 17:57:02
菲尔兹奖报道背后的小心思

菲尔兹奖报道背后的小心思

亮见
2026-07-23 23:02:26
谢霆锋不忍了!回应谢贤“病因”和“遗产分配”,我们都被骗了

谢霆锋不忍了!回应谢贤“病因”和“遗产分配”,我们都被骗了

叨唠
2026-07-24 00:05:14
俄罗斯高科技战机神话破灭 乌军莱曼大包围即将成形

俄罗斯高科技战机神话破灭 乌军莱曼大包围即将成形

西楼饮月
2026-07-23 21:09:58
中国外长缺席,日本外相被王毅晾一边,中方早看穿了他的小心思

中国外长缺席,日本外相被王毅晾一边,中方早看穿了他的小心思

健身狂人
2026-07-23 18:35:18
世联赛疯狂一夜,3-1,3-2,总决赛四强对阵出炉,中国女排大逆转

世联赛疯狂一夜,3-1,3-2,总决赛四强对阵出炉,中国女排大逆转

侃球熊弟
2026-07-23 22:04:45
重庆口水姐已被行政拘留,丈夫也跟着扣分罚款

重庆口水姐已被行政拘留,丈夫也跟着扣分罚款

映射生活的身影
2026-07-23 21:25:00
意图破坏国际会议氛围,泄漏燃油危害周边生态,菲律宾上演侵闯黄岩岛海域闹剧

意图破坏国际会议氛围,泄漏燃油危害周边生态,菲律宾上演侵闯黄岩岛海域闹剧

环球网资讯
2026-07-24 07:00:20
“黑吃黑”!前瑞银副总监私吞南京卖淫团伙头目约1.35亿港元,被香港高院判处10年监禁,上诉遭驳回,“生活奢靡远超合法收入”

“黑吃黑”!前瑞银副总监私吞南京卖淫团伙头目约1.35亿港元,被香港高院判处10年监禁,上诉遭驳回,“生活奢靡远超合法收入”

每日经济新闻
2026-07-23 17:58:04
“没指名道姓,可都知道他在说谁!”丘成桐采访,再提某院士逆徒

“没指名道姓,可都知道他在说谁!”丘成桐采访,再提某院士逆徒

妍妍教育日记
2026-07-21 10:40:06
卷走2000万的“山东高富帅”,引爆2026年第一大雷

卷走2000万的“山东高富帅”,引爆2026年第一大雷

金错刀
2026-07-23 14:07:49
2026-07-24 07:35:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13588文章数 142699关注度
往期回顾 全部

健康要闻

我是不是中风高风险人群?快速自测

头条要闻

女副部王峻被处理:大搞权钱交易 泄露工作秘密

头条要闻

女副部王峻被处理:大搞权钱交易 泄露工作秘密

体育要闻

勇士24岁的MVP,也是个勒布朗?

娱乐要闻

梁朝伟汤唯19年后境遇反转

财经要闻

梁文锋当不成赛博圣人

科技要闻

中国数学家王虹、邓煜获菲尔兹奖

汽车要闻

满配华为乾崑六件套 东风奕派M8限时权益价16.58万起

态度原创

艺术
手机
数码
健康
公开课

艺术要闻

这是毛主席最后一次题写的大学校名!

手机要闻

强强对决:REDMI K100系列与iQOO Neo新机,均8月见!

数码要闻

AMD展示最强AI加速器MI455X:台积电2nm工艺

我是不是中风高风险人群?快速自测

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版