![]()
计算病理学通过对数字化全切片病理图像(whole-slide images,WSIs)进行精准定量分析,为癌症早期诊断、治疗规划和预后评估提供了重要支持。近年来,随着视觉-语言多模态语言大模型(multimodal large language models,MLLMs)的快速发展,病理图像分析从传统的特征提取逐步拓展至自然语言交互。然而,现有病理MLLM大多仍局限于单个图像块(patch),难以整合全切片当中不同区域的信息,限制了模型在肿瘤分型、鉴别诊断和病理报告生成等全切片任务中的应用。
构建具备全切片理解能力的MLLM面临两项关键挑战:首先在数据可及性上,尽管已有大量包含诊断标签或原始报告的WSI数据,但仍然缺乏能够将切片成像、病理描述与临床问题进行有效关联的高质量指令数据。其次在计算效率上,WSI通常达到千兆像素级,如何在保留细粒度病理特征的同时,根据具体问题高效整合全切片信息,仍带来显著的计算和建模挑战。
2026年9月1日,来自斯坦福大学、上海人工智能实验室、上海创智学院和厦门大学等机构的联合研究团队,在Nature Cancer在线发表题为SlideChat is a multimodal generative artificial intelligence assistant for whole-slide computational pathology across cancer types的研究论文,开发了面向多癌种全切片计算病理的多模态生成式人工智能助手SlideChat。SlideChat基于大规模全切片指令数据集SlideInstruction,和经病理专家审核的评测基准SlideBench,实现全切片图像理解与自然语言交互相结合,可完成切片级病理问答和报告生成等任务。
![]()
模型架构。SlideChat主要由patch-level视觉编码器、slide-level视觉编码器、线性投影模块和大语言模型组成。全切片图像首先被划分为多个patch,由patch-level视觉编码器提取细胞和组织层面的细粒度特征;随后,slide-level视觉编码器进一步建模不同区域之间的联系,整合全切片层面的组织学背景。经过线性投影模块映射后,视觉信息与用户提出的自然语言问题被共同输入大语言模型,生成与切片内容和问题语境相关的回答。此外,SlideChat还可生成问题引导的注意力热图,显示模型在回答不同问题时重点关注的切片区域,为模型输出提供可视化依据。
训练数据。为训练SlideChat,研究团队构建了大规模全切片指令数据集SlideInstruction,共包含274,233个多模态样本,覆盖24个解剖部位和31种癌症类型。其中包括8,583组WSI—文本描述数据,以及265,650组涵盖判断题、选择题、长短文本问答和多轮对话的指令数据。模型采用两阶段训练策略:首先学习全切片视觉特征与病理文本之间的对应关系,随后利用多样化问答数据开展视觉指令学习,使模型逐步获得理解和响应复杂病理问题的能力。
![]()
图1:SlideInstruction数据集与SlideChat整体架构
系统验证。为全面评估SlideChat的全切片理解能力,研究团队构建了经病理专家审核的SlideBench。该基准涵盖五个队列、33种癌症类型和27类病理任务,并从封闭式病理问答、开放式病理问答和病理报告生成三个方面进行评估。
封闭式病理问答。SlideBench-Closed共包含8,836道问题,涵盖组织形态、疾病分类与分期、生物标志物分析、预后评估和治疗相关判断等任务。与GPT-4o等代表性模型相比,SlideChat在不同队列和任务中均表现出稳定优势,总体准确率较领先基线提升19.1%。在TCGA队列的13项任务中,SlideChat取得74.12%的总体准确率,并在组织结构、病理变化、疾病分类和生物标志物分析等需要综合全切片信息的任务中表现突出。
开放式病理问答。SlideBench-Open包含129道由病理专家整理的开放式问题。SlideChat与四种对比模型生成的回答经过匿名化和随机排序后,由三位病理专家从准确性、相关性、完整性、表达清晰度和临床适用性五个维度进行盲评。SlideChat的平均得分为4.26分,接近专家参考答案的4.68分,并高于GPT-4o的3.75分及其他对比模型;在多数评价维度中,SlideChat也获得了更多“优秀”评分。
病理报告生成。SlideBench-Report包含来自4个队列的3,149份参考报告,同时覆盖域内与外部数据。研究采用METEOR和基于语义一致性的GPT评分等指标,将SlideChat与HistoGPT、PRISM等病理报告生成模型进行比较。SlideChat在多个队列和癌症类型上均取得了更好的综合表现,其中METEOR指标较现有模型提升7.7%;生成的报告在病理特征描述、诊断信息覆盖和专业表达等方面也更接近参考报告。
临床读者研究。研究团队进一步开展了前瞻性读者研究,比较病理医生在有无SlideChat辅助时的阅片表现。研究由两位资历较浅和两位资深病理医生参与,覆盖乳腺、结直肠、肺、前列腺和食管五类癌症。结果显示,SlideChat生成的报告草稿能够提升诊断摘要质量和关键诊断实体的准确性。对于资历较浅的病理医生,平均阅片时间由每张切片307.28秒缩短至248.83秒,下降约18%;不同阅片者之间的一致性中位数也由0.72提高至0.82。上述结果初步展示了SlideChat在提高阅片效率和诊断一致性方面的应用潜力。
该研究为在临床多模态的交互式理解提供了新的技术路线。Slidechat不仅为病理MLLM从局部图像分析走向全切片交互式理解的可能性,并为切片级病理问答、报告生成和辅助阅片提供了新的技术范式。未来,该模型有望进一步应用于早期肿瘤筛查,治疗方案推荐和患者预后预测等问题。
厦门大学硕士生陈莹和上海创智学院博士生马成龙为共同第一作者。斯坦福大学纪源丰博士后、上海创智学院何军军研究员和厦门大学俞容山教授为论文共同通讯作者。
论文链接:
https://www.nature.com/articles/s43018-026-01220-4
制版人: 十一
学术合作组织
(*排名不分先后)
![]()
战略合作伙伴
(*排名不分先后)
推荐直播
转载须知
【非原创文章】本文著作权归文章作者所有,欢迎个人转发分享,未经作者的允许禁止转载,作者拥有所有法定权利,违者必究。
BioArt
Med
Plants
人才招聘
![]()
点击主页推荐活动
关注更多最新活动!
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.