![]()
编辑丨&
近年来,空间蛋白组学技术让研究人员能够在完整组织中同时观察几十甚至上百种蛋白的位置分布,从而揭示肿瘤微环境中的细胞互作、治疗抵抗机制以及潜在生物标志物。
但随着数据规模不断扩大,一个新的问题也出现了:不同研究往往使用不同的蛋白标记组合、实验流程和成像平台,导致每个研究的数据都像是一张采用不同语言绘制的地图。传统分析方法通常针对单一实验体系设计,难以将一个队列中获得的知识迁移到另一个队列,也很难发现真正具有普适性的癌症标志物。
这正是人工智能基础模型可能发挥作用的地方。
在 2026 年 8 月 5 日发表于《Nature》的「The Virtual Tissues foundation model resolves spatial proteomics across scales」中,来自洛桑联邦理工学院、苏黎世大学等的研究团队提出了 VirTues(Virtual Tissues)——一种面向空间蛋白组学的基础模型,希望让不同来源的组织数据进入同一个可理解、可比较的人工智能空间。
![]()
论文链接:https://www.nature.com/articles/s41586-026-10884-y
一双理解组织结构的眼睛
要让 AI 理解如此复杂的生物组织,第一步是解决数据碎片化问题。
VirTues 建立了一套能够适应不同蛋白标记组合的编码方式。研究团队将蛋白序列信息引入模型,通过蛋白语言模型(PLM)生成每个标记的表示,使不同实验中的蛋白标记能够映射到统一空间中,而不再依赖固定的标记面板。
在模型结构上,VirTues 基于视觉 Transformer 框架进行了改造。传统模型在处理多通道空间生物数据时,计算成本会随着空间尺寸和通道数量快速增加,同时也难以理解不同蛋白标记之间的生物学联系。
![]()
图 1:VirTues 平台概述。
为了解决这一问题,研究人员设计了一种新的因子化 Transformer 结构,将注意力机制拆分为「标记注意力」和「空间注意力」两个部分:前者帮助模型理解不同蛋白之间的关系,后者关注它们在组织中的空间排列方式。
与此同时,VirTues 采用了一种结合蛋白信息和空间图像信息的新方法。模型不仅关注图像中的像素,还会结合蛋白自身的分子信息,从而能够处理训练阶段没有出现过的新标记组合,实现跨数据集迁移。
为了训练这个模型,研究团队收集了目前规模最大的开放空间蛋白组学数据资源之一:核心数据集包含 15 个成像质谱(IMC)队列,共 3102 名患者和 146 种蛋白标记;进一步扩展的数据集覆盖 32 个队列、超过 5100 名患者以及 239 种标记,并包含 CODEX、Orion 和 MIBI 等不同成像技术。
![]()
图 2:VirTues 学习组织结构和标记关系。
最终,VirTues 能够形成从分子、细胞、细胞群落到完整组织多个尺度的表示,为后续的细胞识别、组织分析、疾病预测以及生物标志物发现提供统一基础。
补全看不见的组织信息
如果说传统分析方法更像是在已有信息中寻找答案,那么 VirTues 更接近于学习组织背后的规律,并利用这些规律推测缺失的信息。
研究团队首先测试了模型是否真正理解了组织结构。他们设计了三种不同难度的遮挡任务:随机遮挡部分区域和蛋白信息;完全隐藏某一种蛋白标记;以及同时隐藏某个空间区域内的所有蛋白信号,让模型根据周围环境恢复缺失内容。
在随机遮挡任务中,模型重建结果与真实数据之间的平均 Pearson 相关系数达到 0.800±0.130,明显高于基于平均强度预测的方法。 当整个蛋白通道被隐藏时,VirTues 仍然能够根据其他蛋白之间的关系恢复目标蛋白表达模式,平均相关系数达到 0.700±0.173。
![]()
图 3:VirTues 在单细胞尺度上切割并注释组织。
研究团队进一步进行了零样本测试:将一个完全没有参与训练的新肺癌数据集输入模型,即使其中包含训练阶段没有见过的新蛋白标记,VirTues 仍然能够完成预测。对于训练中见过的标记,零样本重建平均相关系数达到 0.667。 对于新的蛋白标记,模型表现虽然下降,但仍显示出利用蛋白之间生物学关联进行推断的能力。
更重要的是,VirTues 展现出了基础模型最核心的能力——跨数据迁移。
![]()
图 4:VirTues 的临床应用:风险分层、诊断预测及通过相似性提取组织。
研究人员发现,当模型使用全部数据集训练,而不是只使用单一数据集训练时,对于稀有免疫细胞的识别能力明显提高。例如 B 细胞提升 26.4%,髓系细胞提升 34.3%,自然杀伤细胞提升 109.7%,T 细胞提升 30.2%。
在严格的零样本测试中,即使完全不使用目标数据集进行训练,VirTues 的细胞分类性能变化仍然很小。这意味着,一个在大量癌症组织数据中学习过的 AI 模型,可以像一名经验丰富的病理分析专家一样,将知识迁移到新的患者样本中。
预测患者未来
VirTues 最终的目标并不仅是分析图像,而是寻找能够帮助临床决策的信息。它能将细胞层面的空间信息整合为患者组织特征,并在更直接的临床任务中展现出巨大优势。
当然,VirTues 距离真正进入临床仍然需要更多验证。医学 AI 不仅需要准确率,还需要面对数据标准化、实验流程差异以及临床应用可靠性等问题。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.