撰文丨王聪
编辑丨王多鱼
排版丨水成文
理解、预测并最终编程细胞对内部信号和外部刺激的响应,是生物学中的最大挑战之一。虚拟细胞(Virtual Cell)作为人工智能与生物学交叉领域的一个新兴前沿,有望解决这一挑战,从而彻底改变生命科学研究范式。
预测细胞对化学(药物)扰动的响应,对于构建虚拟细胞模型至关重要,然而,实验测得的化合物仅覆盖了庞大的化学空间的极小一小部分。现有的虚拟细胞模型通常将药物分子视为孤立的标识符,而未编码其作用机制之间的关联,这导致它们难以泛化到未表征的化合物,这也成为了构建出真正虚拟细胞的一大瓶颈。
2026 年 8 月 26 日,上海交通大学人工智能学院谢伟迪副教授、张娅教授作为共同通讯作者,在 Nature 子刊Nature Machine Intelligence上发表了题为:A Knowledge-driven Framework for Predicting Single-cell Responses for Unprofiled Drugs 的研究论文。
该研究提出了一种名为MAP(Mechanism-AwarePerturbation Response Predictor,机制感知的扰动响应预测器)的知识驱动框架,通过构建大规模生物医学知识图谱(MAP-KG),首次赋予了虚拟细胞模型在“零样本”(Zero-shot)条件下预测全新、未表征药物扰动响应的能力,为虚拟药物筛选打通了关键的技术闭环。
![]()
虚拟细胞发展的瓶颈
单细胞测序和大规模扰动实验的飞速发展,让我们能够能够在细胞层面系统性刻画药物作用引发的转录组水平变化,彻底改变了我们探究药物因果作用的能力,这也为构建“虚拟细胞”(Virtual Cell)提供了关键基础。
所谓“虚拟细胞”,即能够系统性模拟和预测细胞对先前未观察到的扰动和条件下的响应(例如敲除一个基因,或添加一种药物,细胞会产生什么变化)的模型。如果这些模型准确且具有泛化能力,便可实现对大规模化学空间进行可扩展的计算模拟筛选,在实际实验之前优先确定候选治疗药物和给药策略,降低早期药物发现的成本和周期,从而彻底改变传统药物研发流程。
然而,当前的“虚拟细胞”发展存在一个致命瓶颈——巨大的化学空间与有限的实验数据之间存在鸿沟。人类已知的化学分子空间极其庞大(高达 1060 种),而现有实验手段能够详细记录其细胞效应的,只有寥寥数百种。这意味着,绝大多数化合物的生物学效应,我们几乎一无所知。
传统的人工智能(AI)方法在处理这个问题时遇到了瓶颈——它们通常把药物当作一个“标签”来处理,比如“药物A”“药物B”。如果一个药物没有出现在训练数据中,模型就无法对它做出任何有意义的预测。
该研究开发了一种机制感知的扰动响应预测器(Mechanism-Aware Perturbation Response Predictor,简称为MAP),MAP的突破在于:它不再把药物看作孤立的标签,而是学习药物背后的“语言”——化学结构、蛋白质靶点、作用机制、功能描述……然后将这些多维度的药理学知识整合到细胞响应预测中。
MAP 是如何做到的?
MAP 框架包含三个核心创新:
第一,构建了最大的药物-基因知识图谱
研究团队整合了 14 个公开数据库的信息,构建了一个名为MAP-KG的超大型知识图谱。这个图谱包含了 187089 种药物、22924 个人类基因、694246 条药物与基因之间的机制关系。这就像一张巨大的“生物互联网”,每个药物和基因都是一个节点,每条边都代表着它们之间的相互作用——比如“某种药物会抑制某个基因的表达”。
更重要的是,每条关系都被赋予了自然语言描述,而不是简单的数字编码,这让 AI 能够真正“理解”这些关系的生物学含义。
第二,多模态知识预训练
有了这张知识图谱,MAP 还需要学会如何“阅读”它。研究团队设计了一套巧妙的对比学习方法,让 AI 同时学习三种不同的“语言”:
化学语言:药物的 SMILES 分子结构式;
蛋白质语言:基因编码的氨基酸序列;
文本语言:关于药物作用机制和基因功能的自然语言描述。
通过将这些不同模态的信息对齐到同一个“语义空间”,MAP 学会了判断:“虽然这两种药物化学结构不同,但它们作用于同一个蛋白靶点,因此可能产生类似的细胞效应。”
第三,与单细胞基础模型的深度融合
最后,MAP 将学到的“药物知识”与现有的虚拟细胞模型STATE相结合,这个模型已经学会了如何解读一个细胞在未受干扰时的状态。
当输入一种药物时,MAP 会提取药物的知识嵌入向量,读取目标细胞的初始状态,结合基因层面的知识,进而预测细胞在药物作用下会发生怎样的变化。
![]()
MAP 和 MAP-KG 概述
效果验证
研究团队在多个基准数据集上对 MAP 进行了严格测试,结果令人振奋。
场景一:未见过的细胞类型-药物组合
在这种设置下,模型需要在新的细胞类型中预测一个已知药物的效果。例如,药物 A 已经在肺癌细胞中被测试过,现在要在肝癌细胞中预测它的效果。
MAP 在 Tahoe-100M 数据集上,将 Top-50 差异表达基因的皮尔逊德尔塔相关性提升了 12.3%,方向准确率提升了 11.3%。
![]()
在未见过的细胞系-药物组合上的零样本泛化性能
场景二:对从未见过药物的零样本预测
这是最具挑战性的场景——模型必须预测那些在训练数据中完全没有出现过的药物。
结果同样出色:MAP 在 Tahoe-100M 上将 Top-50 差异表达基因的皮尔逊德尔塔相关性提升了 11.8%,方向准确率提升了 17.5%。也就是说,即使面对一个全新的从未见过的化合物,MAP 也能相当准确地预测它会如何影响细胞内的基因表达。
![]()
MAP 对从未见过药物的泛化性能
场景三:虚拟药物筛选
为了验证 MAP 的实际应用价值,研究团队模拟了一个真实的药物筛选场景。他们选择了 A-549 非小细胞肺癌细胞系,从 58 种候选药物中筛选潜在的有效抗癌药物。
结果显示——
5 种已获批的抗癌药物中有 4 种被排在前 15 名;
排名第二的阿达格拉西布和排名第四的阿法替尼都是临床上用于治疗非小细胞肺癌的标准药物;
排名靠前的候选药物中,还发现了文献支持的潜在新适应症药物。
这些结果表明,MAP 不仅能够预测基因表达的变化,还能在通路层面提供有生物学意义的解读。
![]()
虚拟药物筛选
未来展望
研究团队指出,MAP 框架还有两个重要的拓展方向:
第一,超越小分子药物。目前的 MAP 主要针对小分子化合物,但其方法论完全可以扩展到基因编辑、细胞因子疗法等其他类型的干预手段。
第二,与更大规模的虚拟细胞模型融合。 随着虚拟细胞模型不断升级,MAP 作为一个“插件式”的知识增强模块,可以无缝集成到更强的虚拟细胞模型中,持续提升模型性能。
MAP 的出现,标志着 AI 在生命科学领域迈出了重要一步,它不再是简单地“记住”实验数据,而是开始“理解”生物学的基本规律。
这让我们想起 AlphaFold 在蛋白质结构预测领域的突破——当 AI 掌握了物理和化学的基本原理,它就能预测出从未被实验解析过的蛋白质结构。同样地,当 AI 掌握了药物与细胞相互作用的“语法规则”,它就能预测出从未被实验验证过的药物的效果。
虚拟细胞的梦想,也正在一步步变成现实。
而这背后,是知识图谱、多模态学习和单细胞组学三大技术的交汇融合。正如论文中所说:“生物学知识的注入,为数据驱动的扰动建模提供了一个正交且经济高效的范式。”
论文链接:
https://www.nature.com/articles/s42256-026-01286-w
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.