网易首页 > 网易号 > 正文 申请入驻

【2026ICML】Mila 魁北克 AI 研究所:PerturbDiff:基于功能扩散的单细...

0
分享至

来源:市场资讯

(来源:BioAI Frontier)

—— 核均值嵌入 × 希尔伯特空间扩散 × MMD 去噪目标 × 6100 万细胞边际预训练

一句话

• 拧巴的地方:单细胞测序是破坏性的——同一个细胞不可能既被看到扰动前、又被看到扰动后。所以扰动预测从一开始就是在两堆没有配对关系的细胞之间硬找映射。

• 大家的默认假设:给定细胞类型和扰动类型,响应就该收敛到一个固定的分布。可实际数据里,微环境状态、批次条件这些没被记录下来的因素,会让同一组条件下的响应分布本身就在漂。

• PerturbDiff 的换位:干脆把「细胞群的分布」整个当成随机变量。用核均值嵌入把一群细胞压成希尔伯特空间里的一个点,再在这个函数空间里跑扩散。

• 最漂亮的一处:在 RKHS 里写下的那个标准 L2 去噪损失,展开之后正好等于 MMD——不是外面塞进来的正则项,是从构造里自己掉出来的。

• 为什么值得关心:它给的不是一个预测,而是一族可能的响应。这意味着模型能告诉你哪些实验值得多做几次重复——详见第六节。

一、破坏性测序留下的那道坎

高通量单细胞扰动测序这几年把细胞因子、药物、基因编辑三条线都铺开了:一次实验上千种处理条件已经不稀奇。但可干预的空间——基因 × 药物 × 剂量 × 细胞背景——是组合式膨胀的,再怎么做实验也穷举不完。这就是「虚拟细胞」这一类模型存在的理由:把没做过的扰动算出来。

麻烦在于监督信号的形态。测序会把细胞裂解掉,你拿不到「这个细胞扰动前长这样、扰动后长那样」的配对样本,只能拿到两堆细胞:对照的 X_ctrl 和处理的 X_pert,两边没有一一对应关系。于是任务被迫写成分布到分布的映射。

现有方法大致分三层。最直接的是细胞级确定性映射:随机把对照细胞和处理细胞配上对再回归,线性模型、GEARS、scGPT 都属于这一类——随机配对决定了它们学到的其实是「平均效应」。第二层是概率生成模型,scGen 把扰动当成 VAE 隐空间里的一次平移,CPA 进一步把扰动和生物协变量解耦,Squidiff 用扩散去抓非线性效应。第三层是群体级方法,绕开随机配对直接对齐两个分布:CellOT 走最优传输,STATE 用核判别目标做对齐,CellFlow 学连续时间的流场,Unlasting 用扩散桥。

这三层的共同点是:一旦条件 (c, τ) 给定,目标分布 P(c,τ) 就是唯一的。而这篇论文要挑的恰恰是这个前提。同一批 PBMC,同一种细胞因子,今天这管和明天那管的响应分布并不重合——细胞处在静息态还是激活态、这批测序的技术条件如何,这些都没进条件变量,但它们实实在在地把响应推到了不同的位置。把这些差异一股脑平均掉,得到的是一个谁都不像的「中间态」。


1:(a) 传统设定——在无配对的对照细胞和处理细胞之间学一个分布映射,目标只有一个;(b) 真实情形——未观测的潜在因子(静息 / 激活 / 急性)诱导出一族不同的细胞分布,建模对象随之变成「细胞分布的分布」。

二、先说人话:这事到底难在哪

打个比方。传统做法像是给你一张某人 20 岁的照片,让你画出他 40 岁的样子。但在单细胞这边,你手里根本没有「某个人」——你有的是一群 20 岁的人和一群 40 岁的人,而且这两群压根不是同一批。更麻烦的是,40 岁那群人在什么环境里长起来、中间经历过什么,你并不知道;换个环境,同样一群 20 岁的人会长成完全不同的另一群 40 岁的人。

所以正确的问法不是「这个细胞会变成什么样」,而是「这一群细胞的分布会挪到哪儿」。而且这个「挪到哪儿」本身还带着不确定性,是一族可能,不是一个答案。

论文的三步棋,对应到这个比方大致是:

• 第一步,把「一群」压成「一个」。用核均值嵌入把一整群细胞变成某个空间里的一个点。只有变成点,群体之间才能比较、才能做加减和插值。

• 第二步,在这些点上跑扩散。就像 Stable Diffusion 从噪声里生成一张图,这里是从噪声里生成一个「群体」。被生成的对象从图片换成了分布,框架还是那套加噪—去噪。

• 第三步,衡量生成得像不像。用 MMD——一个专门判断两堆样本是不是来自同一个分布的统计量。

有意思的是第三步不是「选」出来的。你在第一步选了核均值嵌入这个表示,MMD 就是这个表示自带的距离,推到最后它自己会跳出来。这种「不用硬凑、结构自洽」的感觉,是这篇论文读起来最舒服的地方。

三、用了什么技术、什么原理

这一节是给想动手的人看的,公式和实现细节都在这儿。只关心「能拿来做什么」的话,可以直接跳到第六节。

▍ 1. 把一群细胞压成一个点:核均值嵌入

要在「分布」上做扩散,首先得让分布住进一个能做加减法的空间。作者选的是再生核希尔伯特空间(RKHS)。给定一个正定核 k,任意分布 P 被映射成它的核均值嵌入 μ_P,这个 μ_P 是函数空间 H_k 里的一个点。换句话说,一群细胞 → 一个向量(严格说是一个函数)。

μ_P:=E_{Z~P} [ k(Z, ·) ]∈H_k

三条性质撑起了整个框架:

(i)线性μ_{αP+(1-α)Q}=α·μ_P + (1-α)·μ_Q

(ii)核几何<μ_P, μ_Q>_{H_k}=E_{Z~P, Z'~Q} [ k(Z, Z') ]

(iii) 诱导距离 ‖μ_P − μ_Q‖²_{H_k}=MMD²_k(P, Q)

第 (i) 条意味着可以在分布之间做插值,第 (iii) 条意味着这个空间里的距离天然就是 MMD。后面所有看起来很巧的地方,根子都在这三条上。

▍ 2. 在无穷维空间里跑 DDPM

有了 μ,扩散就可以照搬 DDPM 的骨架,只是被加噪的对象从有限维向量换成了函数。前向过程从扰动后的嵌入 μ_0 := μ_{c,τ} 出发,逐步注入噪声:

μ_t=√(1−β_t) · μ_{t−1}+√β_t · Ξ_t ,Ξ_t ~ N_{H_k}(0, C)(3)

闭式边际:μ_t | μ_0~N_{H_k} ( √ᾱ_t · μ_0 ,(1 − ᾱ_t) · C )(4)

ᾱ_t = Π_{s≤t} (1 − β_s)

这里的 Ξ_t 不是普通高斯向量,而是 H_k 上的高斯随机元,由均值元和一个自伴、半正定、迹类的协方差算子 C 刻画。论文用了高斯测度在仿射变换与求和下的封闭性(附录 Lem. B.7 / B.8),证明前向链每一步仍是高斯,因而 (4) 式那个熟悉的闭式边际在无穷维下依然成立。DDPM 的整套推导就这样被平移了过来。

▍ 3. 反向过程,以及那个自己长出来的 MMD

反向条件分布在 H_k 里同样有闭式高斯形式,但 μ_0 在生成时是未知的,没法直接采样。照 DDPM 的做法引入可学习的均值函数 μ_θ,变分推导化简后得到用 RKHS 范数写的去噪目标:

L_t∝‖ μ_0 − μ_θ(μ_t, t, μ_c, c, τ) ‖²_{H_k}(6)

H_k 是无穷维,这个式子算不了。用经验批次实例化之后:

‖ μ_0 − μ_θ ‖²_{H_k}=MMD²_k ( P̃_pert , P̃_θ )(7)

(7) 式是这篇论文的支点。左边是扩散框架里那个再标准不过的重构损失,右边是群体对齐里那个再常用不过的 MMD——两者不是「我选了 MMD 当损失」,而是同一个东西的两种写法,由性质 (iii) 直接给出。训练时,μ_0 由一批真实的扰动细胞 B_pert 实例化,μ_c 由一批对照细胞 B_ctrl 实例化,网络吐出一批预测细胞 B_θ,三者都是对应核均值嵌入的蒙特卡洛估计,批量 m 越大越准。

为什么非要 MMD 不可,消融那节给了很直白的答案:单细胞表达矩阵极度稀疏——PBMC 超过 95% 的表达值是零,Replogle 也超过 60%。逐点 MSE 在这种数据上会被「双方都是零」的位置淹没,梯度大部分花在了没有信息量的地方。实践中作者仍保留了一个 MSE 项,但明确说明优化是被 MMD 主导的,MSE 只是在全局质心上加了个弱约束:

L_total=MMD²_k( P̃_pert , P̃_θ )+(1/m) · Σ_j ‖ x_j − x_θ_j ‖²_2(8)

▍ 4. 无穷维的高斯噪声,怎么真的采出来

(3) 式要求从函数值高斯测度里采样 Ξ_t,这件事本身不可计算。作者绕的这一下我觉得挺聪明:不在 H_k 里采,而是回到原始细胞空间,给批次里每个细胞独立加高斯噪声,然后重新计算经验核均值嵌入。附录 B.1.7 证明了,在核特征映射的一阶线性化下,这个操作确实诱导出一个 H_k 上的高斯随机元,而且它的协方差算子可以被显式写出来(Prop. B.14)。于是一个理论上无从下手的采样问题,被换成了一行加噪代码。

采样端同理:既然 H_k 不可计算,推断时就用 DDIM 在细胞空间里做确定性采样,与训练过程保持一致。

▍ 5. 网络:双流 MM-DiT + AdaLN-Zero + 无分类器引导

去噪网络要同时吃下扰动批和对照批,作者用的是 MM-DiT——从图像生成那边(Stable Diffusion 3)搬过来的多模态扩散 Transformer。它维持两条并行的 token 流,在每个 block 内通过 joint attention 交互。这个结构的含义是:扰动效应被表示成相对于对照分布的结构化偏移,而不是凭空生成一个新分布。

• 条件注入:时间步 t 与协变量 (c, τ) 的嵌入合并后,经 AdaLN-Zero 打进每一个 block,是 DiT 的标准做法。条件包括细胞类型、实验批次、扰动类型三路。

• 无分类器引导:训练时以概率 p_drop 把条件替换成空 token;采样时在条件与无条件预测之间线性外推,x̂ = (1+w)·x_cond − w·x_uncond,用w 调节条件的强度。

▍ 6. 边际预训练:先学细胞长什么样,再学扰动怎么推

扰动数据集的细胞类型往往很窄(Replogle 只有 4 种细胞系),但无扰动的单细胞图谱覆盖面大得多。作者据此加了一个预训练阶段:先只条件在细胞背景 c 上,学未扰动的边际细胞分布 D_c ~ F_θ(· | c),再到扰动数据上微调,去学扰动带来的分布偏移。

预训练语料是三个扰动集的全部训练细胞,加上 CellxGene 的 6090 万个单细胞——覆盖 662 种细胞类型、10,887 个实验批次。跨数据集的基因空间用 merge-then-select 统一,最终留下 12,626 个基因。这里有个数字值得记住:PBMC 和 Tahoe100M 与该基因集的重叠超过 98%,而 Replogle 和 CellxGene 只有 45% 出头。后面 Replogle 上的表现,多少和这个数字有关。


图2:框架总览。(a) 细胞空间里的分布值随机变量经核均值嵌入映射为希尔伯特空间中的点 μ_c,τ 与 μ_c;(b) 扩散定义在扰动嵌入 μ_0 := μ_c,τ 上,去噪网络预测目标 μ_θ;(c) 每个 MM-DiT block 在对照流与扰动流之间做 joint attention,条件经 Modulation 注入。

四、拿什么数据、用什么尺子量

三个基准分别对应三类扰动,评测协议全部沿用 STATE 的划分,统一预测 2000 个高变基因:

数据集

扰动类型

细胞数

扰动数

细胞类型

实验批次

PBMC

细胞因子

9.7 M

90

18

12

Tahoe100M

小分子药物

101.2 M

1,137

50

14

Replogle

基因(CRISPRi)

0.6 M

2,023

4

56

CellxGene

无扰动(预训练)

60.9 M

662

10,887

表1:数据规模与多样性。Tahoe100M 的多重「细胞村」实验设计显著压低了批次效应;Replogle 平均每个基因扰动只有约 300 个细胞,是天然的低数据场景。

指标沿用 Cell-Eval 框架再补上 CellFlow 的 R²,一共 14 个,分两组看:

• 平均表达精度——R²、Pearson Delta 相关(PDCorr)、MAE、MSE,以及扰动判别分数 PDS_L1 / PDS_L2 / PDS_cos。衡量预测的平均表达偏移对不对。

• 差异表达模式——DE 重叠(DEOver)、DE 精确率(DEPrec)、方向一致性(DirAgr)、log 倍数变化的 Spearman 相关(LFCSpear)、AUROC、AUPRC、效应量相关(ES)。衡量预测出来的细胞有没有抓住真实的差异表达格局。

作者的立场很明确:后一组更重要。扰动建模的核心是复现有生物学意义的基因响应,而不是把平均表达水平对上——这一点在结果里会反复出现。对照方法覆盖了简单基线(Mean、Linear,这两个此前被证明能打败包括 scGPT、scFoundation 在内的不少模型)和主流扰动模型(CPA、STATE、CellFlow、Squidiff),Unlasting 因为没有公开代码被排除。

五、结果:赢在哪儿,输在哪儿

▍ 1. 总体:大数据集上全面领先,小数据集上从头训练略逊

从头训练的 PerturbDiff 在 PBMC 和 Tahoe100M 上几乎所有指标都排第一,在规模最小的 Replogle 上排第二。增益最集中的地方是 DE 类指标,尤其是 AUPRC 和 AUROC——这正是把建模对象换成分布之后应该受益的地方:它反映的是群体层面的响应格局,而不是均值对齐。


3:三个数据集上八种方法 × 12 个指标的雷达对比,轴向外为优。左起依次为 PBMC、Tahoe100M、Replogle;蓝线为从头训练版本,绿线为预训练+微调版本,橙线为 STATE。

值得一提的是简单基线的不稳定:Linear 在 Tahoe100M 上很能打,到了 Replogle 三个 PDS 指标齐刷刷掉到 0.5 上下,和随机预测差不多;Mean 在 PBMC 上表现尚可,换到 Tahoe100M 后 AUPRC 和 AUROC 也逼近随机。反过来说,一个方法只在单个数据集上好看,基本说明不了问题。

▍ 2. 逐扰动看:不是被少数几个条件拉上去的

总体指标容易被极端样本带偏,所以作者把每个留出扰动条件单独画成散点。在 DE 类指标上,从头训练的 PerturbDiff 对 STATE 的胜率在 96%–100% 之间——PBMC 的 62 个条件里 100% 获胜,Tahoe100M 的 735 个条件里 99% 获胜。这是相当干净的结果。


4:AUROC 的逐条件散点。横轴为 STATE,纵轴为 PerturbDiff(从头训练),每个点是一个留出扰动条件;点落在对角线上方即代表本方法更优。左 PBMC(62 个条件),右 Tahoe100M(735 个条件)。

▍ 3. 更有意思的一张图:STATE 的系统性过度自信

这一节我认为是全文最有说服力的部分。Cell-Eval 用 Wilcoxon 秩和检验、p_adj < 0.05 判定差异表达基因,作者把真实数据、PerturbDiff、STATE 三者的 −log10(p_adj) 分布画在一起。

真实数据里,DE 基因和非 DE 基因的分布应该是分开的。PerturbDiff 复现了这种分离,曲线形状贴着真值走;而 STATE 给大量基因都赋了很大的 −log10(p_adj),包括本来不该显著的那些——图 5(b) 里,STATE 在非 DE 基因上还在 300 附近顶起一个鼓包。翻译过来就是:它倾向于把几乎所有基因都判成差异表达。这种系统性的过度自信,在汇总指标上未必吃亏,但它说明模型学到的不是扰动驱动的差异格局。


图5:PBMC 上 −log10(p_adj) 的密度分布。左为真实 DE 基因,右为真实非 DE 基因;蓝为真实数据、橙为 PerturbDiff、绿为 STATE。右图中绿线在高值区的隆起即为误判。

▍ 4. 预训练确实带来了可迁移的先验

零样本探针是个很直接的检验:预训练模型完全没见过扰动监督,直接拿去预测,R² 也远高于随机初始化,并且随预训练步数稳定上升(PBMC 尤其明显)。这说明扰动并不是把细胞推到表达空间里任意一个角落——扰动引起的偏移,部分地与无扰动数据里已经编码好的结构化方向重合。这个结论本身比性能数字更值得琢磨。


6:零样本 R² 随预训练步数的变化(虚线为随机初始化基线,内嵌小图为线性纵轴)。左 PBMC,右 Replogle。

低数据场景下的收益更实在。Replogle 本身就是天然的低数据设定(平均每个基因扰动约 300 个细胞),从头训练打不过 STATE,预训练+微调后追平。受控实验则把 PBMC 按 1% 和 5% 的比例下采样(保证所有扰动类型都还在):两个比例下,微调版本在全部指标上都明显优于从头训练,且随着数据比例上升,两者差距如预期地收窄。


7:PBMC 下采样实验。蓝线为预训练+微调,橙线为从头训练;左为 1% 采样比例,右为 5%。

▍ 5. 一个反直觉的结论:堆规模并不奏效

scaling 研究里,模型从 31M 扫到 410M,训练算力跨一个数量级,结论是两个维度上都不单调。中等规模的 114M 最稳、最好;239M 在中等算力处见顶后开始退化,是典型的过拟合曲线。作者据此说明:扰动建模受益于适中的容量和算力,而不是一路加大——这也正是他们做边际预训练的动机:与其暴力堆参数和混数据,不如去提取可迁移的生物学先验。


8:DEOver(左)与 DEPrec(右)随训练算力(FLOPs)与模型规模的变化。颜色由浅到深对应 31M 到 410M,曲线在中段见顶后回落。

▍ 6. 消融:抽掉 MMD,DE 指标立刻塌

把 (8) 式里的 MMD 项去掉,只留 MSE,两个数据集上性能一致下降,DE 类指标掉得最狠——PBMC 上 ES 从 0.39 掉到 0.03,Replogle 上 AUPRC 从 0.31 掉到 0.15。结合前面说的稀疏性(95% / 60% 的零值),这条消融基本坐实了作者的判断:在稀疏高维的单细胞数据上,逐点 MSE 是个很差的对齐目标。


9:MMD 目标的消融。蓝线为完整 PerturbDiff,橙线为去掉 MMD 项。左 PBMC,右 Replogle。

六、以后能用它来做什么

论文本身是方法学的,没做任何湿实验。但这类模型真正的价值不在跑分,而在改变实验怎么安排。下面几条,前三条是论文数据直接支撑的,后两条是我顺着方法特性推的,标注了出处,读的时候分开看。

▍ 1. 把实验预算花在刀刃上

先看组合空间有多大。Tahoe100M 一个数据集就是 1,137 种药 × 50 种癌细胞系,光是「药 × 背景」的配对就接近 5.7 万,再乘上剂量维度还要翻几倍;Replogle 那边是 2,023 个基因 × 4 种细胞系。而实际能做的实验永远只有其中一小块。

所以模型的现实定位不是「替你做实验」,而是「替你排序」:把上万个候选组合先算一遍,按预测的响应强度和方向排个序,再拿最有希望的几百个去做湿实验,做完的结果回灌重训,下一轮排得更准。这是一个主动学习的循环,模型不需要多准,只需要比随机挑选好得多——DE 精确率 0.58 听起来不高,但相对随机是量级上的节省。

▍ 2. 给出的不是一个答案,而是一个范围

这一条是 PerturbDiff 相对同类方法最独特的地方,也是我认为最被低估的用处。既然它建模的是「分布的分布」,那么对同一组条件反复采样,得到的就是一族可能的响应分布,而不是一个点估计。这族分布有多分散,本身就是信息。

往下能接的事情就很具体了:某个扰动如果预测出来的响应族散得很开,说明它对未观测因素(微环境状态、批次条件)高度敏感——这种实验值得多做几个重复、多设几个批次,否则单次结果很可能不可复现;反过来,响应族很集中的扰动,做一次大概就够了。把有限的重复次数分配到真正不稳的地方,这是别的方法给不出来的判断。

▍ 3. 小队列也能上手——这条对临床样本最实在

下采样实验里,PBMC 只留 1% 和 5% 的细胞,预训练+微调版本在全部指标上碾压从头训练;Replogle 这种平均每个扰动只有约 300 个细胞的天然低数据集,也是靠预训练才追平 STATE。

这件事的意义在于:公开图谱动辄千万上亿细胞,但真到了临床队列,几十个病人、每人几千个细胞就是常态,原代细胞、患者来源类器官、罕见细胞类型更是稀缺。「先在无扰动的大图谱上学细胞长什么样,再用少量自有数据微调」这条路,对拿不到海量数据的实验室是有实际操作性的——尤其权重和数据现在都在 HuggingFace 上摆着。

▍ 4. 靶点筛选与药物重定位

论文强调的泛化能力是「对未见扰动」的:训练时没出现过的扰动条件,模型也能给出预测。落到应用上,一是把 CRISPRi 屏幕虚拟地扩出去——真实屏了两千个基因,剩下的先算一遍,挑出预测能引起显著转录组重塑的再做;二是药物重定位:同一个药在不同细胞背景下的响应本来就是 Tahoe100M 的设计意图,模型可以用来问「这个药换到另一种细胞背景会怎样」。

需要泼的冷水是:这些都还停留在计算基准上。论文自己的 Impact Statement 写得很清楚——训练数据的偏差和对预测效应的过度解读都可能导出误导性的生物学结论,这类模型应当作为决策支持工具,与实验验证配合使用。这句话不是客套。

▍ 5. 两个还没做、但方法上通得过的方向

第一个是把批次从麻烦变成旋钮。实验批次本来就在条件变量里,原则上可以问「同一个扰动放到另一个批次条件下,响应会怎么偏」这类反事实问题。论文没做这个实验,但框架是支持的——而且既然潜在因子被显式建模成了分布上的随机性,这个方向比在别的架构上做要自然得多。

第二个是把条件从「细胞类型 + 批次」扩到「供体 + 疾病状态」。CellxGene 的元数据里本来就有发育阶段和疾病标签,只是这篇没用上。一旦条件里能塞进患者层面的信息,「这个病人的细胞对这个药会怎么反应」就从比喻变成了可以训练的目标。当然,这一步跨过去要面对的样本量和混杂问题,比方法本身难得多。

七、几处值得留意的地方

• 从头训练在小数据上并不占优。Replogle 上要靠预训练才追平 STATE。分布级建模需要足够的批内样本才能把核均值嵌入估准,平均 300 个细胞的条件下,蒙特卡洛估计的方差恐怕不小——这是方法本身的结构性代价。

• 微调有取舍,不是白拿的。在 Tahoe100M 上,微调版本 DE 指标继续涨,平均表达精度反而略微下滑。作者的解释是微调主要改善的是条件分布形状,而非细胞级的平均准确度。这个取舍在下游用途上是有分别的。

• 基因空间的重叠是个隐形上限。统一后的 12,626 个基因,Replogle 和 CellxGene 的覆盖只有 45% 出头。跨数据集迁移能走多远,这个数字大概率是天花板之一。

• 对比范围仍有缺口。Unlasting 因无公开代码未被纳入,而它同样是扩散桥类的分布级方法,是最直接的对照。另外全文的比较对象里没有正面对上最新的单细胞基础模型路线。

• 复现门槛不低,但东西是齐的。代码已按 MIT 协议开源(DeepGraphLearning/PerturbDiff,Hydra配置组织),微调后的 PBMC 权重和四套数据都挂在 HuggingFace 上。只是预训练用掉 6100 万细胞、扫到 410M 参数,自己从头跑一遍并不轻松。

八、技术速览一卡通

PerturbDiff 技术栈

• 建模对象:细胞群的分布本身(分布值随机变量),而非单个细胞。

• 表示:再生核希尔伯特空间中的核均值嵌入 μ_P = E[k(Z,·)],一群细胞 → 一个点。

• 生成过程:DDPM 骨架平移到 H_k,前向链注入高斯随机元,闭式边际由高斯测度的仿射封闭性保证。

• 损失:RKHS 去噪目标经批次实例化后恒等于 MMD²;辅以一个弱 MSE 项约束批次质心。

• 噪声实现:细胞空间逐细胞加噪 + 重算经验嵌入,在核特征映射一阶线性化下等价于 H_k 上的高斯随机元。

• 网络:MM-DiT 双流 joint attention(对照流 / 扰动流)+ AdaLN-Zero 条件注入 + 无分类器引导。

• 采样:DDIM 确定性采样,在细胞空间执行。

• 预训练:CellxGene 6090 万无扰动细胞 + 三个扰动集训练细胞,先学边际细胞分布再微调。

• 核心结论:DE 类指标全面领先,逐条件胜率 96–100%;低数据场景靠预训练取胜;规模化收益非单调,114M 最优。

• 能拿来做什么:上万组合的虚拟预筛排序、响应不确定性评估(指导重复次数)、小队列迁移。论文明确其定位是决策支持工具,须与实验验证配合。

一句话记住它:别问「这个细胞会变成什么样」,问「这一群细胞的分布会挪到哪儿」——而挪到哪儿,本身也是个随机变量。

PerturbDiff: Functional Diffusion for Single-Cell Perturbation Modeling. arXiv:2602.19685(2026-02-23)

Xinyu Yuan, Xixian Liu, Ya Shi Zhang, Zuobai Zhang(Mila – Québec AI Institute / Université de Montréal);Hongyu Guo(University of Ottawa, National Research Council Canada);Jian Tang(Mila / Université de Montréal / HEC Montréal, CIFAR AI Chair)

代码:github.com/DeepGraphLearning/PerturbDiff(MIT);权重与数据:HuggingFace katarinayuan/PerturbDiff_release_ckpt、katarinayuan/PerturbDiff_data。本文插图均来自原文。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
央视五套今日焦点赛事!CCTV5直播:中国女排面临重大考验,力争连胜

央视五套今日焦点赛事!CCTV5直播:中国女排面临重大考验,力争连胜

运动小看台
2026-08-24 06:51:37
刚到手的房子竟发霉发臭!一家五口绷不住了

刚到手的房子竟发霉发臭!一家五口绷不住了

看看新闻Knews
2026-08-23 19:38:06
仅剩最后1年!国防部亮底牌了,官方连发3大动作,解放军剑指台海

仅剩最后1年!国防部亮底牌了,官方连发3大动作,解放军剑指台海

老嫅尾声体育解说
2026-08-23 22:11:38
看那英演唱会的明星里,我最不理解的就是马思纯了,很惊讶马思纯现在的状态

看那英演唱会的明星里,我最不理解的就是马思纯了,很惊讶马思纯现在的状态

手工制作阿歼
2026-08-24 06:22:41
日本全面叫停种植牙?种牙潜藏的风险与后遗症,一次为你讲明白

日本全面叫停种植牙?种牙潜藏的风险与后遗症,一次为你讲明白

健康科普365
2026-08-13 14:30:15
10年跌9成产量!中国葡萄酒死磕“又酸又涩”,终被消费者抛弃?

10年跌9成产量!中国葡萄酒死磕“又酸又涩”,终被消费者抛弃?

阿振观点
2026-08-23 05:37:52
特斯拉官网更新:中国被移出FSD可使用地区

特斯拉官网更新:中国被移出FSD可使用地区

新浪财经
2026-08-21 18:32:03
荷兰时报:美国禁止ASML向中国销售所有光刻机,荷兰大臣已提出反对意见,但无法阻止法案推进

荷兰时报:美国禁止ASML向中国销售所有光刻机,荷兰大臣已提出反对意见,但无法阻止法案推进

逍遥漠
2026-08-23 17:29:54
殷秀梅现身那英北京演唱会,70岁状态超好超漂亮,可惜没孩成遗憾

殷秀梅现身那英北京演唱会,70岁状态超好超漂亮,可惜没孩成遗憾

娱人细品
2026-08-23 17:32:03
离谱!穆里尼奥彻底看走眼!皇马巨星灾难级表现坑惨全队

离谱!穆里尼奥彻底看走眼!皇马巨星灾难级表现坑惨全队

澜归序
2026-08-24 08:31:16
炸裂!火箭捡漏捡到未来超巨?小布伦森一战封神

炸裂!火箭捡漏捡到未来超巨?小布伦森一战封神

宝哥精彩赛事
2026-08-24 00:03:27
新型养老火了,不用去养老院,也不用拖累子女,太合适了

新型养老火了,不用去养老院,也不用拖累子女,太合适了

蝉吟槐蕊
2026-08-21 13:20:51
字母哥:如果雄鹿还愿意要我,我希望结束热火生涯后重返球队

字母哥:如果雄鹿还愿意要我,我希望结束热火生涯后重返球队

懂球帝
2026-08-23 23:42:18
泽连斯基首次详解费部长和西帅双双撤职原因

泽连斯基首次详解费部长和西帅双双撤职原因

YY团长
2026-08-23 20:14:57
你见过最毁三观的事是什么?网友:吃亲家一碗面,把亲家母给勾上了

你见过最毁三观的事是什么?网友:吃亲家一碗面,把亲家母给勾上了

带你感受人间冷暖
2026-08-14 10:19:31
杜建英的"美国婚姻":中国法律不认口红印,只认红本本和DNA

杜建英的"美国婚姻":中国法律不认口红印,只认红本本和DNA

匹夫来搞笑
2026-08-24 00:20:15
菲律宾倒向了美国,新加坡倒向了美国,柬埔寨倒向了美国,越南也在倒向美国的路上,我们在东南亚经营了这么多年,为什么都没有什么用呢?

菲律宾倒向了美国,新加坡倒向了美国,柬埔寨倒向了美国,越南也在倒向美国的路上,我们在东南亚经营了这么多年,为什么都没有什么用呢?

扶苏聊历史
2026-08-22 14:00:54
中国机群一落地,埃及空军瞬间懂了:西方给不了这么顶级的阵容!

中国机群一落地,埃及空军瞬间懂了:西方给不了这么顶级的阵容!

锋芒点兵
2026-08-23 15:25:22
景甜健身被偶遇!吊带搭紧身裤腰臀比绝了,这腰臀比谁看了不羡慕?

景甜健身被偶遇!吊带搭紧身裤腰臀比绝了,这腰臀比谁看了不羡慕?

嘴角上翘的弧度
2026-08-22 11:32:31
未来国王惨遭剔除遗嘱:查尔斯二十亿转给哈里,凯特火急咨询王宫律师

未来国王惨遭剔除遗嘱:查尔斯二十亿转给哈里,凯特火急咨询王宫律师

世界王室那些事
2026-08-23 17:53:21
2026-08-24 09:48:49
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4516620文章数 9351关注度
往期回顾 全部

科技要闻

“捂脸跑”机器人火出圈,它自己想出来的

头条要闻

牛弹琴:日理万机的特朗普久久不能入睡 凌晨1点发飙

头条要闻

牛弹琴:日理万机的特朗普久久不能入睡 凌晨1点发飙

体育要闻

46岁小罗复出,为什么选了一支意丙球队?

娱乐要闻

张韶涵演唱会突发不适,本人发文道歉

财经要闻

泡泡玛特,最大的问题才刚显现

汽车要闻

刘苗苗:极狐不押注单一爆款,增长进入体系化阶段

态度原创

数码
艺术
本地
公开课
军事航空

数码要闻

Windows 11固态硬盘游戏性能实测:传统SATA与NVMe差距出乎意料

艺术要闻

我连新鲜白菜都买不起,土豪却花500万抢着买颗“烂包菜”?这世界终于疯成这样了!

本地新闻

《牛来》的一声“妈妈”,到底多少人被精神污染了

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

美国与以色列发生“罕见冲突”

无障碍浏览 进入关怀版