扩散模型做3D医学影像增强,计算开销一直是绕不开的坎。MICCAI 2026上这篇论文给出的答案是:在体素空间直接跑稀疏扩散,只用5个时间步,训练加速最高10倍,还在4个数据集上拿到SOTA。
核心洞察一句话就能说清:条件增强任务里,退化输入本身已经带了很强的解剖先验,密集噪声调度本质上是在做无用功。
![]()
密集调度为什么冗余
现有3D扩散方法普遍先压缩到潜空间来压低开销,但代价是丢失皮层褶皱、肺裂这类高频解剖细节。直接预测噪声或速度呢?输出容易偏离数据流形,得靠几百步迭代慢慢拉回来。
这篇论文换了个思路:既然输入图像已经编码了解剖结构信息,干脆把预测目标改成干净数据x,让输出全程留在流形上。这样一来,相邻时间步的输出高度相似,天然支持稀疏采样——从完整的1000步调度里均匀抽出5个时间步就够了。
x预测配速度监督,梯度稳了
直接在x空间做监督有个麻烦:噪声水平接近0时梯度消失,接近最大时梯度爆炸。论文把监督目标转到速度空间——对预测值做速度变换,用统一尺度损失监督,让稀疏调度下所有时间步拿到均匀缩放的梯度。
消融实验显示,这个组合把PSNR从19.42直接拉到31.25。预测在流形上,监督在速度空间,各司其职。
STM模块:按解剖复杂度调去噪强度
3D医学体素有明显的解剖异质性——均质肝组织和错综血管结构的去噪动力学完全不同。论文设计了结构感知轨迹调制模块(STM),用三平面结构编码器提取解剖上下文,在每个UNet残差块处以专属MLP映射为仿射参数,重新校准时间嵌入。
效果是:同一物理时间步在不同patch上诱发不同去噪强度,结构丰富区保留细节,均质区允许更激进的去噪。
4个数据集双任务SOTA
实验覆盖肺部CT去噪、脑部PET去噪、主动脉CTA超分辨率、脑部MRI超分辨率。相比最强基线,肺部CT去噪PSNR提升0.57dB,主动脉CTA超分辨率超越3D DDIM达0.46dB。
收敛曲线显示,相同迭代数下该方法已达到更高PSNR,而基线还在追赶——稀疏调度消除了反复平滑的冗余步骤。代码已开源。
这篇工作的启示在于:条件增强任务里,退化输入本身就是最强的先验。与其在密集调度里烧算力,不如重新设计预测目标和监督方式,让模型在极少步数内完成增强。对临床场景来说,训练成本和推理延迟的下降,可能比几个dB的提升更实际。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.