网易首页 > 网易号 > 正文 申请入驻

Sora出圈,背后DiT也火了!作者NYU谢赛宁官宣全新升级版SiT

0
分享至

新智元报道

编辑:好困

【新智元导读】扩散Transformer(DiT)重磅升级——可扩展插值Transformer(SiT)!虽然核心架构没变,但在质量、处理速度和使用灵活性方面都实现了显著提升。

最近,OpenAI的视频生成模型Sora实火。

根据纽约大学计算机系助理教授谢赛宁的分析,Sora是基于自己和William Peebles共同提出的DiT框架设计而成。论文被ICCV 2023接收。

随后,William Peebles加入了OpenAI,领导了开发Sora的技术团队。

论文地址:https://arxiv.org/abs/2212.09748

与此同时,随着大家对DiT的关注越来越高,谢赛宁团队还官宣了重磅升级之后的SiT架构——Scalable Interpolant Transformer,即可扩展插值Tranformer。

虽然基于相同的骨干,但SiT实现了更好的质量、速度和灵活性。

对此,谢赛宁表示,SiT突破了传统扩散技术的限制,从而可以利用插值法开拓更加广泛的设计领域!

论文地址:https://arxiv.org/abs/2401.08740

可扩展插值Transformer(SiT),是在扩散Transformer(DiT)技术的基础上发展而来的。

SiT框架提供了一种比传统扩散模型更加灵活的方法,使得我们能够更灵活地连接两个不同的数据分布。

这种方法让我们能够从多个角度审视和优化基于动态传输的生成模型的设计,包括选择离散还是连续的时间来学习、确定模型的学习目标、挑选用于连接分布的插值方法,以及使用确定性或概率性的数据采样器。

结果显示,SiT在条件ImageNet 256x256的基准测试中,使用相同的网络架构、参数数量和计算量,实现了在不同模型规模上超越DiT的性能。

SiT通过调整不同的扩散系数(与学习过程独立),达到了2.06的FID-50K分数,展现了其卓越的图像生成能力。

流与扩散

近年来,一种全新的生成模型逐渐成为焦点,其核心思想是将纯粹的噪声ε转化为具有特定分布p(x)的数据x*。

目前,基于扩散的模型是这种转换最常用的框架,而随机插值和基于流的模型则是这个领域的新成员。

新模型将αt和σt的值限制在时间区间[0,1]内,且α0=σ1=1,α1=σ0=0。如此一来,xt就可以精确地在x*和ε之间插值。

这种方法的优点是,让插值函数插值函数的选择更加灵活,因为它们不再受制于前向SDE。

此外,这些模型还使用了更简单的概率流ODE进行推理:

其中,速度v(Xt ,t)是通过流量匹配目标进行估计的:

简单来说,这可以被看作是预测一个粒子在t时刻从某个ε开始移动的速度。

为了更好地理解这些模型,团队将关键组成部分总结在了下表中:

研究证明,在相同的αt和σt条件下,扩散和基于流的方法实际上遵循着相同的时间发展过程。也就是说,无论是基于流的ODE还是基于扩散的ODE和SDE,其对应的pt(x)都是一致的。

论文中,团队不仅揭示了这些模型组件之间的数学等价性,还探讨了它们对模型性能的影响。

并更进一步地解决了其中的「?」,即在缺少明确前向SDE的情况下,基于流的方法也可以通过反向时间SDE进行有效采样。

可扩展插值Tranformer

从上表可以看出,设计这些模型时需要考虑以下四个方面:

- 时间空间(Timespace):离散或连续的时间间隔;

- 模型预测(Model Prediction):Ls或Lv的目标;

- 插值器(Interpolant):αt和σt的选择;

- 采样器(Sampler):常微分方程(ODE)或随机微分方程(SDE)。

时间空间

首先,将模型从基于离散时间的去噪方式改进为基于连续时间的评分方式后,性能有了小幅提升。

模型预测

团队发现,速度模型与评分模型之间存在一个随时间变化的权重函数:

其中, 。

将这种线性关系应用到Lv中,可以得到:

这一发现与之前的观察一致,即不同的扩散模型预测结果相当于对普通去噪目标进行了不同时间函数的加权。

为了解决数值稳定性的问题,团队采用了与SBDM相同的方法,将训练和采样的范围限制在[ε,1]区间内。

因此,较大的λε能够弥补Ls梯度消失的问题,但这也使得优化Lv变得更加困难。

插值器

团队主要研究了三种不同的插值方法:

下面的例子将展示这些插值方法对简单的一维数据分布产生的影响。

从标准高斯分布开始的一段时间内,VP插值方法在两种情况下都引起了最显著的变化,而GVP和线性插值方法的变化则相对平缓。

直观上来说,VP插值方法的这种急剧变化增加了速度场的Lipschitz常量,从而使其学习变得更加困难。

从标准高斯分布到定义在±1处的伯努利分布

从标准高斯分布到具有两个峰值,分别位于-1和2的高斯混合分布

当从简单的示例转向更复杂的图像生成任务时,可以再次看到不同插值方法之间存在显著的性能差异:

这种差异的一个可能原因如下图所示:当从SBDM-VP改为GVP或线性插值时,路径的长度(也就是传输成本)有所减少。

采样器

在SBDM设置下,速度的反向时间SDE可按以下方式构建:

其中,用g(t)来表示SBDM模型中的扩散系数。

根据之前的讨论,也可以根据g^2(t)=2λtσt这一关系,为GVP和线性插值方法构建类似的SDE模型:

随后,团队进一步提出,扩散系数g(t)可以独立于学习过程进行调整。

实际上,任何非负的函数w(t)(不必是单调的)都可以作为扩散系数。

因此,可以将反向时间的SDE模型进行推广:

除了SBDM系数外,团队还尝试使用w(t)=σt(消除数据分布附近的分数奇异性)和w(t)=sin^2(πt)作为扩散系数,并探讨了它们对速度模型或评分模型的影响。

结果显示,选择最优的扩散系数取决于插值方法和目标,而在实验中,这也很大程度上取决于模型的大小。

经验表明,对于SiT-XL模型,最佳选择是使用线性插值方法和连续时间速度模型,并使用w(t)=σt作为扩散系数的SDE进行采样。

最后,在不同的计算资源下,ODE和SDE积分器的性能可能会有所不同。

如实验所示,相比于SDE,ODE在更少的函数评估次数下能够更快地收敛,而在更大的计算资源下,SDE能够实现更低的FID分数。

无分类器引导

在速度模型中,团队使用了「无分类器引导」的方法。可以看到,这种方法在DiT中所带来的显著性能提升,同样适用于SiT。

参考资料:

https://twitter.com/sainingxie/status/1747863734884745431

https://huggingface.co/papers/2401.08740

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
陈云晚年首次披露:遵义会议上这两个人死活不同意毛主席,吵得面红耳赤

陈云晚年首次披露:遵义会议上这两个人死活不同意毛主席,吵得面红耳赤

老杉说历史
2026-03-21 17:38:44
三观炸裂!翟欣欣出轨聊天记录流出,尺度大到咂舌,判12年都嫌少

三观炸裂!翟欣欣出轨聊天记录流出,尺度大到咂舌,判12年都嫌少

有范又有料
2025-09-29 14:21:11
一觉醒来,成了罗技的狗

一觉醒来,成了罗技的狗

画生笔记
2026-03-28 11:13:05
亿万富豪徐明:病死狱中将近9年,明星妻子田海蓉和女儿过得怎样

亿万富豪徐明:病死狱中将近9年,明星妻子田海蓉和女儿过得怎样

风信子的花
2026-03-28 15:36:48
坐实了!南京,最成功的省会,没有之一

坐实了!南京,最成功的省会,没有之一

城市财经
2026-03-28 11:48:40
1986年韩先楚拒绝葬在八宝山,他对陈云说:那里有我不愿见到的人

1986年韩先楚拒绝葬在八宝山,他对陈云说:那里有我不愿见到的人

百年历史老号
2026-03-25 18:27:41
凌晨,暴跌800点!伊朗警告:尽快撤离!美股大跳水,油价飙升!

凌晨,暴跌800点!伊朗警告:尽快撤离!美股大跳水,油价飙升!

证券时报
2026-03-28 09:01:05
以色列收到1.28万份战火损失赔偿申请

以色列收到1.28万份战火损失赔偿申请

财联社
2026-03-26 23:22:07
为什么闲鱼很多卖家只支持自提?网友:等你碰上到手刀的就老实了

为什么闲鱼很多卖家只支持自提?网友:等你碰上到手刀的就老实了

另子维爱读史
2026-03-22 22:34:48
突发!全球震动!A股下周要迎史诗级变天,这三大方向或要起飞?

突发!全球震动!A股下周要迎史诗级变天,这三大方向或要起飞?

股市皆大事
2026-03-28 11:46:30
2005年《神话》重庆宣传,为争夺金喜善,文强与山西首富大打出手

2005年《神话》重庆宣传,为争夺金喜善,文强与山西首富大打出手

干史人
2026-03-27 10:00:07
李梓萌,私生活传闻太荒唐

李梓萌,私生活传闻太荒唐

做一个合格的吃瓜群众
2026-03-21 19:20:55
大家熟悉的他早已逝世!一天吃十几片止疼药,去世半年公众才知道

大家熟悉的他早已逝世!一天吃十几片止疼药,去世半年公众才知道

谁将笑到最后
2026-03-28 15:47:31
主持人问张晋:你老婆陪了刘銮雄6年,张晋的回答如教科书般标准

主持人问张晋:你老婆陪了刘銮雄6年,张晋的回答如教科书般标准

查尔菲的笔记
2026-03-23 18:06:01
“华人神探”李昌钰去世,享年87岁,曾参与侦办“水门事件”“辛普森杀妻案”,中国留学生追忆:半年前他曾站着演讲1个半小时,精神状态不错

“华人神探”李昌钰去世,享年87岁,曾参与侦办“水门事件”“辛普森杀妻案”,中国留学生追忆:半年前他曾站着演讲1个半小时,精神状态不错

极目新闻
2026-03-28 06:56:12
原来他12年前就已离世!患病3年女儿不愿照看,死后为争遗产现身

原来他12年前就已离世!患病3年女儿不愿照看,死后为争遗产现身

白面书誏
2026-03-26 13:38:18
美国务卿:中国正在经历人类最大规模军力建设,美国打不过中国

美国务卿:中国正在经历人类最大规模军力建设,美国打不过中国

傲傲讲历史
2026-03-27 16:16:47
西安邀请赛3月28日赛程:中国U23PK朝鲜力争首胜,CCTV16直播

西安邀请赛3月28日赛程:中国U23PK朝鲜力争首胜,CCTV16直播

薇说体育
2026-03-28 08:27:10
张雪峰的病,速效救心丸能救吗?

张雪峰的病,速效救心丸能救吗?

中国新闻周刊
2026-03-25 16:23:30
从太空看中国:只用了一年,沙漠边缘“绘就”绿色“同心圆”

从太空看中国:只用了一年,沙漠边缘“绘就”绿色“同心圆”

新华社
2026-03-27 16:25:19
2026-03-28 16:16:49
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
14835文章数 66720关注度
往期回顾 全部

科技要闻

遭中国学界"拉黑"后,这家AI顶会低头道歉

头条要闻

特朗普:北约没支持美打击伊朗 美国以后也不会帮北约

头条要闻

特朗普:北约没支持美打击伊朗 美国以后也不会帮北约

体育要闻

“我是全家最差劲的运动员”

娱乐要闻

王一博改名上热搜!个人时代正式开启!

财经要闻

我在小吃培训机构学习“科技与狠活”

汽车要闻

置换补贴价4.28万起 第五代宏光MINIEV正式上市

态度原创

房产
家居
数码
时尚
军事航空

房产要闻

6.8万方!天河员村再征地,金融城西区开发全面提速

家居要闻

曲线华尔兹 现代简约

数码要闻

华硕新款商务本ExpertBook B3 G1,配置超丰富!

龙虾来了,厌蠢症炸了

军事要闻

美军中东基地损失最新披露

无障碍浏览 进入关怀版