网易首页 > 网易号 > 正文 申请入驻

Stable Diffusion 3技术报告流出,Sora构架再立大功!生图圈开源暴打Midjourney和DALL·E 3?

0
分享至


新智元报道

编辑:润

【新智元导读】Stability AI放出了号称能暴打闭源模型的Stable Diffusion 3的技术报告,采用DiT构架的新模型在灵活性和性能上都达到了新的高度。

,今天公布了详细的技术报告。

论文深入分析了Stable Diffusion 3的核心技术——改进版的Diffusion模型和一个基于DiT的文生图全新架构!


报告地址:

https://stabilityai-public-packages.s3.us-west-2.amazonaws.com/Stable+Diffusion+3+Paper.pdf

通过人类评价测试,Stable Diffusion 3在字体设计和对提示的精准响应方面,超过了DALL·E 3、Midjourney v6和Ideogram v1。

Stability AI新开发的多模态扩散Transformer(MMDiT)架构,采用了分别针对图像和语言表示的独立权重集,与SD 3的早期版本相比,显著提升了对文本的理解和文字的拼写能力。


性能评估

在人类反馈的基础之上,技术报告将SD 3于大量开源模型SDXL、SDXL Turbo、Stable Cascade、Playground v2.5 和 Pixart-α,以及闭源模型DALL·E 3、Midjourney v6 和 Ideogram v1进行了详细的对比评估。

评估员根据与给定提示的一致性、文本的清晰度以及图像的整体美观度选择了每个模型的最佳输出:


测试结果显示,无论是在遵循提示的准确性、文本的清晰呈现还是图像的视觉美感方面,Stable Diffusion 3都达到或超过了当前文生图生成技术的最高水平。


完全没有针对硬件进行过优化的SD 3模型具有8B参数,能够在24GB显存的RTX 4090消费级GPU上运行,并且在使用50个采样步骤的情况下,生成1024x1024分辨率的图像需耗时34秒。

此外,Stable Diffusion 3在发布时将提供多个版本,参数范围从8亿到80亿,从而能以进一步降低使用的硬件门槛。


架构细节曝光

在文生图的过程中,模型需同时处理文本和图像这两种不同的信息。所以作者将这个新框架称之为MMDiT。

在文本到图像生成的过程中,模型需同时处理文本和图像这两种不同的信息类型。这就是作者将这种新技术称为MMDiT(多模态Diffusion Transformer的简称)的原因。

与Stable Diffusion之前的版本一样,SD 3采用了预训练模型来提取适合的文本和图像的表达形式。

具体而言,他们利用了三种不同的文本编码器——两个CLIP模型和一个T5 ——来处理文本信息,同时使用了一个更为先进的自编码模型来处理图像信息。


SD 3的架构是在Diffusion Transformer(DiT)的基础上建立的。由于文本和图像信息的差异,SD 3为这两种信息各自设置了独立的权重。


这种设计相当于为每种信息类型配备了两个独立的Transformer,但在执行注意力机制时,会将两种信息的数据序列合并,这样就可以在各自的领域内独立工作的同时,能保持够相互参考和融合。


通过这种独特的构架,图像和文本信息之间可以相互流动和交互,从而在生成的结果中提高对内容的整体理解和视觉表现。

而且,这种架构未来还可以轻松扩展到其他包括视频在内的多种模态。


得益于SD 3在遵循提示方面的进步,模型能够精确生成集中于多种不同主题和特性的图像,同时在图像风格上也保持了极高的灵活性。


通过重赋权法改进Rectified Flow

除了推出的全新Diffusion Transformer构架之外,SD 3对于Diffusion模型也进行了重大的改进。

SD 3采用了Rectified Flow(RF)策略,将训练数据和噪声沿着直线轨迹连接起来。

这种方法让模型的推理路径更加直接,因此可以通过更少的步骤完成样本的生成。


作者在训练流程中引入了一种创新的轨迹采样计划,特别增加了对轨迹中间部分的权重,这些部分的预测任务更具挑战性。

通过与其他60种扩散轨迹(例如 LDM、EDM 和 ADM)进行比较,作者发现尽管之前的RF方法在少步骤采样中表现更佳,但随着采样步骤增多,性能会慢慢下降。

为了避免这种情况的出现,作者提出的加权RF方法,就能够持续提升模型性能。

扩展RF Transformer模型

Stability AI训练了多个不同规模的模型,从 15 个模块、450M参数到38个模块、8B参数,发现模型大小和训练步骤都能平滑地降低验证损失。

为了验证这是否意味着模型输出有实质性的改进,他们还评估了自动图像对齐指标和人类偏好评分。

结果表明,这些评估指标与验证损失强相关,说明验证损失是衡量模型整体性能的有效指标。

此外,这种扩展趋势没有达到饱和点,让我们对未来能够进一步提升模型性能持乐观态度。


作者在256 *256像素分辨率下,在4096的批大小下,用不同参数数对模型进行了500k步训练。


上图说明了长时间训练较大模型对样本质量的影响。

上表显示了GenEval的结果。当使用作者提出的训练方法并提高训练图像的分辨率时,最大的模型在大多数类别中都表现出色,在总分上超过了 DALL·E 3。

根据作者对不同构架模型的测试对比,MMDiT效果非常好,超过了DiT,Cross DiT,UViT,MM-DiT。


灵活的文本编码器

通过在推理阶段去除占用大量内存的4.7B参数的T5文本编码器,SD 3的内存需求得到了大幅降低,而性能损失微乎其微。

去除这个文本编码器不会影响图像的视觉美感(不使用T5的胜率为 50%),只会略微降低文本的准确遵循能力(胜率为46%)。

然而,为了充分发挥SD 3在生成文字的能力,作者还是建议使用T5编码器。

因为作者发现在没有它的情况下,排版生成文字的性能会有更大的下降(胜率为 38%)。


网友热议

网友们对Stability AI不断撩拨用户但是不让用的行为显得有些不耐烦了,纷纷催促赶快上线让大家使用。


看了技术报考后,网友说看来现在生图圈子要成第一个开源碾压闭源的赛道了!


参考资料:

https://stability.ai/news/stable-diffusion-3-research-paper

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
陕西省教育厅:全面取消普通高中跨市招生

陕西省教育厅:全面取消普通高中跨市招生

鲁中晨报
2024-05-15 20:55:03
德约头部伤势检测结果已出!除伤病外还有一大顾虑

德约头部伤势检测结果已出!除伤病外还有一大顾虑

网球之家
2024-05-16 12:42:41
斯洛伐克总理在枪击事件中受伤!曾表示将阻止乌克兰加入北约

斯洛伐克总理在枪击事件中受伤!曾表示将阻止乌克兰加入北约

每日经济新闻
2024-05-15 21:46:08
猴王崩了,钞王也崩了,一起携手跌回14年前……

猴王崩了,钞王也崩了,一起携手跌回14年前……

牛锅巴小钒
2024-05-16 07:24:07
俄国防部“大活宝”被清洗,不再有F-16和148827辆HIMARS被锤毁了

俄国防部“大活宝”被清洗,不再有F-16和148827辆HIMARS被锤毁了

娱宙观
2024-05-15 13:17:27
富裕了!全红婵家装修,银色大门阔气,两棵迎客松,二楼安装护栏

富裕了!全红婵家装修,银色大门阔气,两棵迎客松,二楼安装护栏

娱圈小愚
2024-05-15 14:44:58
新婚姻法律征求意见,把女性权益拉满,真正目的为了什么不言而谕

新婚姻法律征求意见,把女性权益拉满,真正目的为了什么不言而谕

走读新生
2024-04-10 11:07:51
大S曝大瓜!网传大S小梅达成协议:孩子暑假回京,须按时付抚养费

大S曝大瓜!网传大S小梅达成协议:孩子暑假回京,须按时付抚养费

小徐讲八卦
2024-05-16 15:08:20
震惊!原来1999年,燃气公司就发明了偷气的技术,结果东窗事发!

震惊!原来1999年,燃气公司就发明了偷气的技术,结果东窗事发!

世态言凉
2024-05-10 17:43:24
网友吐槽:某上市公司底薪居然执行当地最低标准?工资越来越低…

网友吐槽:某上市公司底薪居然执行当地最低标准?工资越来越低…

火山诗话
2024-05-16 09:19:44
成都女子称遭假律师骗走2000元,警方已立案

成都女子称遭假律师骗走2000元,警方已立案

上游新闻
2024-05-16 17:30:05
丑陋的CBA总决赛,篮协是罪魁祸首!坑了CBA,坑了中国篮球!

丑陋的CBA总决赛,篮协是罪魁祸首!坑了CBA,坑了中国篮球!

雷米先生
2024-05-16 16:46:29
真相了,广州水价调整真正原因曝光,水司工资远低于阿里华为!

真相了,广州水价调整真正原因曝光,水司工资远低于阿里华为!

朱华微课
2024-05-16 10:18:10
森林狼如何把自己玩没的,看轻约基奇,戈贝尔生孩子成转折点

森林狼如何把自己玩没的,看轻约基奇,戈贝尔生孩子成转折点

邮轮摄影师阿嗵
2024-05-16 01:56:29
荷兰确定将驻以色列使馆迁至耶路撒冷

荷兰确定将驻以色列使馆迁至耶路撒冷

桂系007
2024-05-16 16:24:57
广东朱芳雨直播透露:在沈阳韩德君不请我吃饭,赛后真诚给我道歉

广东朱芳雨直播透露:在沈阳韩德君不请我吃饭,赛后真诚给我道歉

小豆豆赛事
2024-05-15 19:25:59
进入5月,少吃鸡肉和牛肉,建议多吃这2种肉,腿脚有劲,精力旺盛

进入5月,少吃鸡肉和牛肉,建议多吃这2种肉,腿脚有劲,精力旺盛

王大健美食日常
2024-05-14 23:59:02
韩国网友提问:既然中国如此强大,那为什么不敢与韩国开战?

韩国网友提问:既然中国如此强大,那为什么不敢与韩国开战?

博览历史
2024-05-15 16:06:53
上海大学排名大换血!复旦首次失守榜首,上财黑马逆袭跻身前五!

上海大学排名大换血!复旦首次失守榜首,上财黑马逆袭跻身前五!

小李子体育
2024-05-16 12:25:23
用假材料为350名中国人申请在留资格,日本76岁行政书士与62岁公司男高管被捕……

用假材料为350名中国人申请在留资格,日本76岁行政书士与62岁公司男高管被捕……

日本物语
2024-05-16 16:27:54
2024-05-16 20:12:49
新智元
新智元
AI产业主平台领航智能+时代
11039文章数 65506关注度
往期回顾 全部

科技要闻

京东一季度收入2600亿元,同比增长7.0%

头条要闻

湖北一警车高速上逼停小车 当地回应:两民警已停职

头条要闻

湖北一警车高速上逼停小车 当地回应:两民警已停职

体育要闻

生命最后一年,他决定完成自己的“遗愿清单”

娱乐要闻

街头打代驾?李溪芮想翻红那真挺难的

财经要闻

上海家化董事长离职 近四年薪酬约三千万

汽车要闻

内饰改款/功能升级 新博越L将于5月19日上市

态度原创

家居
健康
旅游
公开课
军事航空

家居要闻

第21届青岛国际家具展圆满举办!

在中国,到底哪些人在吃“伟哥”?

旅游要闻

强迫中国游客购物,韩国一旅行社被勒令停业

公开课

父亲年龄越大孩子越不聪明?

军事要闻

俄官宣列装“布拉瓦”洲际导弹

无障碍浏览 进入关怀版