网易首页 > 网易号 > 正文 申请入驻

英伟达定义文生图最后一步:潜在表征直达4K,高精细节一步生成!

0
分享至



2K 图像 210ms 解码,4K 细节直接生成,传统「解码 + 超分」流水线可能要被重写了。

文生图模型现已内卷至 4K、超写实、电影级光影水准,但一张 AI 图像要想像 GPT-Image2 一样呈现高级质感,只靠增加扩散主干的参数规模和训练数据就足够了吗?

主流文生图模型通常分两步:在「潜空间」生成压缩的潜在表征(latent),再由「解码器」(decoder)还原为像素图。传统解码器仅负责「解压」,不主动创造细节。但在生成 2K、4K 高精图片时,解码器能否处理纹理细节,兼顾速度与显存,已成为高精渲染的瓶颈。这个长期被低估的「从 latent 到 pixel」转换环节,正是决定最终图片质感的关键。

现在,英伟达 Spatial Intelligence Lab 团队提出了一种新解法:Pixel diffusion Decoder (PiD)。



  • 论文地址:https://arxiv.org/pdf/2605.23902
  • 项目主页:https://research.nvidia.com/labs/sil/projects/pid/

简单说,PiD 把 latent decoding 本身改造成一个生成式 pixel diffusion 过程,并且在解码的同时还做到了 4 倍甚至 8 倍的上采样,让最终的图像增加了惊人的细节。

PiD 可以把对应 512×512 图像的 latent,直接解码成 2048×2048 的像素输出;在 GB200 上 2K 分辨率解码延迟约210ms;在消费级 RTX 5090 上也能做到1 秒以内,峰值显存约13GB。更重要的是,它不仅快,而且细节更锐、质感更强,在多个图像质量指标上超过传统扩散超分级联方案。

这或许揭示了 GPT-Image2 这类高精图像模型背后一个更通用的趋势:高分辨率和多细节生成的关键,不只是「更大的生成模型」,也可能是「更会生成细节的 decoder」。





高精渲染的瓶颈,藏在最后一步

当前主流文生图模型大多基于潜在扩散模型(latent diffusion model)。

它们不会直接在完整像素空间里生成图像,而是先在一个压缩后的潜空间中完成去噪和构图,再通过 VAE decoder 把潜在表示还原为像素图像。

这个设计极大降低了生成成本,也让 Stable Diffusion、FLUX 等模型成为可能。

但问题也随之出现:传统 decoder 本质上是重建型模块,它的目标是尽可能还原编码器压缩的信息,而不是主动生成新的高频细节。

当目标分辨率来到 2K、4K 时,这个弱点会被放大。

一方面,latent 中本来就丢失了一些细节;另一方面,VAE decoder 往往会把 latent 里的噪声、瑕疵、伪影一起传递到最终图像中。而为了实现高分辨率生成,很多系统不得不在后面再接一个 超分辨率模型,这就是典型的级联流水线:

低分辨率潜在表示 → VAE 解码 → 超分扩散模型 → 高分辨率图像

看起来合理,但代价很高:步骤多、延迟高、显存压力大,而且每一环都可能引入新的失真。

PiD 要做的,就是砍掉这条流水线。



PiD:让 decoder 从「还原器」变成「生成器」

PiD 的核心思想很直接:既然像素扩散模型已经证明自己擅长生成高频细节,那为什么不直接让它承担 decoder 的角色?

于是,PiD 把潜在表示解码重新定义为一个条件像素扩散模型(conditional pixel diffusion model)。

潜在表示负责提供全局结构、语义布局和主体信息;像素扩散模型负责在目标分辨率下合成纹理、边缘、文字、皮肤、毛发、布料等细节。

换句话说,PiD 不再是「从 latent 里还原信息」,而是「以 latent 为条件,在高分辨率像素空间里重新生成一张图」。

这也是它和传统 VAE decoder 的根本区别:

VAE decoder 更像一个压缩文件的解压器,PiD 更像一个带生成能力的高分辨率渲染器。

论文中,PiD 基于 PixelDiT 这类像素空间扩散模型构建,并加入一个轻量级适配器,将低分辨率 latent 注入到高分辨率像素扩散主干中。为了让模型知道什么时候该相信 latent、什么时候该发挥生成先验,团队还设计了 sigma-aware gate:潜在表征越干净,注入越强;潜在表征越嘈杂,模型越依赖自身的像素生成先验。

这让 PiD 不仅能处理完整去噪后的 latent,还能处理尚未完全去噪的中间 latent。

这个设计带来了一个非常实用的能力:提前终止 latent diffusion。



FLUX 还没跑完,PiD 已经可以开始画了

在 FLUX.1 [dev] 这类模型中,完整生成通常需要 28 个 denoising step。PiD 的设计让推理变得更加有趣:不一定要等 latent diffusion 全部跑完。

论文中,PiD 可以在 FLUX.1 [dev] 第 24 步甚至更早就接管尚未完全去噪潜在表征,并直接生成 2048×2048 图像。

这意味着,潜空间的去噪过程可以更早停下来,剩余的细节生成交给 PiD 在像素空间完成。

论文实验显示,完全跑满 denoising step 时,PiD 更忠实于原始 latent;而在中间 step 接管时,由于 latent 还没有把所有细节「钉死」,PiD 反而有更多空间去补充高频纹理,部分场景中会生成更锐利、更丰富的细节。

这相当于把高精渲染过程拆成两层:

  • 第一层:潜空间扩散模型负责整体构图和语义;
  • 第二层:PiD 负责高分辨率细节合成。

这对于商业图像生成系统尤其重要,因为延迟、成本、显存占用,都直接影响服务规模。



210ms 解码 2K,速度和画质同时赢

在 2048×2048 解码任务上,PiD 的速度数据非常亮眼。

以 GB200 + torch.compile 为例,PiD 2K 解码约211ms。对比常见扩散超分基线:

  • SeedVR2-3B 约 1237ms;
  • InvSR-1 约 1018ms;
  • TSD-SR 约 725ms。

也就是说,相比扩散式超分管线,PiD 大约快3 到 6 倍。

而它并不是用画质换速度。

论文使用 MUSIQ、NIQE、DEQA、MANIQA、Q-Align、Unipercept、VisualQuality-R1 等多种图像质量指标评测。结果显示,在 FLUX.1、FLUX.2、SD3、Z-Image 等 VAE latent,以及 DINOv2、SigLIP 等 vision encoder latent 上,PiD 在大多数指标上取得最优或接近最优表现。

论文还用闭源多模态大模型做图像质量评判,让模型比较 PiD 结果和级联超分结果。在 Claude 4.6 Opus、Gemini 3 Flash、GPT 5.5 系列评测器中,PiD 对比所有方法均以高胜率胜出。

换句话说,PiD 不仅快,而且效果还能更好。




PiD 生成更好的毛发细节,且耗时更短




PiD 具有更高的图像质量指标


不挑模型:VAE 和 RAE 的 latent 都能用

PiD 另一个值得注意的地方,它被验证可以适配多种 latent 来源,包括而不限于:FLUX.1、FLUX.2、SDXL、SD3、Z-Image、DINOv2、SigLIP-2……

这点很关键。

这证明了 PiD 是一个通用的范式:只要潜在表征能提供结构和语义,PiD 就可以把它转化为高分辨率图像。

尤其是在 RAE 这类表征自编码器(representation autoencoder) 中,使用 DINOv2 / SigLIP-2 这些视觉编码器的潜空间,他们表征往往更语义化,保留了高层结构,但对底层纹理约束不充分。传统解码器很难补齐这些缺失的外观细节,而 PiD 正好可以用生成式能力来补充这部分细节。

这意味着,未来潜空间的设计可以更大胆:潜在表征不必负责保存所有像素细节,只要保住结构和语义,剩下的高频细节可以交给 PiD 这类生成式 decoder。

直接挑战原生 2K 生成:比 FLUX.2 native 2K 快 14.3 倍

高分辨率图像生成还有另一条路线:原生生成 2K 图像。

问题是,成本非常高。

论文将 FLUX.2 原生 2K、PixelDiT 原生 2K,以及 FLUX.2 先生成 512×512 latent 再接 PiD 解码 2K 图像的方案进行了对比。

结果显示,在单张 GB200 上、不使用 torch.compile 的设置下:

  • PixelDiT 原生 2K:约 13.3 秒;
  • FLUX.2 原生 2K:约 102.2 秒;
  • FLUX.2 512×512 + PiD (解码 2048):约 7.1 秒。

也就是说,FLUX.2 + PiD 的路线比 PixelDiT 快 1.87 倍,比 FLUX.2 native 2K 快 14.3 倍。

在画面表现上,FLUX.2 + PiD 比 PixelDiT 有着更强指令跟随能力和画质;和 FLUX.2 相比仍然保持有竞争力的视觉质量,在一些细节甚至更锐。

这给高分辨率生成提供了一个新的可靠的工程方案:

  • 不一定要让超大模型在 2K 像素级别硬跑到底;
  • 可以让潜空间扩散模型负责低分辨率语义生成,再让 PiD 完成高分辨率细节渲染。

这种解耦方式,对于在线图像生成服务、批量内容生产、广告创意、电商图、游戏资产、影视概念图等场景,都有直接价值。



4K 也能做:同一套范式自然扩展

PiD 不只停留在 2K。

论文进一步展示了 4K 解码结果:给定低分辨率潜在表征,PiD 可以直接生成 4096×4096 图像,并补充更多细节。

从实验设置看,4K 版本沿用了 2K 的训练范式:先训练 4K 分辨率下的像素扩散模型先验,再加入潜在表征适配器,最后通过 DMD2 蒸馏成 4-step 的模型。不需要额外的设计和改动,自然的 scale up 到了 4K 分辨率。

在显存方面,论文报告显示 PiD 的扩展性也优于传统 VAE decoder。标准 FLUX.1 VAE decoder 在 4K 高分辨率下直接爆掉了 H100 的 80G 显存,不得不采取 tiling 的工程 trick 来解码图像。而 PiD 的 4K decoding 下仅需约 22.5GB 峰值显存。

这意味着,PiD 并不是一个只能在小图上跑的概念验证,而是面向 2K、4K 生成服务的实际 decoder 组件。



背后的技术关键词:4-step、DMD2、sigma-aware latent adapter

从工程角度看,PiD 能把速度压到这么低,关键不只是换了一个 decoder,而是整套训练和推理流程的设计。

首先,它把高分辨率像素扩散模型先验作为基础,让模型一开始就拥有强像素生成能力。

其次,它通过轻量级适配器往主干注入潜在表征,sigma-aware gate 控制条件注入强度。推理时可以自然处理「还没完全去噪」的中间潜在表征。

最后,PiD 通过 DMD2 进行蒸馏,把原本多步采样的模型压缩为 4 步。论文结果显示,4 步的蒸馏版本不仅显著加速,视觉指标上还可以超过多步版本。

这也是 PiD 能在 210ms 级别完成 2K 解码的重要原因。

高精渲染的下一步:decoder 成为核心模块

PiD 的意义,不只是让某个超分环节更快。

它实际上重新定义了图像生成系统里的 decoder:decoder 不再是被动的重建模块,而是主动的高分辨率生成模块。

这会改变高分辨率图像系统的设计方式。

过去,研究重点更多放在潜在扩散模型的主干网络:模型更大、训练数据更多。PiD 则提醒我们,最终解码的这一步同样是决定最终画质的关键战场。

当解码器具备生成能力后,基础模型不必承担所有像素细节;高分辨率纹理、锐化、细节补全,可以交给更专门的 pixel diffusion decoder 完成。

对于未来的图像生成、视频生成、world model 和闭环仿真系统,这种模块化思路都很有想象空间。

结语:GPT-Image2 式高精图像,秘密可能在「最后一公里」


高精图像生成看起来像魔法,但拆开来看,它有一个非常工程化的问题:潜在表征里有了结构和语义之后,谁来负责把它变成真正清晰、锐利、细节丰富的像素?

PiD 给出的答案是:让 decoder 自己成为一个生成模型。

从 512×512 latent 直出 2048×2048 图像,从 2K 210ms 解码到 4K 扩展,从 FLUX、SD3 到 DINOv2、SigLIP,PiD 展示了一种新的高分辨率生成范式。

未来,当我们讨论 GPT-Image2 这类模型为什么能生成惊人细节时,答案也许不只在更强的 prompt 理解和更大的 diffusion backbone 中,还在这个长期被低估的「最后一公里」:

如何把潜在表征变成高质量像素。

而英伟达这篇 PiD,正是把这件事推到了台前。

作者介绍

PiD 论文第一作者Yifan Lu 是多伦多大学的博士生,师从 Sanja Fidler 教授。同时也是 NVIDIA Spatial Intelligence Lab 的研究员,研究方向为 Generative model 和 3D Vision。



特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
为什么阿拉伯国家只在口头上支持巴勒斯坦,而却对他们敬而远之?

为什么阿拉伯国家只在口头上支持巴勒斯坦,而却对他们敬而远之?

狗剩说电影
2026-08-12 17:43:49
霹雳-15E未自毁,印度捡到完整弹,逆向工程或已启动

霹雳-15E未自毁,印度捡到完整弹,逆向工程或已启动

止戈军是我
2026-08-11 15:59:03
中国女排自建队至今,最好的教练仅有2人,一锤定音的队员仅有3人

中国女排自建队至今,最好的教练仅有2人,一锤定音的队员仅有3人

冷紫葉
2026-08-05 12:33:35
王传福:15岁成孤儿,生活靠嫂子卖嫁妆,成总裁后把嫂子宠成公主

王传福:15岁成孤儿,生活靠嫂子卖嫁妆,成总裁后把嫂子宠成公主

旧史新谭
2026-08-08 19:32:08
52年邓小平主政西南,得知一县长婚外通奸,邓小平的处理十分高明

52年邓小平主政西南,得知一县长婚外通奸,邓小平的处理十分高明

大运河时空
2026-08-11 16:30:03
最新!俄媒:普京称,若西方国家扣押俄罗斯商船,俄方将予以对等回应

最新!俄媒:普京称,若西方国家扣押俄罗斯商船,俄方将予以对等回应

环球网资讯
2026-08-12 17:46:56
泰国公考曝出近年最大作弊丑闻:近6000人花钱买分,重新核查成绩后一女生逆袭,排名由全国第132升至第1;该作弊网络总涉案金额超9亿元

泰国公考曝出近年最大作弊丑闻:近6000人花钱买分,重新核查成绩后一女生逆袭,排名由全国第132升至第1;该作弊网络总涉案金额超9亿元

扬子晚报
2026-08-12 12:14:02
梦鸽李天一赴美不归?看到85岁李双江“现状”,原来杨洪基没说谎

梦鸽李天一赴美不归?看到85岁李双江“现状”,原来杨洪基没说谎

阿纂看事
2024-11-05 11:54:58
年赚10亿美金放倒10万美国人!北大毒王张智栋,逼得川普深夜跳脚

年赚10亿美金放倒10万美国人!北大毒王张智栋,逼得川普深夜跳脚

莫地方
2026-07-31 19:49:26
为何中国宁愿把电力输向越南,让越南夜晚灯火辉煌,却对朝鲜几乎绝不供电?这事看着奇怪,其实道理很简单!

为何中国宁愿把电力输向越南,让越南夜晚灯火辉煌,却对朝鲜几乎绝不供电?这事看着奇怪,其实道理很简单!

磊子讲史
2026-08-10 15:13:10
上海暴雨,浇醒的不只是房价,更是“伪中产”的体面

上海暴雨,浇醒的不只是房价,更是“伪中产”的体面

茶韵浮生
2026-08-11 18:47:10
善恶有报,黄有龙案判了,更多恶行被扒,幸亏赵薇留了张“好牌”

善恶有报,黄有龙案判了,更多恶行被扒,幸亏赵薇留了张“好牌”

梦在深巷qw
2026-07-09 07:20:47
广东降温时间定了!下滚开水模式即将开启

广东降温时间定了!下滚开水模式即将开启

珠江时报
2026-08-12 13:12:09
研究发现:经常晚上刷牙的人,患高血压、脑梗风险比其他人低?

研究发现:经常晚上刷牙的人,患高血压、脑梗风险比其他人低?

叙说医疗健康
2026-08-12 09:00:22
沈腾《龙餐馆》尺度太大,有人紧急提醒:别带小孩看!网友吵翻了

沈腾《龙餐馆》尺度太大,有人紧急提醒:别带小孩看!网友吵翻了

头号电影院
2026-08-12 08:04:44
一超市老板租借手机号7000余个,从购物平台“薅掉”10余吨大米、鸡蛋,通过自己的超市售卖,已被警方抓获

一超市老板租借手机号7000余个,从购物平台“薅掉”10余吨大米、鸡蛋,通过自己的超市售卖,已被警方抓获

环球网资讯
2026-08-12 11:20:06
普京登上“瓦良格”号警告:西方若扣俄商船,俄可在任何海域对等回应

普京登上“瓦良格”号警告:西方若扣俄商船,俄可在任何海域对等回应

桂系007
2026-08-12 17:30:34
人社部发〔2026〕19号全文拆解,补贴、见习、基层岗位怎么申请

人社部发〔2026〕19号全文拆解,补贴、见习、基层岗位怎么申请

陈博世财经
2026-08-12 14:16:49
1938年,周恩来派她打入国民党内部,她却嫁给蒋介石心腹,身份暴露时说了句话让丈夫愣住

1938年,周恩来派她打入国民党内部,她却嫁给蒋介石心腹,身份暴露时说了句话让丈夫愣住

纪史行者
2026-08-09 08:21:56
泉州寺庙被雷劈后,要求别人相信科学

泉州寺庙被雷劈后,要求别人相信科学

远方青木
2026-07-04 02:22:01
2026-08-12 18:27:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13740文章数 142718关注度
往期回顾 全部

科技要闻

Manus第二季,浪子回头

头条要闻

外卖小哥称"我人生最后一天啦" 女顾客收信息果断报警

头条要闻

外卖小哥称"我人生最后一天啦" 女顾客收信息果断报警

体育要闻

杜兰特,所谓的“联盟小王”

娱乐要闻

老戏骨杨昆两夺金鹰奖,因物业费被告

财经要闻

李嘉诚,再一次大撤退!他嗅到了什么?

汽车要闻

这台大众不一般 上汽大众ID.ERA.5S综合续航约2000公里

态度原创

家居
亲子
游戏
教育
旅游

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

多学科聚力,AI健康体重管理大模型赋能!这些孩子在体重管理科普夏令营里科学减重

《漫威蜘蛛侠3》新情报疑曝光!失眠组真劳模

教育要闻

蔡皋:要宝贝孩子的天性,让他的天真任天真,让他的梦想有梦想

旅游要闻

威海南海新区:蓝天碧海 云卷云舒

无障碍浏览 进入关怀版