一张RTX 4070 SUPER,跑完整个神经渲染网络要29.3毫秒,横跨241次GPU调度。这个数字还没算上游戏本身的开销——光是神经渲染这一层,就吃掉了大约34帧每秒的算力预算。1440p下,它依然需要12.6毫秒。
这是OpenDLSS-NR项目基准表里的一组数据。OpenDLSS-NR是一个开源项目,用逆向工程研究重建了英伟达DLSS 5的神经渲染管线,目的是在英伟达闭源软件栈之外复现这套神经渲染行为。使用它需要Ada Lovelace及以上的显卡,而且项目本身不附带权重文件,用户得自己提供。
![]()
把这些数字摆出来,DLSS 5的性能抱怨就变得非常容易理解了。神经渲染不是免费的。作者在40帧上测量了网络并报告了最小耗时,4K负载在RTX 4070 SUPER上大约在133 TFLOPS处进入算力受限状态。这套实现是在真实地压榨硬件,而不是在描述一个抽象的成本。
为什么英伟达要单独拿一块5090来演示
看到这些数字,就能明白英伟达为什么需要一块完全独立的RTX 5090来专门展示DLSS 5。时间表清清楚楚地显示,神经渲染这一遍消耗掉了整帧中相当可观的一块。用官方DLSS 5的DLL文件跑《The Blood of Dawnwalker》,帧率立刻减半。直到把神经渲染层在管线中的位置换掉,性能才回来。
这也解释了为什么DLSS 5的性能抱怨从来没有消失过。它不是优化没到位的问题,而是这套网络本身就要占用那么多算力。
它确实像一个“AI滤镜”
驳斥DLSS 5批评最省事的办法,是说“AI滤镜”这个类比太简化了。然后你去读OpenDLSS-NR的输出规范,会发现这个说法其实有几分道理。网络并不是简单地替换掉渲染好的帧,它产生的是一个RGB残差,再叠加到原图上。
这个残差本质上是逐像素的指令,告诉现有图像应该怎么改。网络可以让原始渲染的某些部分基本不动,同时改动另一些部分,这让结果和传统的锐化或重建有根本区别。游戏已经完成了渲染,而神经渲染决定最终画面应该变成什么样。
这个复刻项目还带有风格控制。OpenDLSS-NR有一个风格参数,会影响色调、结构和皮肤等特征。这等于直接承认,网络关心的不只是恢复渲染器丢失的信息,它还学到了关于最终画面应该长什么样的偏好。
所以,把DLSS 5叫做Instagram的“美化滤镜”在技术上确实偷懒。但读完这套实现之后,能理解这个说法从哪来。有一张已完成的图像,有一个修改它的神经网络,还有一个决定修改风格的可控参数。AI滤镜的批评变得更难被轻易驳回,尽管这并不意味着DLSS 5就是坏的。
噪声输入让“幻觉细节”的批评变得有意思
OpenDLSS-NR向网络输入了三路“高斯噪声”,与渲染图像和时间信息并列。英伟达把DLSS 5描述为一个单步、像素空间的扩散模型,也就是说,受控噪声是网络生成最终输出的一部分。
这让对幻觉细节的担忧变得更容易理解。传统的重建算法试图从渲染中已有的证据里恢复信息。扩散模型学到的是事物通常长什么样,并能从这些知识中合成出看似合理的结构。DLSS 5不是在随机发明像素,但生成确实是它工作的一部分。把这叫做幻觉可能不精确,但假装这个模型不会发明视觉信息,就更不准确了。
公平地说,英伟达对这个问题有回应。DLSS 5以渲染器信息、运动矢量和时间状态为条件,训练时使用渲染器派生的场景属性,让生成结果忠实于开发者的场景。这让人安心,但也留下一个疑问:当原始渲染器和学到的视觉知识发生分歧时,谁说了算?
开源复刻有一个不小的盲区
OpenDLSS-NR能回答很多问题,但最要紧的那部分并不在仓库里。这个项目重建的是神经渲染管线的行为,而不是英伟达训练这套网络时用的权重和完整数据。用户需要自己提供权重,这意味着复刻项目能展示网络怎么跑、跑多快、输出什么形态,却无法完整还原英伟达在训练阶段做了什么取舍。
对于关心DLSS 5实际表现的人来说,这组代码的价值在于把“性能开销”和“生成式修改”这两件事从感受变成了可测量的对象。29.3毫秒、241次调度、12.6毫秒、133 TFLOPS——这些数字不会替英伟达辩护,也不会替批评者站台,它们只是把争论拉回到了具体的地方。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.