如今,AI从单张图生成3D模型的能力与日俱增,不仅能做出复杂的形状,纹理也是越来越逼真。
![]()
但这里面仍然有个老大难问题,就是-保真度瓶颈。换句话说,就是AI生成的3D资产单看都挺好,却和原图“对不上号”,想要在像素级别上与原始图像一致,仍是个巨大难题。
传统技术大多是让AI在标准的空间中生成形状,并通过注意力机制注入图像信息,这就导致平面图片和立体模型之间的对应关系非常模糊,容易丢失精细细节。
![]()
为了解决这一问题,清华大学、腾讯ARC实验室以及惠灵顿维多利亚大学 三方联合研发团队,提出了Pixal3D:一种用于从图像创建高保真3D资产的像素对齐3D生成方法;不再在规范姿态下进行生成,而是直接以像素对齐的方式生成3D资产,从而与输入视图保持一致。
今天咱们就来浅扒一下Pixal 3D的论文。
![]()
贡献
·提出Pixal3D,一种像素对齐的3D生成范式,证明像素对齐生成在大规模上可行,同时大幅提高了图像→3D资产的保真度。
·提出了射线反投影条件化机制,用显式的2d-3d对应关系替代交叉注意力,实现了直接的像素到3D特征提升,更忠实地保留图像细节。
·通过简单有效的多视图特征体聚合,将Pixal3d从单视图扩展到多视图生成。
·基于pixal3d提出了一个模块化的3d场景生成流程,可以产生高保真、物体分离的3d场景。
『 相关工作 』
当前主流的3D生成方法采用规范姿态生成形状,通过交叉注意力注入图像条件,这使得2D-3D对应关系隐式模糊,模型必须“猜测”像素特征对应3D的哪个部分,导致细节错位和多视图不一致。相比之下,3D重建通过显式且无歧义的2D-3D对应关系能够以高保真度恢复可见表面,但输出不完整,无法直接作为可用资产。
于是,3D生成式重建应运而生:在生成模型中融入重建约束,使输出既忠实于输入又能合理补全未观测区域。而Pixal3D将融合推进得更彻底,不是去“预测”对应关系,而是通过反投影直接建立并强制执行显式2D-3D对应关系,以像素对齐、视图为中心的方式生成3D物体,从而避开了相机估计的脆弱性和规范姿态生成带来的保真度损失,为高保真生成式重建提供了一个可扩展的新基础。
『 方法 』
Pixal3D用“反投影”技术让3D模型和输入图像的每个像素一一对应。不仅能用单张图像生成高保真3D资产,还支持多视图生成和模块化场景级合成。
![]()
原则上,Pixal3D兼容任何具有显式结构的3D生成骨干。论文中,团队采用开源的最先进模型Direct3D-S2作为基础。
Direct3D-S2是一个稀疏体素隐扩散框架,包含稠密和稀疏两阶段,各自配有VAE和DiT模型。原方法在两个阶段的DiT中都通过交叉注意力注入图像条件,而Pixal3D保留了这一核心架构,用像素对齐生成范式对其进行了扩展。
像素对齐的3D生成
规范姿态 vs. 像素对齐生成
现有原生3D生成方法通常在规范姿态(物体正立于标准坐标系)下操作,通过交叉注意力隐式建立2D-3D对应,但可能会导致规范空间中多个3D位置对应统一2D证据,模型往往依赖全局语义“作弊”,无法建立忠实的像素到3D映射。
Pixal3D改为了像素对齐生成:物体定义在输入相机的坐标系中,即“从相机看到的样子”。3D体素与图像视锥对齐,每个像素对应唯一的相机射线,形成几何上确定的2D-3D对应关系,将对应从学习到的随机行为变为扎实的几何先验。
基于反投影条件的3D隐扩散
基于上面提到的隐扩散模型,但VAE编码的是像素对齐的物体,使扩散模型学会视图依赖、像素对齐的生成。
先用DINOv2模型提取输入图像的特征图,把特征图里的每个像素,沿着它在现实世界中对应的视线方向“投射”回3D空间,形成一条射线,所有射线合在一起就构成一个从相机出发的“视锥”。
接下来,用一个可调节距离和大小的立方体框限定物体范围,通过投影公式建立像素与体素的一一对应。每个体素沿射线收集图像特征,拼成“特征立方体”,直接作为扩散模型的条件。训练时用真实相机参数;实际使用时固定视野,自动算出距离使四角射线穿过立方体背面顶点。同时再加入DINOv2提取的全局特征,提供整体语义指导。
![]()
为了让细节更清晰,团队引入多尺度特征。DINOv2特征偏粗糙,缺少精细纹理,于是团队用一个放大模型将其提升到原图分辨率,得到细节丰富的特征图。反投影时,每个体素同时采样粗、细两种尺度的特征并取平均,以低成本大幅提升细节保真度。
多视图扩展
已知多视图相机参数时,将每个视图的多尺度特征反投影到3D空间,在每个体素内简单平均聚合,得到融合特征体作为条件。视图越多,表面覆盖越全,3D形状越确定。
『 实验 』
单视图3D生成
团队在Toys4K数据集上,与TRELLIS、TripoSG、Hunyuan3D-2.1、Direct3D-S2等最先进方法进行了全面的定量和定性比较。
为精确评估保真度差异,在输入图像坐标系下渲染生成网格的表面法线图,并与真实法线图进行对比。基线方法采用真实相机姿态渲染。使用IoU(交并比)和PSNR(峰值信噪比)来评估法线图的覆盖率和逐像素差异,同时报告平均角度误差、边界处角度误差,以及不同阈值下的准确率等,所有计算均基于预测和真值重叠的区域。
![]()
鉴于Toys4K网格大多比较简单,团队额外构建了一个包含150张互联网及AI生成图像的测试集,包含复杂几何细节与多样语义。在这一测试集上(没有真实相机姿态或法线图),采用ULIP2和Uni3D来评估图像-3D一致性,并开展了30人的用户研究,对生成网格的保真度与整体质量进行1-5分评分。结果显示,Pixal3D在保真度上优势显著,在保持高质量的同时能忠实还原图像细节。
![]()
相比其他方法,Pixal3D更加精准地恢复了输入图像的视觉内容,同时生成了更高质量的3D网格。尤其在精细细节的保真度上差异尤为明显,依靠像素对齐设计,几乎保留了所有图像细节,达到了接近重建级别的保真度。
![]()
![]()
多视图3D生成
在多视图3D生成方面,团队在Toys4K数据集上使用倒角距离、推土机距离和F-score进行评估(输入视图数量分别为2、4、6),与VGGT和TRELLIS多视图版进行了比较。
![]()
相比之下,Pixal3D的像素对齐设计能无缝处理多视图输入,保持跨视图一致性。并且,随着视图数量增加,生成的不确定性逐渐下降,重建线索也会增强。
![]()
3D场景生成
Pixal3D在生成3D场景时,确保每个物体的3D模型都和输入图像的像素对齐,并通过深度图等几何线索规整空间一致性,让生成的场景看起来更自然、协调,真实可靠。
![]()
本质上,Pixal3D结合了重建与生成二者的优点,提供一种简单有效的方法,可以从单视图或多视图输入,生成忠于原图、完整的3D模型和场景。
为3D生成式重建打好了基础,未来也许真的可以创建既有创意又能够像素级还原的3D内容了~
-今日互动-
听说长得好看的人都给我点赞赞了
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.