网易首页 > 网易号 > 正文 申请入驻

ECCV 2024 | 南洋理工三维数字人生成新范式:结构扩散模型

0
分享至

  • AIxiv专栏是机器之心发布学术、技术内容的栏目。过去数年,机器之心AIxiv专栏接收报道了2000多篇内容,覆盖全球各大高校与企业的顶级实验室,有效促进了学术交流与传播。如果您有优秀的工作想要分享,欢迎投稿或者联系报道。投稿邮箱:liyazhou@jiqizhixin.com;zhaoyunfeng@jiqizhixin.com

该论文作者均来自于新加坡南洋理工大学 S-Lab 团队,包括博士后胡涛,博士生洪方舟,以及计算与数据学院刘子纬教授(《麻省理工科技评论》亚太地区 35 岁以下创新者)。S-Lab 近年来在顶级会议如 CVPR, ICCV, ECCV, NeurIPS, ICLR 上发表多篇 CV/CG/AIGC 相关的研究工作,和国内外知名高校、科研机构广泛开展合作。

三维数字人生成和编辑在数字孪生、元宇宙、游戏、全息通讯等领域有广泛应用。传统三维数字人制作往往费时耗力,近年来研究者提出基于三维生成对抗网络(3D GAN)从 2D 图像中学习三维数字人,极大提高了数字人制作效率。

这些方法往往在一维隐向量空间建模数字人,而一维隐向量无法表征人体的几何结构和语义信息,因此限制了其生成质量和编辑能力。

为了解决这一问题,来自新加坡南洋理工大学 S-Lab 团队提出结构化隐空间扩散模型(Structured Latent Diffusion Model)的三维数字人生成新范式 StructLDM。该范式包括三个关键设计:结构化的高维人体表征、结构化的自动解码器以及结构化的隐空间扩散模型。

StructLDM 是一个从图像、视频中学习的前馈三维生成模型(Feedforward 3D Generative Model),相比于已有 3D GAN 方法可生成高质量、多样化且视角一致的三维数字人,并支持不同层级的可控生成与编辑功能,如局部服装编辑、三维虚拟试衣等部位感知的编辑任务,且不依赖于特定的服装类型或遮罩条件,具有较高的适用性。

论文标题:StructLDM: Structured Latent Diffusion for 3D Human Generation

论文地址:https://arxiv.org/pdf/2404.01241

项目主页:https://taohuumd.github.io/projects/StructLDM

实验室主页:https://www.ntu.edu.sg/s-lab

方法概览

StructLDM 训练过程的包含两个阶段:

结构化自动解码:给定人体姿态信息 SMPL 和相机参数,自动解码器对训练集中每个人物个体拟合出一个结构化 UV latent。该过程的难点在于如何把不同姿态、不同相机视角、不同着装的人物图像拟合到统一的 UV latent 中,为此 StructLDM 提出了结构化局部 NeRF 对身体每个部位分别建模,并通过全局风格混合器把身体各部分合并在一起,学习整体的人物外观。此外,为解决姿态估计误差问题,自动解码器训练过程中引入了对抗式学习。在这一阶段,自动解码器把训练集中每个人物个体转化为一系列 UV latent。

结构扩散模型:该扩散模型学习第一阶段得到的 UV latent 空间,以此学习人体三维先验。

在推理阶段,StructLDM 可随机生成三维数字人:随机采样噪声并去噪得到 UV latent,该 latent 可被自动解码器渲染为人体图像。

实验结果

该研究在 4 个数据集上进行了实验评估:单视角图像数据集 DeepFashion [Liu et al. 2016],视频数据集 UBCFashion [Zablotskaia et al. 2019],真实三维人体数据集 THUman 2.0 [Yu et al. 2021], 及虚拟三维人体数据集 RenderPeople。

3.1 定性结果比较

StructLDM 在 UBCFashion 数据集上与已有 3D GAN 方法做了对比,如 EVA3D、 AG3D 及 StyleSDF。相比于已有方法,StructLDM 可生成高质量、多样化、视角一致的三维数字人,如不同肤色、不同发型,以及服饰细节(如高跟鞋)。

StructLDM 在 RenderPeople 数据集上与已有 3D GAN 方法(如 EG3D, StyleSDF, 及 EVA3D)及扩散模型 PrimDiff 对比。相比于已有方法,StructLDM 可生成不同姿态、不同外观的高质量三维数字人,并生成高质量面部细节。

3.2 定量结果比较

研究者在 UBCFashion, RenderPeople,及 THUman 2.0 上与已知方法做了定量结果比较,在每个数据集上随机选取 5 万张图像计算 FID ,StructLDM 可大幅降低 FID。此外,User Study 显示大约 73% 的用户认为 StructLDM 生成的结果在面部细节和全身图像质量上比 AG3D 更有优势。

3.3 应用

3.3.1 可控性生成

StructLDM 支持可控性生成,如相机视角、姿态、体型控制,以及三维虚拟试衣,并可在二维隐空间插值。

3.3.2 组合式生成

StructLDM 支持组合式生成,如把①②③④⑤部分组合起来可生成新的数字人,并支持不同的编辑任务,如身份编辑、衣袖(4)、裙子(5)、三维虚拟试衣(6)以及全身风格化(7)。

3.3.3 编辑互联网图片

StructLDM 可对互联网图片进行编辑,首先通过 Inversion 技术得到对应的 UV latent,然后通过 UV latent 编辑可对生成的数字人进行编辑,如编辑鞋、上衣、裤子等。

3.4 消融实验

3.4.1 隐空间扩散

StructLDM 提出的隐空间扩散模型可用于不同编辑任务,如组合式生成。下图探究了扩散模型参数(如扩散步数和噪声尺度)对生成结果的影响。StructLDM 可通过控制扩散模型参数来提高生成效果。

3.4.2 一维与二维人体表征

研究者对比了一维与二维 latent 人体表征效果,发现二维 latent 可生成高频细节(如衣服纹理及面部表情),加入对抗式学习可同时提高图片质量和保真度。

3.4.3 结构感知的归一化

为提高扩散模型学习效率,StructLDM 提出了结构感知的 latent 归一化技术 (structure-aligned normalization),即对每个 latent 做逐像素归一化。研究发现,归一化后的 latent 分布更接近于高斯分布,以此更利于扩散模型的学习。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
华裔富豪包养68名情妇,欲娶外甥女为妻,被自己姐夫剁成108块

华裔富豪包养68名情妇,欲娶外甥女为妻,被自己姐夫剁成108块

历史八卦社
2023-11-25 07:05:03
嘎子哥谢孟伟抖音账号被封禁

嘎子哥谢孟伟抖音账号被封禁

三言科技
2025-09-19 07:51:03
21天卖光俩月产能,特斯拉等来救命稻草

21天卖光俩月产能,特斯拉等来救命稻草

Tech星球
2025-09-18 12:32:13
23岁男中介带看房9分钟,女客户报警称被强奸,6个G视频揭露真相

23岁男中介带看房9分钟,女客户报警称被强奸,6个G视频揭露真相

悬案解密档案
2025-05-09 17:03:55
詹姆斯:我肯定不会再打23年,退役那天总会来只是现在还没到

詹姆斯:我肯定不会再打23年,退役那天总会来只是现在还没到

懂球帝
2025-09-19 08:07:08
台湾只有2340万人,上半年却创造3万亿GDP,与福建省相比什么水平

台湾只有2340万人,上半年却创造3万亿GDP,与福建省相比什么水平

科普100克克
2025-09-18 20:13:53
直击iPhone 17开售首日:消费者偏爱银色橙色,有黄牛加价500元收购Max 256G版本

直击iPhone 17开售首日:消费者偏爱银色橙色,有黄牛加价500元收购Max 256G版本

澎湃新闻
2025-09-19 09:46:27
他假冒军人15年,骗380万加俩老婆,给自己升官,被抓时已是少将

他假冒军人15年,骗380万加俩老婆,给自己升官,被抓时已是少将

浩舞默画
2025-09-18 08:47:27
江西反腐消息:徐勇庆被查、李云被“双开”、刘杨忠被查、吴雪平主动投案

江西反腐消息:徐勇庆被查、李云被“双开”、刘杨忠被查、吴雪平主动投案

鲁中晨报
2025-09-19 17:33:07
辛柏青没想到,《731》上映仅1天,李乃文因一特殊举动口碑暴涨

辛柏青没想到,《731》上映仅1天,李乃文因一特殊举动口碑暴涨

凡知
2025-09-19 12:25:16
哈兰德打进欧冠50球时25岁59天历史第二年轻,梅西居首姆巴佩第三

哈兰德打进欧冠50球时25岁59天历史第二年轻,梅西居首姆巴佩第三

直播吧
2025-09-19 04:40:16
2分!为何宫鲁鸣还坚持用李缘?谁注意他赛后一番话,球迷理解了

2分!为何宫鲁鸣还坚持用李缘?谁注意他赛后一番话,球迷理解了

体育就你秀
2025-09-19 16:13:54
好评如潮,热度破5000,我想说:9月压轴黑马剧出现了

好评如潮,热度破5000,我想说:9月压轴黑马剧出现了

星宿影视鸭
2025-09-19 17:59:13
利空!集体大跌

利空!集体大跌

中国基金报
2025-09-19 15:51:31
唏嘘!全红婵被体型反噬,博主:大概率半退役,陈芋汐未来天花板太高

唏嘘!全红婵被体型反噬,博主:大概率半退役,陈芋汐未来天花板太高

小椰的奶奶
2025-09-18 08:09:46
袁甲评哈维尔:真是在外边找不到工作的都来咱这骗钱了

袁甲评哈维尔:真是在外边找不到工作的都来咱这骗钱了

直播吧
2025-09-19 13:56:16
59岁王志文参加《731》路演,脸肿又垮轮廓模糊,散发一股老人味

59岁王志文参加《731》路演,脸肿又垮轮廓模糊,散发一股老人味

老吴教育课堂
2025-09-19 12:22:07
多地省级政府领导班子密集调整

多地省级政府领导班子密集调整

上观新闻
2025-09-19 14:51:23
武汉大学图书馆事件最新进展:杨景媛没去香港,她目前处境曝光

武汉大学图书馆事件最新进展:杨景媛没去香港,她目前处境曝光

平老师666
2025-09-18 12:48:37
多块查封土地竟能“人间蒸发”,司法权威在广东成为笑话

多块查封土地竟能“人间蒸发”,司法权威在广东成为笑话

几个老记者
2025-09-18 08:47:11
2025-09-19 20:04:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
11321文章数 142452关注度
往期回顾 全部

科技要闻

直击iPhone 17开售:消费者偏爱银色橙色

头条要闻

越南最高领导层"扩员"了 干部的层级架构被大幅修改

头条要闻

越南最高领导层"扩员"了 干部的层级架构被大幅修改

体育要闻

从轮椅到铜牌 他熬了7年:下个目标唱国歌!

娱乐要闻

全智贤被全面抵制!相关代言评论区沦陷

财经要闻

"矿霸"填埋万吨危废 当地政府成立调查组

汽车要闻

对话周光:一个技术理想主义者的“蜕变”

态度原创

时尚
游戏
家居
手机
公开课

今日热点:电影《震耳欲聋》定档1004;《惊天魔盗团3》发布新预告……

《时空之轮》30周年举办活动 SE送出鸟山明原稿!

家居要闻

公共艺术 限时体验打造

手机要闻

卢伟冰:小米 17 系列官宣后,小米之家累计定金盲约量较上代翻倍

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版