网易首页 > 网易号 > 正文 申请入驻

CVPR 2024|仅需文本或图像提示,新框架CustomNeRF精准编辑3D场景

0
分享至

机器之心专栏

机器之心编辑部

美图影像研究院(MT Lab)与中国科学院信息工程研究所、北京航空航天大学、中山大学共同提出了 3D 场景编辑方法 ——CustomNeRF,同时支持文本描述和参考图像作为 3D 场景的编辑提示,该研究成果已被 CVPR 2024 接收。

自 2020 年神经辐射场 (Neural Radiance Field, NeRF) 提出以来,将隐式表达推上了一个新的高度。作为当前最前沿的技术之一,NeRF 快速泛化应用在计算机视觉、计算机图形学、增强现实、虚拟现实等领域,并持续受到广泛关注。

有赖于易于优化和连续表示的特点,NeRF 在 3D 场景重建中有着大量应用,也带动了 3D 场景编辑领域的研究,如 3D 对象或场景的纹理重绘、风格化等。为了进一步提高 3D 场景编辑的灵活性,近期基于预训练扩散模型进行 3D 场景编辑的方法也正在被大量探索,但由于 NeRF 的隐式表征以及 3D 场景的几何特性,获得符合文本提示的编辑结果并非易事。

为了让文本驱动的 3D 场景编辑也能够实现精准控制,美图影像研究院(MT Lab)与中国科学院信息工程研究所、北京航空航天大学、中山大学,共同提出了一种将文本描述和参考图像统一为编辑提示的 CustomNeRF 框架,可以通过微调预训练的扩散模型将参考图像中包含的特定视觉主体 V∗嵌入到混合提示中,从而满足一般化和定制化的 3D 场景编辑要求。该研究成果目前已被 CVPR 2024 收录,代码已开源。



  • 论文链接:https://arxiv.org/abs/2312.01663
  • 代码链接:https://github.com/hrz2000/CustomNeRF



图 1:CustomNeRF 在文本驱动(左)和图像驱动(右)的编辑效果

CustomNeRF 解决的两大挑战

目前,基于预训练扩散模型进行 3D 场景编辑的主流方法主要分为两类。

其一,是使用图像编辑模型迭代地更新数据集中的图像,但是受限于图像编辑模型的能力,会在部分编辑情形下失效。其二,则是利用分数蒸馏采样(SDS)损失对场景进行编辑,但由于文本和场景之间的对齐问题,这类方法在真实场景中无法直接适配,会对非编辑区域造成不必要的修改,往往需要 mesh 或 voxel 等显式中间表达。

此外,当前的这两类方法主要集中在由文本驱动的 3D 场景编辑任务中,文本描述往往难以准确表达用户的编辑需求,无法将图像中的具体概念定制化到 3D 场景中,只能对原始 3D 场景进行一般化编辑,因此难以获得用户预期中的编辑结果。

事实上,获得预期编辑结果的关键在于精确识别图像前景区域,这样能够在保持图像背景的同时促进几何一致的图像前景编辑。

因此,为了实现仅对图像前景区域进行准确编辑,该论文提出了一种局部 - 全局迭代编辑(LGIE)的训练方案,在图像前景区域编辑和全图像编辑之间交替进行。该方案能够准确定位图像前景区域,并在保留图像背景的同时仅对图像前景进行操作。

此外,在由图像驱动的 3D 场景编辑中,存在因微调的扩散模型过拟合到参考图像视角,所造成的编辑结果几何不一致问题。对此,该论文设计了一种类引导的正则化,在局部编辑阶段仅使用类词来表示参考图像的主体,并利用预训练扩散模型中的一般类先验来促进几何一致的编辑。

CustomNeRF 的整体流程

如图 2 所示,CustomNeRF 通过 3 个步骤,来实现在文本提示或参考图像的指导下精确编辑重建 3D 场景这一目标。



图 2 CustomNeRF 的整体流程图

首先,在重建原始的 3D 场景时,CustomNeRF 引入了额外的 mask field 来估计除常规颜色和密度之外的编辑概率。如图 2(a) 所示,对于一组需要重建 3D 场景的图像,该论文先使用 Grouded SAM 从自然语言描述中提取图像编辑区域的掩码,结合原始图像集训练 foreground-aware NeRF。在 NeRF 重建后,编辑概率用于区分要编辑的图像区域(即图像前景区域)和不相关的图像区域(即图像背景区域),以便于在图像编辑训练过程中进行解耦合的渲染。

其次,为了统一图像驱动和文本驱动的 3D 场景编辑任务,如图 2(b)所示,该论文采用了 Custom Diffusion 的方法在图像驱动条件下针对参考图进行微调,以学习特定主体的关键特征。经过训练后,特殊词 V∗可以作为常规的单词标记用于表达参考图像中的主体概念,从而形成一个混合提示,例如 “a photo of a V∗ dog”。通过这种方式,CustomNeRF 能够对自适应类型的数据(包括图像或文本)进行一致且有效的编辑。

在最终的编辑阶段,由于 NeRF 的隐式表达,如果使用 SDS 损失对整个 3D 区域进行优化会导致背景区域发生显著变化,而这些区域在编辑后理应与原始场景保持一致。如图 2(c)所示,该论文提出了局部 - 全局迭代编辑(LGIE)方案进行解耦合的 SDS 训练,使其能够在编辑布局区域的同时保留背景内容。

具体而言,该论文将 NeRF 的编辑训练过程进行了更精细的划分。借助 foreground-aware NeRF,CustomNeRF 可以在训练中灵活地控制 NeRF 的渲染过程,即在固定相机视角下,可以选择渲染前景、背景、以及包含前景和背景的常规图像。在训练过程中,通过迭代渲染前景和背景,并结合相应的前景或背景提示,可以利用 SDS 损失在不同层面编辑当前的 NeRF 场景。其中,局部的前景训练使得在编辑过程中能够只关注需编辑的区域,简化复杂场景中编辑任务的难度;而全局的训练将整个场景考虑在内,能够保持前景和背景的协调性。为了进一步保持非编辑区域不发生改变,该论文还利用编辑训练前的背景监督训练过程中所新渲染的背景,来保持背景像素的一致性。

此外,图像驱动 3D 场景编辑中存在着加剧的几何不一致问题。因为经过参考图像微调过的扩散模型,在推理过程中倾向于产生和参考图像视角相近的图像,造成编辑后 3D 场景的多个视角均是前视图的几何问题。为此,该论文设计了一种类引导的正则化策略,在全局提示中使用特殊描述符 V*,在局部提示中仅使用类词,以利用预训练扩散模型中包含的类先验,使用更几何一致的方式将新概念注入场景中。

实验结果

如图 3 和图 4 展示了 CustomNeRF 与基线方法的 3D 场景重建结果对比,在参考图像和文本驱动的 3D 场景编辑任务中,CustomNeRF 均取得了不错的编辑结果,不仅与编辑提示达成了良好的对齐,且背景区域和原场景保持一致。此外,表 1、表 2 展示了 CustomNeRF 在图像、文本驱动下与基线方法的量化比较,结果显示在文本对齐指标、图像对齐指标和人类评估中,CustomNeRF 均超越了基线方法。



图 3 图像驱动编辑下与基线方法的可视化比较



图 4 文本驱动编辑下与基线的可视化比较



表 1 图像驱动编辑下与基线的定量比较



表 2 文本驱动编辑下与基线的定量比较

总结

本论文创新性地提出了 CustomNeRF 模型,同时支持文本描述或参考图像的编辑提示,并解决了两个关键性挑战 —— 精确的仅前景编辑以及在使用单视图参考图像时多个视图的一致性。该方案包括局部 - 全局迭代编辑(LGIE)训练方案,使得编辑操作能够在专注于前景的同时保持背景不变;以及类引导正则化,减轻图像驱动编辑中的视图不一致,通过大量实验,也验证了 CustomNeRF 在各种真实场景中,能够准确编辑由文本描述和参考图像提示的 3D 场景。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
浙江破获涉案3亿元始祖鸟冲锋衣造假案:市价6000元卖500元,商家还获利150%

浙江破获涉案3亿元始祖鸟冲锋衣造假案:市价6000元卖500元,商家还获利150%

上游新闻
2024-06-14 14:14:12
老年人一旦步入80岁高龄,以下几条建议不妨听听

老年人一旦步入80岁高龄,以下几条建议不妨听听

开郎的小皮
2024-06-03 04:18:23
南京的房价快成大笑话了,现在卖房子,已经可笑到什么程度了?

南京的房价快成大笑话了,现在卖房子,已经可笑到什么程度了?

趣味萌宠的日常
2024-06-15 19:34:11
G7场外疯狂一幕,西方媒体都看不下去了!想起奥巴马的“性凝视”

G7场外疯狂一幕,西方媒体都看不下去了!想起奥巴马的“性凝视”

牛锅巴小钒
2024-06-14 18:59:12
92个国家参加瑞士和平峰会,其中57个国家领导人出席,亚洲有5个

92个国家参加瑞士和平峰会,其中57个国家领导人出席,亚洲有5个

飞狼
2024-06-16 00:00:07
不是杨鸣,不是郭士强!男篮主教练基本确定,球迷都怕挨骂

不是杨鸣,不是郭士强!男篮主教练基本确定,球迷都怕挨骂

十点体坛
2024-06-14 22:38:49
京广高铁全线实现复兴号列车时速350公里可劲跑

京广高铁全线实现复兴号列车时速350公里可劲跑

新京报
2024-06-15 16:32:28
万达集团创始人王健林宣布退出公司并将全部股权转让给中国儒意

万达集团创始人王健林宣布退出公司并将全部股权转让给中国儒意

鹏飞深文
2024-04-22 12:19:28
黄一鸣再次公开爆料,直言有孩子也不会嫁王思聪,这次其实是乌龙

黄一鸣再次公开爆料,直言有孩子也不会嫁王思聪,这次其实是乌龙

小seven的囧囧啊
2024-06-14 14:36:52
28岁白色蓝格泳衣美女在酒店楼顶泳池边拍的写真照

28岁白色蓝格泳衣美女在酒店楼顶泳池边拍的写真照

白宸侃片
2024-06-12 20:47:22
江苏男子罗布泊探险后精神失常,临终坦白真相:回来的不是人

江苏男子罗布泊探险后精神失常,临终坦白真相:回来的不是人

青丝人生
2024-06-11 18:49:55
老公带我去私人影院体验快乐,结果把我们双方带入深渊,不可收拾

老公带我去私人影院体验快乐,结果把我们双方带入深渊,不可收拾

亲爱的落落
2024-06-05 15:50:28
大飞机两百多天没飞行,价值20多亿当备件用?

大飞机两百多天没飞行,价值20多亿当备件用?

夹心果
2024-06-15 18:24:06
2比0!中国34岁老将爆冷,击退1号种子,赛季首进决赛,逼近美网

2比0!中国34岁老将爆冷,击退1号种子,赛季首进决赛,逼近美网

曹老师评球
2024-06-15 16:02:44
49岁的我,历经两年更年期才明白,更年期的某些症状不需要吃药的

49岁的我,历经两年更年期才明白,更年期的某些症状不需要吃药的

今日养生之道
2024-06-15 17:20:15
惠州市十三届人大补选7名代表,8名代表资格终止

惠州市十三届人大补选7名代表,8名代表资格终止

南方都市报
2024-06-15 13:42:12
岸田文雄想要的,中方不会给,沉默半个月,日本威胁对华发起制裁

岸田文雄想要的,中方不会给,沉默半个月,日本威胁对华发起制裁

发缴爱体育
2024-06-14 20:45:21
越闹越大!奔驰车主持棍击打女骑手后续,车主身份曝光,实锤酒驾

越闹越大!奔驰车主持棍击打女骑手后续,车主身份曝光,实锤酒驾

辉哥说动漫
2024-06-15 22:52:32
高三学生苦练“意大利斜体”,被网友“真实”:给个0分就老实了

高三学生苦练“意大利斜体”,被网友“真实”:给个0分就老实了

妍妍教育日记
2024-06-13 19:24:54
突然一声枪响,从韩朝边界线传来,中国绝不允许家门口生战生乱

突然一声枪响,从韩朝边界线传来,中国绝不允许家门口生战生乱

青年的背包
2024-06-16 00:43:17
2024-06-16 03:16:49
机器之心Pro
机器之心Pro
专业的人工智能媒体
9080文章数 141943关注度
往期回顾 全部

科技要闻

TikTok开始找退路了?

头条要闻

欧洲杯-亚马尔创纪录卡瓦哈尔首球 西班牙3-0克罗地亚

头条要闻

欧洲杯-亚马尔创纪录卡瓦哈尔首球 西班牙3-0克罗地亚

体育要闻

莱夫利,让困难为我让路

娱乐要闻

江宏杰秀儿女刺青,不怕刺激福原爱?

财经要闻

新情况!高层对人民币的态度180°转弯

汽车要闻

东风奕派eπ008售21.66万元 冰箱彩电都配齐

态度原创

艺术
房产
游戏
手机
公开课

艺术要闻

穿越时空的艺术:《马可·波罗》AI沉浸影片探索人类文明

房产要闻

万华对面!海口今年首宗超百亩宅地,重磅挂出!

魂师对决:SP唐昊返场抽取价值分析!真身幻金真是一个都少不了!

手机要闻

小米澎湃OS再次公布进展通报:多项问题优化中,且全是内置应用!

公开课

近视只是视力差?小心并发症

无障碍浏览 进入关怀版