网易首页 > 网易号 > 正文 申请入驻

图层,而不是像素:当AI设计工具学会像设计师一样思考

0
分享至


你有没有想过,为什么用AI生成的海报图,你想把里面那只兔子挪个位置,几乎是不可能的事?

你打开PS想改一张设计稿里的文字,鼠标一点,那个文字层立刻被选中,可以拖动、可以改颜色、可以删除,背后的背景图完好无损。这是因为设计师从一开始就是按图层工作的,背景、主体、装饰、文字,各自待在自己的层里,互不干扰。

但AI生成的图片不是这样。

主流的文本生成图像模型,不管是Midjourney还是Stable Diffusion,吐出来的都是一张扁平的画布。像素排列得再精美,它们描述的也只是"这个位置该是什么颜色",而不是"这个区域是一只兔子,那个区域是月亮,它们之间有前后遮挡关系"。你想单独挑出那只兔子挪个位置,模型根本不知道"兔子"这个概念在图里对应哪些像素、被谁挡住了多少、挪走之后露出的应该是什么内容。

这就是这篇论文要解决的核心矛盾:生成模型很擅长"画出来",却完全不懂"怎么拼出来的"。

像素记录的是结果,图层记录的是过程

先说清楚这两者的区别有多大。

像素*:图像最基础的单位,每个像素记录一个颜色值,描述的是画面"看起来是什么样",而不涉及内容的语义结构。

一张扁平化的PNG图,本质上就是几百万个像素点按顺序排列。它可以告诉你"这个位置是红色",但没法告诉你"这个红色区域是一件衣服",更没法告诉你"这件衣服被一个人的手臂遮住了一部分,如果把手臂拿掉,衣服应该是完整的一件"。

而设计师工作时脑子里想的完全是另一套逻辑:这是背景层,这是主体人物层,这是装饰元素层,这是文字层,每一层都是一个独立的、完整的、可以单独操作的对象。这就是这篇论文提出的核心洞察,用论文里的话说:像素定义了图像如何被渲染,而图层定义了图像如何被创造、理解和编辑。

这句话听起来有点抽象,换个说法可能更好懂:一张扁平的图片就像一份直接端上桌的成品菜,你尝得出味道,但看不出用了哪几种食材、哪个步骤先放盐哪个步骤后放糖。而一份带图层的设计稿更像是厨房里没洗的备菜台,葱姜蒜、肉、调料分门别类摆着,你随时可以单独拿起某一份重新处理,而不影响其他部分。如果所有食材直接混合下锅端上桌(也就是只有扁平像素),你想单独把里面的姜丝挑出来重新切一遍,基本没有可能。

于是研究团队提出了一个叫UniWorld-Design的框架,核心思路就是把语义化的RGBA图层,作为生成、理解、编辑这三件事的最小单位。

RGBA*:一种图像表示方式,除了常见的红绿蓝三个颜色通道(RGB),额外增加一个Alpha通道,用来表示每个像素的透明度,从而支持"抠图"式的图层叠加。

这个框架里有两个模型。一个叫T2RGBA(文本生成透明素材),另一个叫I2L(图片拆解为图层)。这两个模型合起来,构成了一个从文字到图片、再从图片拆回可编辑图层的完整循环。

从零开始造一个透明素材:T2RGBA

先看第一个模型,T2RGBA,全称Text-to-RGBA。

它做的事情很直接:给一句话描述,比如"一只戴着水手帽的绿松石色鲸鱼",直接生成一张带透明背景的RGBA图片,而不是一张需要你再去抠图的普通照片。

这里有个技术上的巧妙之处。研究团队没有从零训练一个全新的模型来处理透明通道,而是在已有的图像自编码器基础上做了个"微创手术"。

自编码器(VAE)*:一种能把图片压缩成一小段数字编码,再从编码还原回图片的神经网络结构,是几乎所有主流图像生成模型的底层组件。

具体做法是,把编码器最开始那一层和解码器最后那一层,从处理三个颜色通道(RGB)扩展成处理四个通道(RGBA)。原来的RGB权重原样复制过来,新增的透明度通道的权重先设成零,解码器的透明度偏置项设成"完全不透明"。这样一来,改造完的模型起步状态就等同于原来的RGB模型,只是多了一个默认全不透明的透明度通道,之后再通过训练慢慢学会怎么正确地处理透明区域。

如果不这样做,直接从零训练一个RGBA模型会怎样?那意味着要放弃原来RGB模型已经学到的所有关于物体轮廓、光影质感的知识,相当于让一个已经会画画的人重新从拿笔开始学,浪费了大量已有的能力积累。而这种"渐进改造"的方式,更像是给一辆已经会开的车加装一个新功能模块,而不是把整辆车拆了重新造。

训练数据方面,团队用的是内部整理的一批"文字配透明图"的数据集,包括设计素材、抠好的主体图、矢量画转成的插画。透明图片占了训练数据的大多数,但也混入了一部分不透明的图片,防止模型"忘了"怎么处理正常图像。

训练完成之后,模型还要经历一套两阶段的优化流程:先做渐进式蒸馏来提速,再用一种叫DiffusionNFT的方法做强化训练来提质。这个流程我们后面统一讲,因为I2L也用了同一套。

在CLIP Score(一种衡量生成图像和文字描述匹配程度的指标)这个维度上,T2RGBA达到了33.03分,是所有对比模型里最高的,比LayerDiffuse高了13%,比OmniAlpha高了6.5%。不过在FID(衡量生成图和真实图分布相似度)和白底合成后的LPIPS(衡量图像细节相似度)这两个指标上,OmniAlpha表现更好。这说明T2RGBA更擅长"听懂你说的话",但在细节质感上还有提升空间。

拆解一张成品图:I2L怎么做到"拆得干净还能用"

第二个模型是整篇论文里更硬核的部分,叫I2L,Image-to-Layer。

它接收一张已经画好的成品图,加上一句全局指令(比如"把这张图拆成背景、元素和文字"),再加上针对每一层的具体描述,然后同时输出一组排好顺序的、完整的语义图层。

这里的关键词是"完整"。

多数现有的分割方法做的是"可见像素分割",也就是只把画面上肉眼看得见的部分抠出来。这样做有个大问题:如果你把某个遮挡物挪走,被遮住的地方就露出一个透明的洞,因为模型压根没学过那块被遮住的区域应该是什么样。

I2L要解决的正是这个问题。它学的不是"哪里能看见什么",而是"这个物体完整的样子是什么",即便这个物体有一部分被别的东西挡住了。论文管这个叫语义完整图层,而不是可见像素分区。

打个比方,这就像给一栋房子拍照和给房子画建筑图纸的区别。拍照只能记录你镜头前看到的那一面墙,墙后面藏着什么完全不知道;而建筑图纸会把每一层楼、每一根承重柱的完整结构都画出来,哪怕现在被墙面装饰挡住了。等你哪天想拆掉一面墙看看内部结构,有图纸的房子随时能查,只有照片的房子就只能瞎猜。如果I2L也只学"可见分割"这一套,那么用户挪走一个遮挡物之后,看到的就永远是一个不明不白的透明窟窿。

要实现这个目标,光靠数据和模型规模堆不出来,还得解决两个结构性的对应难题。

第一个难题是,每一句针对某一层的描述,必须精确控制住"它对应的那一层",而不能影响到整个图层堆栈的其他部分。第二个难题是,不同图层的图像token(模型内部表示图像信息的基本单元)必须共享同一个画布坐标系,同时又要保持各自独立的身份和先后顺序。

Token*:模型处理信息时切分出的最小单元,图像token对应图片中的一小块区域,文本token对应一个词或字。

为了解决这两个问题,研究团队设计了一套叫LIB-MMDiT(Layer–Instruction Binding MMDiT)的架构,中文可以理解为"图层指令绑定的多模态扩散Transformer"。

它包含两个机制。第一个叫图层指令绑定注意力,做法是给全局指令和整张输入图打上标签-1,给每一层专属的描述和对应的图层图像打上编号i(i是第几层)。这样,某一层的图像在"读取"文字信息时,只能读到全局指令和自己专属的描述,读不到别的层的描述。但图像和图像之间的关注是完全开放的,这样才能让所有图层共同判断彼此的遮挡和堆叠关系。

第二个机制叫图层索引的三维旋转位置编码,简单说就是给每个图像token除了原本的行、列坐标,再加一个"层号"坐标,让模型知道同样位置的一个点,在不同图层里是同一个画布位置,但属于不同的层。

这套设计的效果,从数据上看很明显。

在Crello这个基准测试集上,I2L和目前另一个先进模型Qwen-Image-Layered对比,在每层RGB内容的还原误差上降低了37%(从0.2014降到0.1264),在透明度区域的匹配精度Alpha Soft IoU上提升了34%(从0.5454提升到0.7325)。

| 方法 | RGB L1误差(越低越好) | Alpha Soft IoU(越高越好) |

| Qwen-Image-Layered(4层) | 0.2014 | 0.5454 |

| **UniWorld-I2L(4层)** | **0.1264** | **0.7325** |

在可编辑性指标上,I2L生成的"空白图层"比例下降了63%(从0.35降到0.13),"糊状半透明层"(那种既不干净也不能单独用的层)从1.34降到1.19。

| 方法 | 坏图层数量 | 空白层 | 糊状层 | 内容差异度 |

| Qwen-Image-Layered(4层) | 1.69(占42.3%) | 0.35 | 1.34 | 0.658 |

| **UniWorld-I2L(4层)** | **1.32(占33.0%)** | **0.13** | **1.19** | **0.690** |

还有一组用大语言模型(VLM)打分的评测,从五个维度给拆解结果评分,满分25分。I2L拿到20.43分,Qwen-Image-Layered拿到17.60分。

在这五个维度里,I2L在语义分离度、背景修补、内容分布、内容有效性这四项上都更强,唯独在Alpha清洁度(也就是透明边缘是否干净,没有色彩残留和光晕)上略逊一筹(2.90对3.33)。论文也坦诚承认了这一点,把边缘处理和密集文字识别列为当前的主要局限。

拆完还能再拆一次:指令驱动的递归分解

I2L不只是"拆一次就完事",它支持一种叫指令可寻址的操作方式。

具体来说有三种玩法。

第一种叫顶层分解,就是把一张完整图片按你说的语义类别拆成几层,比如"背景、主体、设计元素、文字"。

第二种叫递归分解,也就是把拆出来的某一层再拿去当输入,进一步细分。比如第一轮拆出了"主体"这一层,里面其实包含了一个人和一只鹦鹉,第二轮就可以再拆一次,把人和鹦鹉分开。

第三种叫目标提取,直接告诉模型"我只要这几个特定元素单独成层,剩下的合并成一层"。

论文里给了大量的实际案例,比如输入一张写着"中秋"字样的月亮海报,第一轮指令是"把这张图拆成背景、元素和文字",第二轮再指定"把左下角的树、右上角的月亮、屋顶上的兔子分别单独提取出来"。模型能连续两轮准确响应,输出的每一层都保持位置对齐、透明度正确。

这个能力为什么重要?

因为它把"拆图层"变成了一个可以被外部智能体(比如自动化设计流水线里的AI助手)调用的工具,而不是一个死板的固定流程。一个多模态智能体可以按需决定"这次要拆多细"、"这次要单独抠出哪个东西",然后把结果交给别的编辑工具去处理,处理完再合成回去。

论文里配的一张流程图讲得很清楚:一个纯像素接口只能把图片扔给智能体,智能体拿到手还得自己想办法猜图里有什么结构;而图层原生的接口直接把一组持久化的、可以单独操作的对象状态摆在智能体面前,它可以直接调用生成、拆解、编辑、合成这几个工具,像搭积木一样组织整个设计流程。

这就好比你去五金店买一套现成的标准化螺丝钉和螺母(图层原生接口),和你去矿场挖一块原始矿石回来自己冶炼、切割、打磨(纯像素接口)。后者理论上也能造出同样的东西,但每一步都要重新发明轮子。如果没有这套标准化的图层接口,每个想做AI辅助设计的团队都得自己再造一遍"怎么从一张图里认出物体边界"这轮子。

训练数据从哪来:不能用AI生成的图自己训练自己

这一部分其实是整篇论文里我觉得最实在的一段。

研究团队面临一个逻辑上的死循环:如果想让I2L学会"完整图层"(包括被遮挡的隐藏内容),那训练数据本身就得包含这些隐藏内容的真实样子。但如果用AI生成的图层来构造训练数据,那些被遮挡的内容也是AI编造出来的,模型学到的东西无非是继承了生成器本身的偏见和局限,越训练越像在拿自己的影子训练自己。

所以团队选择了一条更笨但更扎实的路:直接用设计师亲手做的PSD文件。

PSD*:Photoshop的专属文件格式,保存了一份设计作品里所有独立图层的原始信息,包括被其他图层遮挡的部分。

PSD文件里,被遮挡的图层内容其实一直都完整保存在文件里,只是最终导出成图片时被盖住了看不见。这就相当于拿到了"标准答案",不需要靠模型去猜测被遮挡的部分应该是什么。

具体流程是,先把PSD里的图层渲染出来,用一个视觉语言模型辅助把相关的图层归并成有意义的语义组(比如把"眼睛""鼻子""嘴巴"这几个零散图层合并成"人脸"),再组织成一个树状的层级结构。注意,视觉语言模型只负责"分组建议",所有实际的像素内容都直接来自原始PSD文件,不会被AI二次生成污染。

这棵树建好之后,一份PSD文档就能自动衍生出三种训练样本:树的根节点对应顶层分解任务,树的中间节点对应递归分解任务,选中某些节点加上剩余部分则对应目标提取任务。一份素材,喂养三种能力,这个设计相当聪明,省了不少数据标注的功夫。

让模型跑得快一点:蒸馏与强化学习

一个模型光是效果好还不够,如果推理速度慢到没法用,那价值也大打折扣。

I2L要在一次推理中同时输出好几层完整分辨率的图像,这天然就会让计算序列变得很长,推理成本随之飙升。为了压缩这个成本,团队用了一套两阶段的后训练流程。

第一阶段叫渐进式蒸馏,用一个学生模型去学习一个更慢但更精确的教师模型的行为,目标是把原本需要很多步才能完成的生成过程压缩到八步就能搞定。这个过程借鉴了SDXL-Lightning的渐进对抗蒸馏思路,还额外加入了一个判别器,专门用来区分"这是教师模型真实生成的终点"还是"这是学生模型模仿出来的终点",防止蒸馏后的模型输出变得过度模糊平滑。

团队还试过另一种叫分布匹配蒸馏的技术方案,但发现效果不理想:透明度会莫名其妙变得都很不透明,颜色内容和透明度掩码对不齐,跟着指令的能力和图层之间的一致性也变弱了。这段坦诚的"失败尝试"记录挺难得,说明研究团队确实是踩过坑之后才选定现在这套方案的。

第二阶段是用一种叫DiffusionNFT的强化学习方法做后训练,目的是针对具体任务再打磨输出质量。

DiffusionNFT*:一种基于扩散模型的强化学习后训练方法,核心思路是给模型生成的样本打一个"好坏分数",分数高的样本被进一步强化,分数低的被反向修正。

针对T2RGBA和I2L,团队设计了不同的打分规则。

T2RGBA用了三个打分器:一个专门检查透明度是不是符合预期(该透明的地方透明,该不透明的地方不透明);一个用CLIP式的方法算生成图和文字提示的语义相似度;还有一个直接让一个大语言模型给生成结果打0到5分。这三个分数会先经过一层"透明度是否正确"的把关,如果透明度本身就错了,哪怕另外两项分数再高也没用,相当于一个硬性门槛。

I2L的打分规则更聚焦在图层还原精度上,用逐像素的RGBA绝对误差加上一个感知相似度网络(LPIPS)的组合分数,每一层单独算分再平均,不搞跨层的连乘惯性。

写在后面

读完这篇论文,最触动我的其实不是那些提升百分之几十的指标,而是那个"用PSD文件训练"的决定。

这背后藏着一个挺朴素但容易被忽略的道理:想让AI学会某种"完整性"的认知,你不能靠AI自己生成数据去教AI,因为它没见过真正完整的东西,它只会把自己的偏见传给下一代。这跟教育里"言传不如身教"有点像,你想让模型学会处理被遮挡的隐藏内容,就得先找到真正保存了这些隐藏内容的原始资料,而不是让模型自己瞎猜然后拿猜测结果当教材。

论文里还有个细节值得单独说一下:团队试过用分布匹配蒸馏来提速,结果发现透明度全变得不透明了,这个"失败"被坦率地写进了论文而不是藏起来。做研究的人大概都懂,这种"我们试过A方案但它把颜色和透明度弄乱了,所以换成了B方案"的记录,比一份只报喜不报忧的成功故事更有参考价值。

如果这条路继续走下去,下一步大概会是什么样子?论文结尾提到,团队接下来想把这套能力扩展到"图层插入替换"和"多轮迭代编辑"。那意味着有一天,你也许可以直接跟AI说"把这个人物往左移一点,背景山换成海",而AI真正理解的,不再是一整张照片该怎么重画,而是这句话到底指向了哪一层、该动哪块积木。

Q&A

Q1:UniWorld-Design是什么?

A:UniWorld-Design是一个把图像生成从"画一整张图"改成"生成可编辑图层"的框架,核心是把带透明通道的RGBA图层当作生成、理解和编辑的最小单位,包含T2RGBA(文字生成透明素材)和I2L(图片拆解成图层)两个模型。

Q2:I2L和普通的图像分割工具有什么区别?

A:普通分割只能抠出画面上肉眼可见的部分,被遮挡的地方会留下透明的洞;I2L学的是完整的语义对象,即使某个物体被遮挡了一部分,拆解出来的图层依然是完整的,挪走遮挡物后不会露馅。

Q3:这套技术训练时用的数据从哪里来?

A:团队没有用AI生成的图层做训练数据,而是直接使用设计师制作的PSD文件,因为PSD里被遮挡的图层内容原本就完整保留着,避免了用AI自己编造的内容训练AI导致的偏见传递问题。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
彻查!信号强烈!中央升级反腐“天网”!

彻查!信号强烈!中央升级反腐“天网”!

职场资深秘书
2026-08-19 23:38:51
美联储发布!加息预期突变!沃什意外提议

美联储发布!加息预期突变!沃什意外提议

证券时报
2026-08-20 08:14:02
《牛来》冲向全球,海外社媒炸了!

《牛来》冲向全球,海外社媒炸了!

互联网品牌官
2026-08-19 19:50:46
太过现实!许多广东准大学生,交学费那一刻,才知晓父母并不富裕!

太过现实!许多广东准大学生,交学费那一刻,才知晓父母并不富裕!

解说阿洎
2026-08-19 10:07:32
阳朔网红“千里江山图”打卡点划定摄影师专用机位,当地镇政府:地块属企业承包经营,非公共景区;旅拍空闲时段游客可进入

阳朔网红“千里江山图”打卡点划定摄影师专用机位,当地镇政府:地块属企业承包经营,非公共景区;旅拍空闲时段游客可进入

大风新闻
2026-08-19 18:51:06
Selina接娃现身,状态引热议

Selina接娃现身,状态引热议

草莓解说体育
2026-08-20 10:30:52
奖金被哄抢?王曼昱瑞典站68万奖金,到手所剩无几?许昕没说错

奖金被哄抢?王曼昱瑞典站68万奖金,到手所剩无几?许昕没说错

观锐器
2026-08-19 16:24:31
美女主播自制胸部手柄露脐装,揉胸操控初代马里奥尖叫不断

美女主播自制胸部手柄露脐装,揉胸操控初代马里奥尖叫不断

山月不知2
2026-08-19 16:10:26
是时候说出真相!打越南时损失或超乎想象,从牺牲的名将后代便知

是时候说出真相!打越南时损失或超乎想象,从牺牲的名将后代便知

飞哥谈史
2026-08-17 09:30:28
女子发问“我得了艾滋病,还有人要我吗?” 自称可以退步:可以不要彩礼!评论区一片恐慌,纷纷吐槽!

女子发问“我得了艾滋病,还有人要我吗?” 自称可以退步:可以不要彩礼!评论区一片恐慌,纷纷吐槽!

谭谈社会
2026-08-20 09:13:59
表决仅十几分钟,新防长任命即通过,乌议会打了费多罗夫的脸

表决仅十几分钟,新防长任命即通过,乌议会打了费多罗夫的脸

小影的娱乐
2026-08-20 06:06:27
两性关系:女人暗示你可以“泡她”的6个信号,男人别再装傻了

两性关系:女人暗示你可以“泡她”的6个信号,男人别再装傻了

王二哥老搞笑
2026-08-20 11:05:54
胡赛成孤儿,中东联盟正绞杀所有伊朗系武装

胡赛成孤儿,中东联盟正绞杀所有伊朗系武装

移光幻影
2026-08-19 07:44:36
知名男演员自曝23岁在北京买房,当年房价8000元一平方米,五六年后提前还清贷款

知名男演员自曝23岁在北京买房,当年房价8000元一平方米,五六年后提前还清贷款

天津美食全搜罗
2026-08-19 11:41:32
错过《奥德赛》少赚几个亿!如何留住顶级人才,诺兰给好莱坞上课

错过《奥德赛》少赚几个亿!如何留住顶级人才,诺兰给好莱坞上课

极客电影
2026-08-19 18:46:34
安以轩代老公取款43万遭拒,陈荣炼狱中怒告银行,法院判其败诉

安以轩代老公取款43万遭拒,陈荣炼狱中怒告银行,法院判其败诉

开开森森
2026-08-20 09:01:06
弟弟举报哥哥案反转,母亲首度发声:弟弟当上公务员,嫌我们穷

弟弟举报哥哥案反转,母亲首度发声:弟弟当上公务员,嫌我们穷

荷兰豆爱健康
2026-08-19 04:41:44
“看不懂的东西千万别乱戴!!”哈哈哈哈哈这是哪门子潮人啊!!

“看不懂的东西千万别乱戴!!”哈哈哈哈哈这是哪门子潮人啊!!

不二表姐
2026-08-19 23:48:48
父亲患病,三个儿子凑不齐3万医药费,他没怨言,悄悄卖了祖屋

父亲患病,三个儿子凑不齐3万医药费,他没怨言,悄悄卖了祖屋

兰姐说故事
2026-02-05 10:50:09
从特区变成“特困”,曾与深圳同为特区,这个城市为何扶不上墙?

从特区变成“特困”,曾与深圳同为特区,这个城市为何扶不上墙?

笑熬浆糊111
2026-08-20 07:27:08
2026-08-20 13:12:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9587文章数 568关注度
往期回顾 全部

科技要闻

DeepSeek Harness更新多模态支持

头条要闻

许家印被判无期徒刑 恒大集团、恒大地产等案一审宣判

头条要闻

许家印被判无期徒刑 恒大集团、恒大地产等案一审宣判

体育要闻

拥有“儿皇梦”的罗德里,为何选择巴萨?

娱乐要闻

汪峰也没想到章子怡,挖到了一条财路

财经要闻

许家印被判处无期 恒大集团被罚88.2亿

汽车要闻

第二代家庭旗舰的样子 奕境X9预售价29.98万起

态度原创

教育
手机
旅游
健康
本地

教育要闻

2026雅思暑假班怎么选?先搞清楚这四件事,再对号入座不踩坑

手机要闻

9月9日科技春晚 苹果华为小米新品或同天发布

旅游要闻

夜市、潮饮、露天电影全都有,北京推出夏夜“烟火气地图”

这种脊柱侧弯,运动能救!

本地新闻

先导片|攀登不止,让不同的故事在此连接

无障碍浏览 进入关怀版