![]()
这项由以色列特拉维夫大学与美国康奈尔大学联合开展的研究,以预印本形式于2026年7月13日提交至arXiv,编号为arXiv:2607.11885,有兴趣深入了解的读者可以通过该编号在arXiv平台上查询完整论文。
每个人大概都有过这样的经历:用了一款AI换脸或美颜软件,把自己的照片改得挺满意,但一旦换个背景、换个角度再生成,那个"你"就完全对不上了——明明要的是那个带雀斑的、高鼻梁的、浓眉毛的你,生成出来的却像换了个陌生人。这种感觉就像是你让裁缝按照你的样子定做了一件衣服,结果发现每次量尺寸的结果都不一样,衣服穿上去要么肥要么瘦,总是对不准。
这正是当前AI生成人脸时面临的核心难题:如何对一个人的外貌做出精细调整,同时保证不管在哪张图里,他都还是那个人?特拉维夫大学与康奈尔大学的研究团队提出了一种叫做"潜在身份调整"(Latent-Identity Tuning)的技术框架,专门解决这个问题,让你能够像调音台旋钮一样,精准调节某人外貌的某一个具体细节,而且调整之后的"身份"会稳定地出现在后续所有生成的图像里。
一、先搞清楚问题:为什么精细改脸这么难
要理解这项研究在做什么,先得理解现有技术卡在哪里。
目前主流的AI图像生成工具,比如大家听说过的Stable Diffusion、FLUX这类"文生图"模型,已经能够根据文字描述生成非常逼真的人脸图像。更进一步,还有一类叫做"个性化生成"的技术,它能够读取你提供的一张或几张真实照片,提取出你这个人的面部特征,然后在任意场景下把你画出来——骑马的你、宇航员装扮的你、中世纪骑士造型的你,诸如此类。
但问题来了:这些技术基本上只擅长"复制",而不擅长"修改"。它可以把你的长相忠实地搬到各种场景里,但如果你想改一点点——比如让自己的鼻子稍微小一些,或者添一圈络腮胡,或者让脸上多几颗雀斑——它就会开始犯难。要么改不到位,要么改完之后这个人就不像你了,要么同一个修改在不同图里呈现的效果完全不一致。
更根本的问题在于:现有的图像编辑技术,改的是"图",而不是"人"。你改了这张图,下一张图还是得从头算。就像你在一张纸上画好了一个人的肖像,然后用橡皮擦和铅笔在这张纸上改了改——但如果有人再印一张新的肖像出来,那些改动就消失了,新的图还是原来的样子。
这项研究的核心突破,就是把修改从"图的层面"提升到了"身份表示层面":直接动那个代表这个人"是谁"的核心编码,而不是去改某张具体的图。这样一来,不管之后生成多少张图,用的都是那个被修改过的"身份配方",改动自然就全都带上了。
二、身份是怎么被编码进去的:认识Q-Former
要理解研究团队在哪里动了手脚,先得了解一个叫做"Q-Former"的东西。
在这类个性化生成系统里,有一个专门负责"读脸"的模块。你把一张人脸照片输入进去,这个模块会把照片分析一遍,然后输出一组数字序列——就像是一套密码,里面记录了这张脸的所有特征。这组密码之后会被传递给图像生成模型,告诉它"嘿,你接下来要画的人长这样"。
Q-Former(全称是Querying Transformer,查询变换器)就是这个"读脸编码"模块里的关键组件。它的工作方式有点像一个有着很多专项记者的采访团:每个记者只负责追问人脸的某一个部位——一个专门盯着眼睛看,一个专门关注嘴唇,一个负责记录鼻子的细节。Q-Former维护着一组叫做"查询向量"的学习参数,每个查询向量通过交叉注意力机制去扫描输入的人脸图像,提取它最关心的那部分信息,最终产生一组固定数量的输出向量,这就是"身份令牌"(Identity Tokens)。
研究团队在论文的图2里展示了一个非常直观的发现:当你把Q-Former里不同查询令牌的注意力范围可视化出来时,会发现它们真的各司其职——一个令牌主要关注眼睛区域,另一个关注鼻子,还有一个盯着嘴唇。不仅如此,同一个令牌在处理不同人的脸时,始终盯着同一个区域。这说明Q-Former并不是随机地把整张脸压缩进一个大箱子,而是把不同的面部特征分门别类地装进了不同的格子里。
这个发现非常重要,因为它意味着如果你想改某个人的眉毛,你只需要动负责眉毛的那几个令牌,而不需要把整张脸重新算一遍。这就是精准编辑的基础。
三、改哪几个格子:令牌选择的两种方法
好,既然每个令牌对应着不同的面部区域,那怎么知道"该改哪些令牌"来达成你想要的修改效果?
研究团队提出了两种方法,分别针对不同类型的修改目标。
第一种方法用于处理局部、有明确位置的面部修改,比如"改眼睛""改嘴唇""改鼻子"这类需求。方法的思路出人意料地简单直接:拿一张人脸照片,把你想修改的那个部位从另一张脸上挖出来,粗暴地贴上去(就像小时候拼贴游戏里把不同人脸的五官剪下来拼在一起),然后把原图和拼贴图分别送进编码器,看看两者产生的身份令牌有哪些地方发生了变化。哪个令牌变化最大,说明那个令牌对这个面部区域最敏感,就把它纳入"负责该区域的令牌组"里。
重复这个过程五到十次(每次用不同的人脸做拼贴),统计出哪些令牌最频繁地出现在变化最大的那批里,就形成了一个稳定的令牌子集S,专门负责这个面部区域。这个子集只需要算一次,之后对任何人的脸做同类修改都可以复用。
第二种方法针对的是整体性的、没有固定位置的全局外貌属性,比如"雀斑""肤色""脸颊红晕"。这类属性在脸上各处都有体现,用粘贴补丁的方法没法定位。于是研究团队换了个角度:利用一个有着大量标注信息的人脸数据集(CelebA数据集,里面有20多万张人脸,每张都标注了40个外貌属性),把每张脸编码成身份令牌,然后对每一个令牌单独训练一个线性分类器,看看仅凭这个令牌能不能可靠地判断出一个人是否有雀斑、是否有红晕。如果某个令牌对某个属性的预测准确率超过70%,就说明这个令牌里编码了关于这个属性的信息,把它纳入负责这个属性的令牌组。
两种方法的逻辑可以用一个类比来理解:如果你想知道图书馆里哪个书架放着关于"眼科"的书,第一种方法是先拿一本眼科书走过去,看看哪个书架有反应(上面其他书的分类标签跟着出现了"医学"字样);第二种方法是把图书馆里所有书依次拿到那个书架前,测试哪个书架能最准确地判断"这本书是不是关于雀斑护理的"。两种方法对应不同场景,互相补充。
四、有了令牌组,怎么进行实际编辑
确定了哪些令牌负责哪些面部区域之后,就可以开始对这些令牌动手了。研究团队设计了几种不同的编辑方式,各有适用场景。
最直观的一种是"身份插值",也就是把两个人的身份特征混合在一起。具体做法是把两个人各自的身份令牌按照一定比例加权平均——比如70%取自A,30%取自B——然后用这个混合后的令牌去生成图像。如果你把两个人的全部令牌都混合,就会得到一张介于两人之间的脸,从A渐渐变成B,过渡非常自然,不会有任何突兀的跳跃。这就像是用颜料调色,红色和黄色之间可以有无数种橙色的深浅变化,而不是非得在红色和黄色之间二选一。
更有趣的是"局部身份迁移":只混合负责特定部位的那些令牌,而保持其他令牌不变。比如你觉得B的眼睛好看,就只把负责眼睛的令牌换成B的版本,其余部分还是A的。这样得到的结果就是:A的脸型、鼻子、嘴唇,配上B的眼睛。研究团队在论文里展示了眉周区域(眉毛+眼睑)和嘴唇的迁移效果,效果相当自然,其他面部特征几乎不受影响。
还有一种方法叫"监督线性方向",是基于数据统计找出一个"让脸长出胡须"或"让脸变成光头"的方向。做法是把大量有胡须的人脸和没有胡须的人脸分别编码成令牌向量,然后计算两组的平均值之差,这个差值就代表了"胡须方向"。之后对任何人的身份令牌沿着这个方向移动一定距离,就相当于给这个人"添加胡须",移动多少距离决定了胡须的浓密程度。
另一种监督方法是训练一个支持向量机(SVM,一种常见的分类模型)来区分有某个属性和没有某个属性的两类脸,然后用这个分类器划定的边界线的垂直方向作为编辑方向。研究团队发现这两种方式各有优势:对于脸颊红晕这种细微变化,SVM方向更精准;对于剃光头或留胡子这种大幅度改变,平均值差值方向效果更好。原因在于SVM倾向于找到最具区分性的维度,对小变化很敏感,但对大幅度变化有时候会抓到"捷径"而不够全面;平均值差值则更整体,对大变化方向的描述更完整。
此外,研究团队还探索了不依赖任何标注数据的"无监督方向"——直接用主成分分析(PCA,一种发现数据里最主要变化方向的数学工具)来扫描身份令牌空间,看看其中最显著的变化方向是什么。对一万张FFHQ数据集里的人脸做了PCA之后,他们发现这些方向里有些对应着年龄变化,有些对应着眼睛的睁闭程度,有些对应着嘴唇颜色的深浅。
当PCA作用于所有令牌时,捕捉到的是整体性的全局变化,比如年龄感,但这些方向往往会同时影响多个面部区域,局部控制力较弱。当PCA只作用于某个特定令牌时,控制力很精准,但效果太微弱,因为信息分散在多个令牌里,单个令牌改变太小。效果最好的是介于两者之间的方式:用令牌选择方法确定负责某个区域的令牌子集,只对这个子集做PCA,然后沿着主方向移动。这样既保持了局部性,又有足够的编辑力度。比如对眼睛的令牌子集做PCA,就能发现控制眼睛睁开程度的方向,从"眯眼"到"大眼"可以连续调节,而且对其他面部特征影响极小。
五、还有一种"手工贴补丁"的玩法
除了数学方向上的操作,研究团队还发现了一种更加直觉性的编辑方式,叫做"补丁编辑"(Patch Editing)。
具体来说,就是在输入照片上做像素层面的粗糙替换——把一种特定风格的胡须图像直接贴到人脸上,或者把某副眼镜贴到鼻梁上,然后把这张"拼贴图"送进编码器,用它生成的身份令牌来驱动后续的图像生成。
令人惊喜的是,编码器并不会被粗糙的拼贴边缘所干扰,而是会把这个"意图"理解得相当准确——生成出来的图像里,那种类型的胡须或那副眼镜会以非常自然、融合的方式出现在人脸上,而且能够稳定出现在不同场景的多张生成图里。
这种方式特别适合那些用文字很难准确描述的修改需求——你可能说不清楚"我要那种留着下唇小撮胡的梵戴克(Van Dyke)造型",但你可以直接从网上找一张那种胡型的参考图贴上去。论文里展示了贴入不同风格眼睛、嘴唇和梵戴克胡须的实验结果,在"登山场景"和"城市场景"两种不同的生成提示下,那些特定的外貌细节都保持了一致。
六、跟其他方法比,这套框架的表现如何
研究团队做了相当系统的比较实验。他们构建了一套包含20个身份图像的测试基准,针对五种基础外貌修改(包括添加/去除胡须、剃光头、改变性别、添加/去除眼镜、添加/去除刘海)和七种需要更细腻控制的高级修改(包括雀斑、弓形眉、浓眉、厚唇、小胡子、苍白肤色、玫瑰色脸颊),配合13条由大语言模型生成的场景描述提示,每个修改对每个方法都生成13张图像,总计超过3000张图用于比较。
评估指标从三个维度衡量:一是"身份一致性",用ArcFace人脸识别算法来测量同一个人在不同生成图之间的长相相似度,分数越高说明同一身份在不同图里长得越像;二是"编辑贴合度",用一个视觉问答模型来判断生成的图像有没有准确地完成了指定的修改;三是"提示词贴合度",同样用视觉问答模型来判断生成的图像是否符合文字场景描述。
被比较的方法包括两种专门做身份编辑的工具:PreciseControl和Weights2Weights(简称W2W),以及当时最先进的图像编辑模型Flux Kontext(分两种用法:直接一步生成的Kontext Direct,以及先改图再用改图生成场景的Kontext Sequential)。
在身份一致性这个维度上,PreciseControl得分0.25,W2W得分0.31,Flux Kontext Direct得分0.37,Flux Kontext Sequential得分0.51,而这项研究的方法(分别基于Omni-ID和PuLID两种编码器)得分为0.47和0.49。在编辑贴合度上,这项研究方法得分与Kontext Direct相当(均约0.79-0.81),同时远高于PreciseControl和W2W。在提示词贴合度上,这项研究方法得分0.88-0.91,显著高于所有基线方法。
在涉及高级精细修改的场景下,W2W和PreciseControl的表现都大幅下滑甚至无法支持(PreciseControl不支持高级修改),而这项研究方法在高级修改上的表现与基础修改相当,没有明显退步。Kontext Sequential在身份一致性上与这项研究接近,但在高级修改的编辑贴合度和提示词贴合度上都落后。
研究团队还做了一项用户研究,邀请参与者在看到原始人脸照片和编辑指令之后,对比每种方法生成的结果,从身份保留、跨图身份一致性、编辑贴合度、提示词贴合度和综合偏好五个维度做出选择。最终,在与W2W的比较中这项研究方法的整体偏好赢率达到94%;与Kontext Direct相比赢率85%;与Kontext Sequential相比赢率83%。
七、这套方法有没有局限
研究团队没有回避这套方法的局限性,在论文里专门讨论了一个重要的制约因素:Q-Former的令牌数量。
前面说过,Q-Former会把人脸信息分装进一组令牌里。如果令牌数量充足,每个令牌就能专注于一个小的面部区域,形成自然的"分区",局部编辑就可以做得很精准。但如果令牌数量太少,每个令牌就不得不同时兼顾多个面部特征,这时候你想只改眼睛,但负责"眼睛"的那个令牌里还混着其他特征的信息,动了它就会产生连带的变化。
这个问题在使用监督方向和无监督PCA方向时影响相对较小,因为这些方向是从大量数据里统计出来的,能够找到即便在"混合"令牌里也比较纯净的变化方向。但如果你想做更直接的令牌替换(比如把A的某个令牌直接换成B的),令牌数量不足就会导致"溢出效应",改了眼睛不小心把鼻子也带变形了。
研究团队由此建议,未来设计个性化生成模型时,应该在Q-Former的令牌数量上给足余量,这样不仅对模型本身的生成质量有好处,还能为下游的精细编辑任务提供更好的基础。
说到底,这项研究做的事情可以用一句话来概括:把对人脸的修改从"每次从头来"变成了"一次调好,处处生效"。
这背后的关键洞察在于,当前最先进的人脸编码器其实已经悄悄地学会了把脸的不同部位分开记录,只是之前没人去细究这些记录之间的关系。研究团队通过两种令牌选择方法找到了每个面部区域对应的"档案格子",再用数学手段在这些格子里找出有意义的变化方向,就把一个原本"只会复制、不会修改"的系统变成了一个具备精细改写能力的工具。
对于普通用户来说,这项研究意味着未来的AI图像工具可能真的能做到:"帮我把我的照片里的鼻子改小一点,然后在任何你帮我生成的图里,我的鼻子都是这个新的样子。"不是改完一张扔掉,而是修改之后的"你"成为一个持续生效的新设定。
这同时也引出了研究团队自己提到的社会影响问题:精细控制面部特征的能力在创意表达和个人定制方面有广泛的正面应用,但也可能被用于生成误导性内容或未经本人同意地改变他人形象。研究团队鼓励持续发展检测算法、推行生成内容水印机制,以及在使用他人肖像时遵守明确的授权流程。
有兴趣深入了解这套方法的全部技术细节、实验数据和可视化结果的读者,可以在arXiv上通过编号2607.11885找到完整论文。
Q&A
Q1:什么是"身份令牌",它在人脸生成里起什么作用?
A:身份令牌是Q-Former编码器读取一张人脸照片之后输出的一组数字向量,里面记录了这张脸的外貌特征。图像生成模型接收这组令牌后,就知道要画一个什么样的人。研究发现,不同的令牌对应着脸的不同区域——某个令牌管眼睛,某个令牌管鼻子,这为精细编辑奠定了基础。
Q2:潜在身份调整和普通的图像编辑软件有什么区别?
A:普通图像编辑是改某一张具体的图,改完这张就完了,下次重新生成还是原来的样子。潜在身份调整改的是编码器输出的"身份表示"本身——改了之后,不管之后生成多少张图,这个改动都会保留,就像改了模具而不是改了单件产品。
Q3:Flux Kontext这类图像编辑模型和这项研究的方法主要差距在哪里?
A:Flux Kontext做的是图像层面的编辑,每次生成都是独立的,没有持续的"身份档案",所以在多张图之间保持同一个人的一致性较难。这项研究的方法则通过修改身份令牌来锁定改动,跨图一致性明显更高,尤其在需要细腻控制的高级修改上(如雀斑、特定眉形)差距更为突出。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.