做AI动画的人大多有一套固定流程:生成角色设定图,永远是四分之三身位、正面、侧面、背面,一套服装,中性姿势。干净、统一,动画师想要的东西全在上面。然后拍到一场戏的第四十个镜头左右,脸开始飘了。下颌变方了一点,两眼间距变宽了一点。如果不是盯着每一张脸剪了一整天,根本没人看得出来。 问题出在一个很少被点破的地方:一张参考图,被同时要求干两件互不相关的事——撑住身体比例,和撑住脸部身份。而大多数AI视频模型在脸占画面比例很小时,只会认真对待其中一件。一张全身参考图拍一张脸,就像护照照片拍风景:技术上存在,但作为主要信息来源毫无用处。 **为什么脸会漂移** 模型是从一小块低分辨率像素里提取身份的。在标准的四分之三身位参考图上,脸大概只占画面的5%到8%。参考图要干的活不止一件:衣服的缝线、皮带扣、靴子,全都在争夺模型编码这张图时那笔固定的token预算。身体赢了。而观众真正会一个镜头一个镜头追踪的脸,拿到的是剩下的边角料。 这不是猜测。Runway自家的Gen-4 References文档就建议用全身提示,专门为了避免出现被裁切的结果——这说明一旦你要求完整人形,模型的默认行为就已经把脸当成次要信息了。Kling的Image 3.0指南从另一个方向把同样的取舍讲明白了:正面朝向的图片一致性最高。这条建议只有在非正面或局部参考是常见失败模式时才有意义。 **把脸和身体拆到两张图上** 今年在AI电影制作圈子里传开的解法很直接:别把脸和身体放在同一张面板上。做一套参考图,一张全身面板不带任何值得编码的头部细节,在脖子处裁掉或者直接给背面;另一张完全独立的特写面板,只用来锁脸。 有位创作者正在做一部十二分钟的AI动画短片,主角是一对同卵双胞胎——这是相当残酷的一致性测试,因为模型几乎只能靠脸来区分两个人。他试完这套方法后说得很直白:听起来很粗暴,但比试过的任何方法都好用。 逻辑说出来就通了。全身面板负责比例、服装和剪影,脸部面板负责身份。把两者合并到一张图里,并不会省下一个参考位,反而浪费了一个——因为模型仍然要选择优先处理哪件事,而它通常选错。 一套可用的参考图大致长这样: - 一张全身正面面板,中性姿势,脸裁掉或转开,只锁比例和服装 - 一张紧凑的脸部特写,中性表情,均匀光照,锁骨骼结构和五官 - 如果角色经常出现在侧面镜头里,再加一到两张四分之三角度图 - 一段简短文字,记录静态图带不了的东西:跛脚、口头禅、只在特定光线下才显出的疤 一张图回答不了两个不同的问题。问它这个人穿什么,它答得很好。从同一张图里问它这张脸属于谁,它通常靠猜。 **参考图数量才是真正的瓶颈** 大多数教程跳过这一段,但这恰恰是卡点所在。每个平台都限制单次生成能调用多少张参考图,这个上限决定了“多加几张参考”到底是不是一个选项。 Runway Gen-4 References每次生成最多允许三张活跃参考。一张给身体、一张给脸,就只剩一个位置留给道具、第二个角色或环境板。Seedance 2.0在2026年2月彻底重写,单次生成最多接受十二个参考素材,图像、视频、音频合并计算,直接标记进提示词。在Runway上,把一个角色拆成身体和脸两个专属位置,还没等第二个角色或道具入镜,预算就快用掉一半了。在Seedance上,两个角色各自配脸加身体都还有余量。 先定参考预算,再做设定图,别等镜头崩了才想这件事。 **不是每个镜头都需要两张面板** 紧凑的对话特写几乎用不上身体参考:只喂脸部面板,把位置省给别的东西。角色在画面里很小的远景建立镜头,几乎用不上脸部面板,剪影和服装承担了全部可见信息。 错误在于把参考集当成整个项目固定不变的东西,而不是按镜头挑合适的一两张面板——就像摄影指导拍特写和拍远景会用不同的镜头。 几个值得直接点名的常见错误: - 不管什么景别都复用同一套双面板参考,把预算浪费在当前镜头根本看不见的细节上 - 脸部面板用四分之三角度而不是正对镜头,多个平台自己的文档都指出这是更弱的锚点 - 把锁定的种子当成锁定参考图的替代品。种子控制的是初始噪声,不是身份,它没法像真正的参考那样把一张脸稳住 - 完全跳过文字备注,指望一张静态图去承载跛脚、口音,或者只在特定光线下才看得见的疤
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.