AI画图最大的坑,不是丑,是不听指挥
大多数AI生成的图片,构图都像同一个模子刻出来的。人物居中,镜头齐眼,画面没什么纵深。看起来还行,但根本看不出模型能不能把相机放到你指定的位置。
![]()
这次我拿Tsubaki.3做了九组测试,每组都要求一个具体的镜头角度或者画面安排方式,然后检查它到底有没有照做。判断标准只有一个:我描述的那个精确设定,有没有出现在成片里。
相机高度、纵深层次顺序、畸变、每个主体落在画面的哪个位置。如果一眼就能看到我要求的东西,算通过;如果给我一张好看但无视指令的图,那就不算。
低角度和高角度,相机高度变没变
最干净的相机测试,是同一个主体拍两次,只改相机高度。我用了一个站在战场上的独行骑士。
低角度镜头里,相机几乎贴地,骑士居高临下压过来,靴子和腿占满前景,头显得又小又远,背后是风暴云和破旗。高角度镜头里,相机从高处陡直往下看,地面填满画面,她的头和肩膀最大,脚在下方变小,影子横在泥地上。
两个角度都落地了,差别很明显。关键不是她姿势变了,而是透视关系变了。模型理解了相机高度,这正是测试的核心。唯一的小瑕疵是,高角度那张是陡峭的俯视,而不是完全垂直的正俯视。
走廊纵深,线性透视有没有拉出来
这一组测的是线性透视。画面里有没有一条真正往远处收窄的线,而不是背景随便糊一层景深。
从结果看,走廊的延伸感是成立的。近处的结构大,远处的结构小,视线会被自然地带向画面深处。模型没有把纵深偷换成模糊背景,而是真的在安排前景、中景和远景的尺寸关系。
这类测试最容易翻车的地方,是模型把“有深度”理解成“背景虚化”。但Tsubaki.3在这组里没有走这条捷径,透视收缩是实打实画出来的。
畸变控制,广角效果有没有过头
广角镜头会带来边缘拉伸和近大远小的夸张效果,但很多模型一听到“广角”就把画面扭成一团。这组测试看的是畸变有没有被控制在合理范围。
成片里,靠近画面边缘的部分确实有拉伸感,主体也因为靠近镜头而显得更大,但整体没有崩坏。畸变服务于空间感,而不是毁掉结构。
这说明模型对镜头特性的理解不是简单贴标签。它知道广角意味着什么,也知道什么时候该收住。
主体落位,说放左边就不会跑中间
很多模型有个坏习惯:不管你要求什么构图,最后都把主体放回正中间。这组测试专门检查主体能不能偏离中心,落在指定位置。
从结果看,主体确实待在了要求的一侧,画面另一侧留出了空间。没有出现“嘴上答应,手上还是居中”的情况。
这一点对实际使用很重要。如果每次都要手动裁切或者后期调整,那所谓的构图控制就只是摆设。Tsubaki.3在这组里表现出了基本的执行力。
九组测试下来,真正能用的结论
这九组测试覆盖了相机高度、线性透视、畸变、主体落位等不同维度的控制需求。Tsubaki.3的整体表现是:大部分指令能落地,少数地方有偏差,但没有出现大面积无视指令的情况。
最值得肯定的是,它在透视和纵深上的理解不是靠模糊背景糊弄出来的。相机高度变化时,透视关系真的变了;走廊纵深测试里,近大远小的尺寸关系是成立的。
当然,它也不是完美无缺。高角度那张没有做到完全垂直的正俯视,说明在极端角度下还有偏差。但如果你需要的是一个能听懂相机位置、而不是只会出漂亮图的模型,这九组测试给出的答案是有参考价值的。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.