Nose
当下AI生成视频最大的痛点是什么,做过的都懂。一言以蔽之,就是大模型不听话、听不懂话,不能严格按照创作者的意图去工作。
其实在生成复杂环境和风格质感方面,大模型现在的能力并不差,但最难让它理解的意图,我认为还是场面调度,是运镜。
最近找到一个新工具,利用白模功能,做了几支视频,重点就是想解决精准场面调度的难题。看看效果:
第一支视频是一个相对简单的十秒左右的环绕镜头。
第二段是一个夕阳离别的场景,需要人物处在精确的空间关系中。
第三段是一组较为复杂的滑板场面,包含一个低机位的跟拍,一个22秒的拍摄对象多人接力长镜头,一个摄影机90度倾斜加180度滚翻再回正的花哨镜头。
说100%实现调度意图肯定夸张了,但实现85%是有的。说说制作这几个视频的过程,我也是收获巨大。
第一个视频里人物是一个类似梅尔维尔电影里的冷静杀手,行走在法国城市的街头。怎么处理环绕?我希望从杀手的右肩开始,顺时针绕到前方,再回到他的正后方,目送他走远。过程中,会有一些细节,包括最开始入画时,人物是处于半身入画的中近景景别,慢慢变成胸部至肩部的近景,绕到后方后景别又有一个变大的过程。
![]()
我先试了纯文字生视频,用极为精细的语言描述了整个运镜过程,自以为万无一失,但还是进入了漫长的抽卡过程,每次不是距离不对,就是速度不对,或者景别不对。五六次之后,有一次勉强接近我的初衷。
随后尝试了白模预演台,一开始建模也摸索了一会。这里要实话实说,建模并非毫无门槛就能上手,起码也要花半小时摸索一下功能和界面,再手把手做两次才能熟练,但这个学习成本,比Blender低多了吧?
我在白模中输入街道参考图,它用几分钟时间就3D建模成功,然后检查空间层次、物体比例是否符合预期,这一般是没问题的。再下一步,把人物放到街道模型上的准确位置,同时安置虚拟摄影机的初始机位和运动路径,也设置好人物的起点、终点和移动路线。
![]()
因为这10秒镜头是一镜到底,让摄影机和人物在同一条连续时间线上完成运动就行。如果需要多机位切换,可以分别设定各个机位及切换位置。只要脑中有清晰的镜头调度规划,加上一定的空间思维能力,把运镜「翻译」成白模,这个环节很快就可以完成。
完成基本调度后,我预览白模视频,如果和设计没什么出入,就可以录制白模视频了。接下来回到画布,进入生成阶段。这时候,我先把白模视频加入作为运镜参考,也可以引入人物三视图、场景俯瞰图等作为视觉参考,在提示词中就只需要规定这场戏的内容,也就是人物行为、氛围、光线、表演这些就行。
![]()
有一点需要提醒,建好白模之后,提示词中反而不应该继续输入大量运镜指令。因为预演台的价值就是省掉一部分提示词,这时摄影机运动已经由白模负责,如果一边让白模规定摄影机轨迹,一边又在提示词里要求摄影机后拉、环绕、转向,两套指令可能发生冲突。我一开始也不知道这个窍门,还以为越详细越好,结果生成视频反而不够准确,后来从提示词中将运镜和走位指令全部删除,反而一步到位了。
结果就是,在我掌握白模使用窍门之后,仅用了一次机会,就得到了极为接近构思的「独行杀手环绕镜头」。如果不放心,在不改白模的情况下,还可以稍微改下风格提示词,重新生成一个版本。新版本的风格质感颇不一样,但运镜和走位几乎一模一样。
![]()
所以,预演台的核心功能就是一句话,上传场景参考图,快速生成3D白模场景,再在白模场景中非常精确地控制镜头和人物运动,再交给大模型去生成最终的影像。
白模并不是那种上传图片之后,立刻完成整个镜头的一键出片工具。也就是说,人物形象、台词、视觉风格等等方面,仍然靠文字和大模型沟通,但运镜和场面调度可以完全交给白模,让它精准实现我们的想法。最大的好处,是大大节省了抽卡时间和成本,按一个镜头二十多块算,稍微复杂镜头抽四五次才能有一条可用,省下的成本有100元了。再考虑运镜准确性呢?更不能比了。
再说第二段夕阳离别戏。内容是一对中年情侣的最后一面,说的是女主角上车后,发现男主角在等自己,她犹豫了一瞬间,决定狠心开车离开,汽车从男人身旁驶过,男人留在原地,她离开之后终于哭出来。
这组场景的灵感,来自伊斯特伍德和梅丽尔·斯特里普在《廊桥遗梦》中的那场雨中分别戏,不过我重构了行动逻辑和环境,想试试能否用白模来实现这种细腻的情感互动。
![]()
《廊桥遗梦》
这场戏的情绪建立在一系列很小的空间关系上。我想精确设定男人和汽车的站位距离和方位、汽车启动时的速度及加速度。因为如果男人离汽车太近,告别会显得具有某种挽留意味,这是我不想要的。若距离太远,两个人之间的目光又难以成立。
道路空间关系也很关键,如果模型擅自把男人移动到另一侧,女人的视线方向和汽车经过他身旁的路线都会失去连续性。事实上,我在测试用纯文字生场这场戏时,不论多么详细规定男人和汽车的站位关系,模型总是有一定概率,将男人直愣愣地放在汽车正前方,想要拦车的架势,那就搞笑了。
![]()
纯文字提示词生成,无法正确处理空间关系
用预演台将位置关系定死之后,再没有出现这种情况。
最后说说这次难度最大的一组镜头,是在一座欧洲城市跟拍三个滑板少年。
难度较大的是当中有一个多人接力的镜头,有点受到著名滑板电影《Pretty Sweet》的启发。《Pretty Sweet》片头用无人机航拍实现了多个滑手的镜头主体转换,我想在地面实现更复杂的调度,同时也实现多个滑手的接力,这对真人实拍来说很难办到。
![]()
《Pretty Sweet》
AI倒是可以一试,但这样的镜头对AI来说也有另外一种难度。因为所有动作环环相扣,下一个动作都建立在上一个动作留下的空间条件上,必须要求AI深入理解空间的整体性,而且22秒一镜到底过程中三次变换拍摄主体,AI经常把这种变换用「超现实逻辑」去处理。
![]()
比如说,有的人物入画时竟然凭空出现,大变活人,或者出画时像幽灵一样蒸发,还有同一个人在画面上分裂成双胞胎,还比如A从某人背后掠过,被短暂遮挡后,穿出时竟会变成B……这都是大模型很容易犯的错误,因为它缺少对「真实世界」的认知。但如果你以为用了约束语或关键帧来强制规定每个人物的入画出画,就解决了问题,那也想简单了。
![]()
纯提示词容易造成角色分裂穿帮
我非常严谨地对比了两种工作流程的输出结果。在纯文字提示词实践中,不论多么详细地规定人物的运动轨迹,模型仍然会犯上述那些让人抓狂的错误。哦,还有前面说的倾斜加滚翻镜头,模型尤其容易理解为普通的画面倾斜,它可能不太理解摄影机本身在空间中经历翻滚是什么样子。
那反复抽卡就能解决这些问题吗?事实上不能,我试了不下十遍,每一次都变着法子出现某种不能忍受的穿帮。因为镜头运动过于复杂,不管提示词写得多么完美,因为完美也意味着复杂,模型在执行的时候,可能因为命令超载而选择性执行,那再完美也没用。如果不追求完美和复杂,提示词写得简明扼要,那就意味着放弃精确,让模型自由随意发挥,这同样不是我的本意。
![]()
最终还是用预演台,解决了上面这些关于运镜的问题。当然,这次建白模也花了比较长的时间。比如长街上的退行跟拍,涉及复杂的人物走位和交接,还有专门的滑板技术动作,还比如最后那个镜头倾斜加翻滚,都需要微操般的精确。但磨刀不误砍柴工,以结果而论,还是值得的。
到了生成的一步,前两次抽卡几乎立刻就做到了镜头只有很少瑕疵。是的,白模并不能一劳永逸避免抽卡,因为现阶段模型的执行仍存在不可控性,有些bug是关于人物肢体动作的,有些是关于场景渲染的,都有可能随机出现。但白模可以大大减少抽卡的次数,后来我微调了提示词,又试了两次,就获得了比较满意的镜头。
试用下来,我给updream推出的预演台功能可以打85分。在我看来,它把专业和业余之间的鸿沟,进一步缩小了。
AI生成影像,本就是让业余人士也获得了制作精美影像的能力。但慢慢我们发现,普通人很难发挥出AI百分之百的能力。当我们只能运用它40%的实力时,很难说可以借此达到专业影像的水平。现在updream的这种预演台,就是来再次缩短40%差距的,它让业余人士也获得了设计复杂镜头、执行复杂镜头的能力。
有一点我反复强调,白模不是一劳永逸、一键出片的。它仍然需要我们时不时返工,精修每一个镜头,但它改变了返工的性质和流程。
![]()
清晰的工作流
过去一个镜头不对,只能反复修改提示词,重新生成。至于到底能实现多少意图,是一个脱离我们掌控的概率游戏。现在可以先在白模阶段找到具体问题,再对机位或运动路径进行局部微调。运气成分不能说没有,但这开始接近正常影视制作中的修改。我们知道自己在改什么,也大致能预判生成的结果是什么样子。
要我说,预演台最有价值的地方还真不是省时省钱,而是它让AI影像创作,真的更接近「创作」了。
场面调度是电影艺术的灵魂,如果连场面调度都要交给模型碰运气,这的确还不算一种自主性的创作。现在这种白模能力,让我们在AI影像生成这条路上,慢慢开始掌握自主权。
AI影像出现以来,大家都在说什么技术平权、创作平权。我的理解,这并不是让专业能力失去价值,也不是让每个人按下按钮就自动成为导演。恰恰相反,技术在不断降低物质门槛、资金门槛,真正决定结果的变成了创作者是否理解空间、调度、节奏和镜头。
除了创造力本身,其他东西都不构成你的障碍。
我们离这一天,又近了一步。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.