大家好,欢迎来到AI变革。
大伙儿,听说最近非常火爆的真人动作转AI角色玩法了吗?
我手里正好有一段二十秒的武术展示视频。
一个男运动员穿着红色练功服,在体育馆的台子上打了一整套,腾空飞脚,贴地扫堂腿,身体横着甩出去的旋子,连续的弓步冲拳,还有侧手翻,最后一拳定住,结尾镜头慢慢推到了近景。
动作密度非常高,属于那种你明知道厉害、但很难用嘴复述清楚的东西。
我想干的事听起来挺简单,让一只功夫片质感的3D熊猫,在一片竹林里,把这套动作一模一样地打一遍。
人换成熊猫,体育馆换成竹林,红色练功服和背景统统不要,只留下动作和镜头。
就这么个需求,我用老办法做,一直不满意,最后是靠LibTV刚上线的深度动作捕捉才真正跑通。
这篇我就把整个过程说明白。
![]()
这是我制作的熊猫。
先说这件事为什么难,难到我觉得值得专门写一篇。
你现在可以试着用文字把这套动作写清楚。
人要先压低、蹬地、拧腰,然后整个身体横着甩到空中,和地面平行,两条腿前后打开,再顺势转体落地。
你把这些写进提示词,模型理解的和地面平行可能是趴下去,拧腰甩出去可能是原地转个圈。
更别说这二十秒里有十几个动作咬在一起,动作之间怎么衔接、重心怎么换、第几秒腾空第几秒落地,文字根本承载不了。
这就是第一个痛点,复杂动态,尤其是这种带腾空、带转体、带地面技术的高难度动作,靠提示词几乎是描述不准的。
那直接上参考视频不就行了,这正是我一开始的做法。
![]()
直接进行参考生成。
然后我结结实实撞上了第二个痛点,参考视频是个打包货,它给你的从来不只是动作。
那段原片里,有太多的元素。
你把整段视频挂给模型,跟它说换成熊猫和竹林,模型并不会只取动作。
来看看你直接参考生成的效果。
乍一看感觉不错是吧,但你仔细去品,就会发现生成的视频和原视频的背景声音有重叠,尤其是原视频打拳时的喊声,全都复刻过来了,不符合角色的形象,还好是个拟人的男熊猫,不然更加违和。
还有就是动作节奏对不上,每个时间点都有问题。
我接下来用同一段武术原片,同一个视频模型,同一句提示词,同一套参数在LibTV里把原片过一遍深度动作捕捉,拿得到的深度动态节点当参考。
两组唯一的区别就是参考源。
我把那段武术视频传到画布上,点中这个视频节点,去顶部工具栏找逐帧拉片,在它的下拉菜单里找到深度动作捕捉。
![]()
点进去,选处理分辨率,再点生成。
![]()
画布上会多出一个新节点。
![]()
这就是原片的深度动态版本,一段偏单色的画面,你能清楚看到一个人形轮廓在里面跳跃、扫腿、横飞、出拳,但原来那张脸、红色练功服、蓝色台子、舞台灯光全被抹掉了,剩下的只有身体在三维空间里怎么运动。
我把它连到视频生成节点上。
![]()
相同的提示词进行生成。
来看一下效果。
连续弓步冲拳那段也有意思。
直接参考原视频的熊猫出拳时明显时间要晚了两秒。
参考深度动作捕捉的视频镜头推近,节奏和原片严丝合缝。
测到这儿,我把什么样的素材最该用深度动作捕捉总结一下。
一是空间感得强,人物要在画面里真的移动,有走位、有远近变化,站桩念台词那种用不上它。
二是动作幅度要大,最好带腾空、转体、下蹲、地面动作,越是文字写不出来的,它越值钱。
三是原片别用扁平动画,那种本身就没什么立体空间关系的画面,深度提取也提不出多少东西,真人写实、立体、有光影的素材才最合适。
之后我还要说一下LibTV这次一起更新的智能剪辑,我正好也一起测了一下。
和大家说,其实剪口播一直是我最烦的活。
找卡壳、去口水词和重复、重新排结构、再上花字字幕,没半个小时下不来。
我手头正好有个需要剪的例子,一个女主播做职场方向,五段十来秒的视频。
这5个视频里总有说错,有重复说的。
这次我直接在画布上加了个智能剪辑节点,选口播视频。
![]()
五段素材全部选上,已经配好了提示词。
![]()
它先把每段讲了什么理解一遍,自动粗剪。
五段零散素材一共有一分钟。
最后剪辑下来有38秒,说明有20多秒是不能用的。
字幕都给我配好了。
智能剪辑先把人最耗时间的那部分机械活替你干掉,把判断和创作留给你自己,简直太适合媒体人了。
测完我最大的感受是,AI视频这两年卷来卷去,明面上都在卷谁的画面更精致,可真正做内容的人,私底下最迫切的需求全是可控两个字。
我脑子里明明看得见这套武术该怎么打、镜头该怎么走,就是没法稳定地让AI照做,要么它听不懂我的文字,要么它顺手抄走我根本不想让它抄的东西。
深度动作捕捉真正打动我的,是它的可控,从控制一张画面长什么样,推进到控制动作、走位、运镜和空间关系。
动作其实是一段视频的骨架,长相、服装、场景、画风,都是挂在骨架上的皮肉。
以前你喂参考,是连皮带骨塞给它,它当然连皮肉一起抄。
现在你能先把骨架单独抽出来,皮肉想换成熊猫就换成熊猫,想放进竹林就放进竹林。
测完我发现,这才应该是参考视频本来应该有的效果。
地址我放在这了,https://www.liblib.tv/ ,逐帧拉片的下拉里就能找到深度动作捕捉。
真心建议你也找一段动作足够狠的视频,做一次自己想做的视频,亲自过一遍,你就明白我为什么愿意为它写这么长一篇文章了。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.