半个多月前我写过一篇OiiOii,就是拆「AI视频成片质量公式」的那篇。讲它怎么用一个7人的AI虚拟团队,把我的一句话变成一部4分多钟的叙事动画。
那篇里我还动手复刻了一条B站爆款,「地牢酒馆」。生成环节Agent帮我包圆了,但最关键的一步是我自己来的:一帧帧看原片,把它的风格逻辑总结出来(第一视角、单角色单段互动、喝完酒的荒诞反应),再翻译成故事描述喂给它。成片效果不错,但拆原片这步,靠的是我看片多。
我还在文章里留过一句猜测。当时解释「为什么OiiOii不用你写提示词」,我说:
按我的理解,是因为OiiOii对影视工作流里不同角色的技能、各类AI模型的能力有足够的领域认知,所以他们把这变成了一个类似skill的东西,植入在了视频创作流程里。
纯粹是从产品行为反推,猜他们内部大概是怎么做的。
上周,OiiOii官宣2.0,三个新能力:智能画布、拉片复刻、Skill库。我之前那句「类似skill的东西」,他们直接做成了一个叫Skill库的功能;我上次人肉拆片复刻的整个过程,被收进了一个叫拉片复刻的按钮里。
![]()
上篇我就觉得OiiOii的操作已经够傻瓜式了。这次这三个升级,我正好想看看,他们到底又把AI视频的创作门槛压低到了什么地步。三个功能我都真机跑了一遍,挨个说。
智能画布:从「改哪一栏」到「张嘴说」
上篇我说OiiOii给你的不是一个万能工具,是一个团队,你的位置是导演。1.0的画布我当时的评价是「Agent把底牌全摊开了」:每个分镜的提示词拆成画面描述、角色动作、镜头运动几栏,想改哪儿点哪栏。已经很可控,但改的动作还落在你头上,你得知道该动哪一栏。
2.0的智能画布把这一步也接管了。现在你直接对着画布说人话。
我拿上篇那个天文馆项目试的。点开男主角「陆星河」的立绘,全程不写一个提示词,就打了一句大白话:「把这个角色改得年轻一点,像刚毕业的大学生,笑起来更亲切」。它自己把这张图当参考,调角色总监重画,大概20秒,陆星河就从一个西装革履的天体物理研究员,变成了一个穿背带裤、戴护目镜、表情松弛的年轻人。我没碰任何一栏提示词,全程就是聊天框里打了那么一句话。
![]()
这里有个我觉得该说的真实槽点:它理解得有点放飞。我只想让他「更年轻、更亲切」,它顺手把正装也换成了休闲装。
最终做出的成片部分为了和女主更搭配,我用的还是西装版本的男主
口语指令省事,但你脑子里默认、嘴上没说的那部分,它不一定接得住。这点后面拉片复刻那节还会再撞上一次,先记着。
2.0里这7个Agent也有了正式编制:角色总监、分镜总监、音乐总监,各管一摊。你说要什么,叫谁干活是它们自己判断。
![]()
还有个对重度用户更实在的细节:多任务能并行。一边改角色图、一边改场景图、一边生视频,不用一个等一个。加上2.0接了满血版不排队的Seedance 2.0,等片时间确实短了不少。
拉片复刻:上次我一帧帧看的片,它50秒拆完了
这是三个里我期待最高的,因为复刻爆款是AI视频领域最真实的需求。大部分人做视频,起点都是刷到一条爆款,然后想:我能不能做个我自己的版本。
我直接拿上次那条「地牢酒馆」原片传了进去,点拉片复刻。大约50秒,它把70秒的视频拆成了3个镜头,每个镜头按五大类、最多18个维度去拆:叙事要素、时间、镜头语言、影像处理、声音,每一类底下再细分到景别、运镜、构图、光影色调、音乐音效这些。
![]()
我把它拆出来的东西,跟我上次人肉总结的对了一遍,有点服气。
它独立拆出了「第一人称镜头」,就是我说的第一视角;每个镜头标了「分镜功能」,引入人物、引入新人物、高潮爆发,正好对上我总结的「单角色单段互动」的递进结构。
更狠的是几个我上次根本没注意到的设计。镜头3那个大块头登场,画面色调从前两段的暖棕,悄悄转成了冷灰冷蓝,给高潮做了情绪铺垫;骷髅士兵那段,它连「酒水直接从骨架漏到地上」的音效都标了出来。
拉片是电影学院导演课的基本功,一个镜头一个镜头按暂停,分析它为什么这么拍。这门课值钱的地方,是把「我觉得好看」翻译成可复用的方法。OiiOii把这门课做成了一键可得的能力。
拆完它还自动把整条片切成了可替换的零件:角色(酒保、哥布林、骷髅士兵、食人魔)、场景(酒馆吧台)、元素(金币、酒杯、啤酒桶、钱袋、烤腿),每个都带一个「替换」按钮。我顺手做了一版替换:哥布林换成戴红头巾的武术家、骷髅士兵换成戴面具的摔角手、食人魔换成绿皮丛林战士,酒保和酒馆原样不动。它按原片的镜头结构、动作、音效,重新生成了一整条新片。
成片出来,我盯着看了半天,我意识到一个问题。
它生成的「武术家」,是一只戴着红头巾的哥布林。红头巾贴上去了,可身体还是原片那只哥布林,不是我想象里的那个人。一开始我以为是它没还原好,后来发现是我自己的问题:我写「功夫武术家」的时候,脑子里默认他是「人」,但「人」这个最关键的维度,我根本没写进提示词。
文字是你用脑子对一个事物做的有损压缩。你把脑子里那个活生生、多维度的形象,凝练成几个词,这一步天然就漏掉了一大堆你以为不用说的信息。
然后大模型再拿这几个词,按它的概率去还原,又是一次信息流失。一来一回,出来的东西跟你想的差着十万八千里,其实很正常。
而拉片复刻真正的价值,恰恰在这儿:它让你直接投喂「视频」这个信息密度最高的原始载体,跳过了「人脑抽象成文字」这个有损环节。投喂图、投喂视频,才是保住信息完整度、提高还原度的最好策略,文字描述永远是退而求其次。我上次人肉拆片再写提示词去复刻,本质上就是在做有损压缩;这次它让我把原片整个喂进去,这才是它比我那套手动流程强的根上的原因。
Skill库:他们对Skill的理解,跟我是同一套
Skill这个话题我可能有点发言权。我自己做的女娲.skill在GitHub上拿了两万多star,老读者应该都看过我写skill的那几篇。
Skill这个词火了小半年,火过头的结果是被用得很泛,不少产品挂个Skill的名,点进去还是原来那排预设按钮。OiiOii的做法是把Skill放进具体的使用场景里。我翻了一遍它的Skill库,分自媒体、广告营销、游戏、周边设计四类,十几个skill。有意思的是周边设计那一栏压根不是视频,吧唧、亚克力牌、九宫格表情贴纸、手办模型、谷子墙,Skill库已经溢出「视频」这个边界了。
![]()
我挑了个「搞笑故事」跑一轮。给它的设定是:一个程序员去面试梦想中的大公司,发现面试官是他家那只天天踩键盘的猫。
点了确认,艺术总监接单,把编剧、角色总监一个个拉进群聊接力。这套7人团队的群聊协作上篇就讲过,不是新东西。我这次盯着看的是另一件事:整条流水线是被「搞笑故事」这个skill牵着走的,它清楚搞笑故事该怎么起头、怎么反转、怎么把情绪一层层往上顶。
编剧产出的剧本我得贴一段,是真的好笑:
程序员郝建紧张地坐在面试间,对面那把高管椅缓缓转过来,椅子上没有人,只有一只戴着迷你红领巾的胖橘猫,正不耐烦地拍着智能平板。平板发出机械音:「请叫我橘总监。」……「要不是我每天半夜三点假装跑酷,在你键盘上踩出那段'asdfghjkl'的底层逻辑代码,把你那堆破烂Bug修好,你连初筛都过不了。」最后橘总监把一个金枪鱼罐头踢到郝建面前:「你被录用了,职位是我的初级代码助理兼专属开罐员。」
冷幽默、反转、情绪升级,该有的都有。一个skill里封进去的,是一整套「这类片子到底怎么拍」的方法论。
往下走,角色总监按我选的「美式2D动画」风格,把橘总监画成了一只板着脸、系着迷你红领巾、挺着肚子的胖橘猫,把郝建画成了一个穿蓝白格子衬衫、瞪着眼一脸震惊的程序员,再给两个角色各生成了一张FaceID,锁住人脸,保证后面每个镜头里他俩都是同一张脸。这就是公式里那个C(一致性)变量,被它做成了一个具体的机制。
再往后,分镜师把整个剧本拆成了6个镜头的故事板,皮椅转身、瞪眼、橘猫拍平板、踢罐头,每一格都标好了画面和台词。我就看到这一步——从我一句「面试官是自家的猫」,到一套能直接往下生成的分镜,中间我没写一句提示词。
![]()
这套东西跟我一直讲的Skill本质是一致的:Skill的本质,是把一个领域专家的整套工作流,封装成可复用的能力。 我做女娲,封装的是人的思维方式;OiiOii做的,是把「会拍搞笑短片的那个导演」的整套出片流程封装进去。路子不一样,底层是一回事。
最后成片的效果用我女朋友的话说就是,这是她在小红书或抖音上刷到时会选择看下去的短片~这个反馈我是相当满意了。
对普通用户来说,这意味着做行业素材不用再从零搭流程。抽卡碰运气出片,和按成熟模板稳定出片,是两种完全不同的生产状态。
回到那个公式
上篇我拆过一个公式:
AI视频成片质量 = M ×(S + U)×(D + C)
![]()
模型能力M在2026年快速拉平,大家都能用Seedance、Kling、Veo,真正拉开差距的是创作能力S、易用性U、领域知识D、一致性C。
2.0这三个功能,对着公式看思路非常清楚:智能画布拉的是U,让你张嘴就能改;拉片复刻是把别人的D直接变成你的D,还顺手解决了「文字描述会丢信息」这个老问题;Skill库是把D和C打包预设好,选场景直接出片。还是上次那个判断:M卷不动了,聪明的产品都在卷另外几个变量。
1.0那会儿,它给了你一支总监团队,但你还得自己当导演、自己喊话;2.0想做的,是让这支团队听得懂人话,你说去哪,路线它来规划。
当然,实测下来它也不是没毛病。智能画布的口语理解会放飞,纯文字替换的还原度有上限(想精准还原,老老实实喂图喂视频)。但这些都不影响那个大方向:做视频拼的越来越不是谁手里的模型更强,而是谁雇得起更懂行、更省心的AI员工。
传送门:www.oiioii.tv
感兴趣的可以趁着最近OiiOii在做算力锦鲤的活动,先自己玩起来,尤其建议拿一条你喜欢的爆款去跑跑拉片复刻,体感比看文章直接得多。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.