![]()
你有没有想过这样一个问题:如果让你把一只袋鼠跳跃落地的动作,"翻译"给一盏台灯,你该怎么做?
袋鼠有四条腿、一条尾巴,还有发达的后肢肌肉。台灯呢?一个底座,一根可以弯折的金属杆,一个灯罩。它们没有共同的骨骼结构,没有共同的关节点,甚至连"腿"这个概念都不共享。可是,如果你看过皮克斯那盏会跳跃、会好奇张望的台灯动画,你会知道,这种跨物种的动作移植不仅可能,而且做得极其自然。
这正是这篇论文要解决的问题。它有一个很直白的名字,叫做"运动超越形态"(Motion Beyond Morphology)。研究者们想让AI做到的事情是:给一段参考视频(比如袋鼠跳跃),再给一个目标对象(比如台灯的图片),AI能生成一段台灯做出"跳跃落地"这个动作的视频,同时这盏灯看起来还是那盏灯,没有变成四不像。
这件事,比听起来难得多。
现有方法为什么会卡壳
先说说这个领域此前是怎么做的。
如果你关注过AI视频生成,可能听说过"骨骼动画"或者"姿态引导"这类技术。简单说,就是先给人体或者某个角色提取一套关键点或骨架序列(比如肩膀、手肘、膝盖的坐标),然后让AI照着这套骨架去生成动作。这套方法在人物动画、数字人这块效果拔群,因为源和目标共享同一套骨骼系统,就像给两个身高不同的人穿同一套动作捕捉服,缩放一下就能对上。
**但这套逻辑一旦离开"结构相似"的前提,立刻失效。**
袋鼠和台灯,蜻蜓和花朵,水母和降落伞,它们之间根本不存在共同的骨骼模板。你没法把袋鼠的膝关节映射到台灯的哪个部件上,因为台灯压根没有膝关节这个概念。
论文里提到,近些年也有一些方法试图绕开这个限制。一种思路是从视频生成模型的中间层特征或者注意力模式里去提取动作信息,这类方法覆盖面广,什么类别的物体理论上都能处理,但问题是这些特征往往会"夹带私货",把源视频里的外观、几何形状甚至背景信息也一并带过去,导致生成结果里能隐约看到袋鼠的影子出现在台灯身上,观感很怪。
另一种思路是用更"干净"的显式表示,比如物体轨迹(只记录物体整体在画面里怎么移动)或者密集点跟踪(记录画面里成百上千个点各自怎么运动)。这两种方式确实把动作和外观分得更开,但代价是信息量打了折扣:物体轨迹只知道"从哪到哪",不知道内部关节怎么弯曲;密集点跟踪知道每个点怎么动,但不懂这些点背后代表的是"手臂在挥动"还是"翅膀在扇动"这种语义层面的结构。
**换句话说,没有一种现成的动作表示方法,能同时做到语义丰富、跨类别通用、又不携带多余的外观信息。**
这就是研究者面对的核心矛盾:你想要的东西太多,但每种工具只能满足其中一部分。
核心思路:不追求固定对应,而是自适应地决定"哪些该保留,哪些该丢弃"
研究者们提出了一个挺有意思的哲学转向。
他们认为,跨类别的动作迁移不应该依赖某种固定的"对应关系",而应该让模型自己判断,在源和目标之间,哪些动作因素应该保持耦合,哪些应该被解耦。
举个例子。如果源和目标是两只长得差不多的猫,那语义对应、姿态、拓扑结构这些精细信息都可以直接搬过去,因为猫和猫的身体结构本来就相近。但如果源是蜻蜓,目标是花朵,那能保留下来的可能就只剩下更抽象的东西了,比如运动的节奏(快慢交替)、轨迹形状(开合的弧度),至于蜻蜓翅膀具体是怎么震动的细节结构,就该被逐渐弱化掉。
论文管这个叫"Motion Beyond Morphology",翻译过来就是运动要透过形态学的表象,抓住那些在不同形态下依然有意义的东西。
这个思路要落地,面临一个供应链问题:训练数据从哪来?
现实中的视频,动作、外观、几何形状、空间布局全都揉在一起,你几乎找不到大量现成的"这两个视频动作等价但物种完全不同"的配对样本。互联网上有海量的袋鼠跳跃视频,也有海量的台灯广告视频,但没人拍过"台灯像袋鼠一样跳"的视频,因为这压根不存在。
**这就是这篇论文真正巧妙的地方:它没有去找这种数据,而是自己造了这种数据出来。**
两阶段框架:先用"抽象动作语言"造数据,再让模型自己学会直接看视频
整个方法拆成两个阶段,我把它想象成一个"翻译中转站"的建立过程。
### 第一阶段:抽象动作引导(Abstract Motion Bootstrapping)
研究者们先定义了五种"动作的抽象表示方式",每一种只捕捉动作的某个侧面。
> 语义运动学(Semantic kinematics):用ViTPose++这类姿态估计工具,提取动物的关键点,画出骨架序列,适合捕捉四肢关节这种精细的关节运动。
> 深度感知全局轨迹(Depth-aware global trajectories):追踪物体的中心位置,结合深度信息画出一个"圆点移动轨迹",专门捕捉整体的位移、靠近、远离这类粗粒度动态,同时基本不带任何物体本身的结构信息。
> 密集点轨迹(Dense point tracks):用TAPNext++这种跟踪算法,记录画面里大量点各自的运动路径,不预设任何结构语义,对各种非刚性形变的物体都适用。
> 六自由度轴(6-DoF axis):针对刚性或近似刚性的物体,估计出物体每一帧的旋转和平移变换,用坐标轴的形式画出来,专门表示转向、朝向的变化。
> 边缘轮廓(Edges):用Canny边缘检测提取前景轮廓,保留形状随时间演变的粗略信息,同时把大部分外观和背景信息过滤掉。
这五种表示各有侧重,谁也替代不了谁。这就是关键设计:每种表示只在它能被可靠提取的场景下使用,比如给蜻蜓提取骨架没问题,但给水母提取关节骨架就是无意义的,因为水母根本没有关节,这时候系统就会转而用密集点轨迹或边缘轮廓。
拿到这些抽象表示之后,研究者做了一件很聪明的事:把某个源视频提取出的动作表示(比如袋鼠跳跃的骨架序列),配上一个完全不同类别的目标条件(比如"一盏台灯"的图片加文字描述"台灯向左跳跃然后落地"),喂给模型,让它生成一段新视频。
这段生成的视频,动作来自骨架条件(继承自袋鼠),外观和结构来自目标条件(台灯)。这样,研究者就人工"造"出了一对"动作相同、外观完全不同"的视频,而这在真实世界里是根本不存在的数据。
这里我想打个比方。这就像你想教一个从没见过芭蕾的机器人理解"旋转跳跃"这个动作的本质,而不是记住"穿着芭蕾舞裙的人怎么转"。如果你只给机器人看芭蕾舞视频,它可能会把"裙子的飘动方式"也当成动作的一部分学进去,结果你让它给一只企鹅编排旋转动作时,企鹅身上莫名其妙地飘出了裙摆的褶皱感。而通过先造出"骨架相同、穿着不同、甚至物种不同"的配对样本,机器人被迫必须去学习动作骨架本身的规律,而不是那些偶然伴随出现的外观细节。如果不这样"人为拆分",模型就永远没办法把动作和外观解耦开,因为它见到的每一份真实数据里两者都是绑死的。
当然,这批生成出来的数据不是照单全收的。研究者做了严格的筛选,从提取阶段就先剔除那些运动信息本身就不可靠的样本,生成之后再从四个角度打分:动作是否保真、目标是否保真、是否泄漏了源视频的外观痕迹、视频质量是否过关。只有四项全部达标的样本,才会被留下来用于下一阶段的训练。
### 第二阶段:跨类别动作内化(Cross-Category Motion Internalization)
第一阶段造出来的数据虽然有用,但这些骨架、轨迹、边缘这些"抽象语言"本身也是一种局限,因为提取它们需要专门的工具,而且每种工具只能捕捉动作的一个侧面。
**研究者的真正目标,是让模型最终能直接看着一段原始视频,就理解里面哪些动作信息是可以迁移的,不需要中间商(也就是骨架提取器之类的工具)。**
所以第二阶段做的事情是:把第一阶段的模型继续训练,但这次不再喂给它骨架图或轨迹图,而是直接喂给它那段"袋鼠原始视频"本身,让模型学着直接从RGB像素里读出可迁移的动作信息,然后按照目标条件把它实现出来。
这里的关键在于,第一阶段生成的那批"配对数据"里,源视频(袋鼠)和目标视频(台灯)在外观和结构上差异巨大,但动作是等价的。这意味着,如果模型想靠"记住袋鼠长什么样"来蒙混过关,它在预测台灯视频时根本用不上这个信息,因为台灯和袋鼠压根不像。**这种数据构造方式,从根本上堵死了模型偷懒走捷径的路,逼着它必须去关注那些真正跨类别依然成立的东西,比如节奏、轨迹形状、开合幅度这些抽象规律。**
这一步做完之后,推理阶段就变得非常干净了:你只需要给模型一段参考视频,加上一张目标图片或一句文字描述,模型直接生成结果,不需要你再手动提取骨架、指定轨迹或者做逐视频的优化调试。
我觉得这个设计思路挺值得琢磨。它没有试图去发明一种"万能的动作表示",而是承认了每种表示都有局限,转而把这些有局限的表示当作"脚手架",用来搭建训练数据,脚手架用完就拆掉,最后留下的是一个直接吃视频、吐视频的端到端模型。这跟很多深度学习领域的思路是相通的:中间的显式规则和先验,很多时候只是帮助模型在早期少走弯路的拐杖,一旦模型学到了足够的东西,拐杖就该扔了。
造了一整套数据集和评测基准
因为这个任务此前没有专门的训练数据和评测标准,研究者干脆自己造了两套东西。
> OpenVMT-Dataset:目前已知第一个专门针对开放类别、跨内容动作迁移的训练数据集,包含1万对"动作等价但外观形态完全不同"的视频对,其中4千对是"同类别"(Same,比如猫和猫),4千对是"近类别"(Near,比如猫和狗),2千对是"远类别"(Far,比如袋鼠和台灯)。
> OpenVMT-Bench:用来评测的基准测试集,分为图像条件(OpenVMT-I2V,123个测试用例)和文本条件(OpenVMT-T2V,166个测试用例)两条赛道,每条赛道又按照源目标之间的类别差距分成Same、Near、Far三档。
这套数据集和基准的价值在于,它第一次把"跨形态动作迁移"这个模糊的能力,切分成了可以量化比较的具体档位,让不同方法能在同一把尺子下被比较,而不是各说各话地展示几个漂亮的案例视频。
评测结果:数字说话
论文用了好几个维度去衡量方法的好坏:动作保真度(生成视频有没有真的复现源视频的动作)、目标保真度(生成视频有没有忠实呈现目标的外观)、源内容泄漏程度(生成视频里有没有意外带上源视频的痕迹)、时间质量(视频播放起来流不流畅)。
在图像条件(I2V)赛道上,对比的基线方法包括DisMo(一种隐式动作表示方法)、Wan-Move和Tora(两种基于轨迹条件的方法)。
| 方法 | HMF-Same | HMF-Near | HMF-Far | 目标保真度(DINO-I) | 泄漏分数(越低越好) |
| DisMo | 0.7367 | 0.7437 | 0.7441 | 0.8587 | 1.182 |
| Wan-Move | 0.7370 | 0.7338 | 0.7335 | 0.8849 | 1.128 |
| Tora | 0.7161 | 0.7259 | 0.7402 | 0.8846 | 1.023 |
| **本文方法** | **0.7435** | **0.7617** | 0.7446 | **0.9058** | **1.000** |
(HMF全称Hybrid Motion Fidelity,一个衡量全局轨迹和局部动作一致性的综合指标)
可以看到,本文方法在几乎所有指标上都拿到了最好成绩,尤其是在目标保真度和泄漏分数上优势明显,说明它确实做到了"动作学过来了,但外观没有跟着串味"。
文本条件(T2V)赛道上,对比对象是DeT、FlowMotion,以及把DisMo改造成只用文本条件的版本DisMo-T2V:
| 方法 | HMF-All | G-Mot.(动作偏好评分) | CLIP-T(文本对齐) |
| DeT | 0.7428 | 2.418 | 0.2392 |
| FlowMotion | 0.7387 | 2.970 | 0.2522 |
| DisMo-T2V | 0.7696 | 2.873 | 0.2415 |
| **本文方法** | **0.7707** | **3.976** | **0.2677** |
值得一提的是,DisMo-T2V在HMF-F(远类别的动作保真)和时间流畅度上略微领先,但代价是它对源视频动作的"死记硬背"过重,导致目标对齐分数和泄漏分数都不理想,也就是说它更容易把源视频的结构原封不动地搬过来,而不是真正理解动作再重新演绎给目标。
论文还做了一场人工评审实验,找了12名有视频生成经验的评估者,用"更好/差不多/更差"三档打分去比较本文方法和最强的基线。结果显示,在图像条件任务上,本文方法在动作维度的综合偏好率达到89.3%,在整体质量上达到93.0%;在文本条件任务上,整体偏好率高达97.3%。这种压倒性的人工偏好,比单纯的自动指标更能说明生成结果在人眼里到底看起来自不自然。
拆开来看每个部件到底有没有用
研究者还做了消融实验,把整个系统拆开一块块看效果。
一个关键发现是:如果把第二阶段用的"跨类别配对"换成"同类别配对"(也就是源和目标其实是同一个类别,比如都是狗),HMF-All这个综合指标会从0.7707掉到0.7588,动作偏好评分G-Mot.更是从3.976暴跌到3.436。
**这个数字差距意味着什么?**
意味着如果训练数据里源和目标总是长得差不多,模型就有机会靠"记住外观"来蒙混过关,而不是真正去学习那个更抽象的、能跨越形态鸿沟的动作规律。一旦真正遇到袋鼠和台灯这种天差地别的组合,这种"投机取巧"学出来的模型立刻现出原形,动作还原度明显打折扣。这也反过来证实了前面提到的核心设计逻辑:跨类别的数据构造不是锦上添花,而是这套方法能成立的根基。
另外研究者也单独测试了每种抽象动作表示(只用轨迹、只用点跟踪、只用边缘)的效果,发现轨迹更擅长表现整体位移,点跟踪更擅长捕捉局部细节动态,边缘则提供更强的结构线索。三者各有偏重,谁也无法单独顶替,这也印证了为什么第一阶段要设计五种互补的表示方式,而不是押宝在某一种上。
我想到一个类比。这有点像学一门新语言时,你不能只靠背单词表,也不能只靠听力磨耳朵,你需要语法书教你结构规律,需要听说读写四项技能互相补位。如果只练听力(对应只用轨迹这种表示),你可能能听懂大意但说不出细节;如果只背语法(对应只用边缘轮廓),你可能知道句子该长什么样但语感生硬。研究者没有指望某一种表示单枪匹马解决所有问题,而是让它们分工合作,各自负责自己擅长的那部分,最后再靠模型自己把这些互补的信息融合起来。
写在后面
读这篇论文的时候,最触动我的其实不是那些具体的技术模块,而是它对"数据不存在怎么办"这个问题给出的答案。
很多AI研究论文遇到数据稀缺,第一反应是想办法收集更多真实数据,或者用众包标注硬凑一批出来。这篇论文的思路反过来了:它承认这种"动作等价但形态完全不同"的真实数据根本不可能大规模存在(你上哪儿去找一段"椅子像鲸鱼一样甩尾巴"的真实录像),于是干脆用生成模型自己造出这批数据,再用这批"合成但受控"的数据去训练一个更本质的能力。
这种"先用弱监督生成中间数据,再用中间数据训练最终模型"的两阶段策略,其实在别的领域也有影子,比如知识蒸馏里用大模型生成伪标签去训练小模型。但这篇论文把它用在了一个挺刁钻的场景里:不是压缩模型规模,而是压缩表示形式,把五种笨重的、需要专门工具提取的显式表示,蒸馏进一个只需要看视频像素就能工作的端到端模型里。
论文里没细说的一点是,这五种抽象动作表示的"自动选择"机制具体怎么判断某个视频该用骨架还是该用点跟踪,这个筛选逻辑的鲁棒性其实决定了整个数据构造管线的上限。如果某个边界案例(比如半透明的水母)被错误分配了不合适的表示方式,会不会污染后续训练?这是我读完之后一直在想的问题。
Q&A
Q1:Motion Beyond Morphology是什么?
A:这是一篇论文提出的核心理念,指的是在做视频动作迁移时,不依赖源对象和目标对象之间固定的结构对应关系(比如骨骼骨架一一映射),而是让模型自适应地判断哪些动作因素在不同形态下依然有意义并保留下来,比如节奏、轨迹形状,同时逐渐弱化那些依赖具体身体结构的细节。
Q2:这篇论文提出的两阶段框架具体是怎么工作的?
A:第一阶段叫抽象动作引导,先用骨架、轨迹、点跟踪、边缘等五种互补的抽象方式提取源视频的动作,再把这个动作条件配上完全不同类别的目标(比如台灯图片),生成一批"动作相同但外观不同"的训练数据。第二阶段叫跨类别动作内化,用这批数据继续训练模型,把抽象动作条件换成原始视频本身,让模型学会直接从视频像素里读出可迁移的动作,推理时不再需要任何显式提取工具。
Q3:OpenVMT-Dataset和OpenVMT-Bench是什么?
A:OpenVMT-Dataset是论文提出的训练数据集,包含1万对动作等价但形态完全不同的视频对,分成同类别、近类别、远类别三档。OpenVMT-Bench是配套的评测基准,分图像条件和文本条件两条赛道,用来衡量不同方法在动作保真度、目标保真度、源内容泄漏、时间质量等维度上的表现。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.