网易首页 > 网易号 > 正文 申请入驻

热点关注丨全网都在猜,这些视频是不是字节AI生成的:该跟动捕说再见了?

0
分享至

转自 机器之心

动作捕捉,刚刚发生了革命。

在 GPT-4o 的风到处吹时,X 平台(原推特)上有好多带视频的帖子爆了。到底是什么引来了一百万的浏览量?

没错,是玛丽莲・梦露「活了过来」。她不仅能够语音 — 口型保持一致,动作也能复刻参考示例。在大幅度的手臂摆动时,也不会出现严重的变形或虚影。

网友瞳孔震惊,「别告诉我,这些都是 AI 生成的......」

这两段视频更是 Next Level。相比梦露黑白视频示例,他们所处的环境光影更具挑战。仔细观察,二者举手投足都能看到光影相应正确的变化,甚至灰色衣服男子的衣服在不同幅度的动作下有对应摆动。

网友都感慨到,AI 真的很伟大,或许已经争取到了不再用动捕的胜利。

不仅还原度极高,它还能掌握不同风格的生成。

本周四在网络上爆火的 AI 视频生成效果,都来自字节跳动提出的一个全新的框架 DreamActor-M1—— 基于扩散式 Transformer(DiT)的人体动画生成框架,通过混合引导机制,实现对动画的精细化整体控制、多尺度适应以及长时间一致性。

只需一张参考图像,DreamActor-M1 就能模仿视频中的人物行为,跨尺度生成从肖像到全身的高质量、富有表现力且真实感十足的人体动画。最终生成的视频不仅在时间上保持连贯性,还能准确保留人物身份特征,画面细节也高度还原。

  • 论文标题: DreamActor-M1: Holistic, Expressive and Robust Human Image Animation with Hybrid Guidance

  • 论文链接:https://arxiv.org/pdf/2504.01724

  • 项目页面:https://grisoon.github.io/DreamActor-M1/

我们先快速梳理一下这项研究的要点:

  • 在运动引导方面,研究者设计了一套融合隐式面部特征、3D 头部球体和 3D 身体骨架的混合控制信号,能够稳健地驱动面部表情与身体动作的生成,同时保证动画的表现力与人物身份的一致性。

  • 在尺度适应方面,为了应对从特写肖像到全身图像等不同尺度和姿态的变化,字节跳动采用了逐步训练策略,利用多分辨率、多比例的数据进行训练,提升模型的泛化能力。

  • 在外观引导方面,他们将连续帧中的运动模式与互补的视觉参考相结合,有效增强了复杂动作中未显区域的时间一致性。实验结果表明,该方法在肖像、半身以及全身动画生成任务中均优于现有先进技术,能够持续输出富有表现力且长期稳定的一致性动画。

下图概述了 DreamActor-M1 的总体流程:

首先,从驱动视频的帧中提取出人体的骨架(表示姿势)和头部的球体(表示头部的位置和朝向),这一步就像是先把人的动作「抽象出来」。接着,这些信息会被姿态编码器的模块处理,转化为姿态潜变量。可以简单理解为这个动作变成了数字表示。

同时,研究者还会从整个视频中截取一小段,用 3D VAE 进行编码,得到视频潜变量。这个潜变量是被加了噪声的(也就是故意让它模糊一点,方便训练)。然后,把视频潜变量和先前得到的姿态潜变量融合在一起,作为输入。

面部表情则面部动作编码器单独处理,把它编码成隐式的面部信息,比如笑、皱眉这些表情特征,也用数字方式表示出来。

系统还可以选取输入视频中的一张或几张图像,作为参考图像。这些图像里包含了人物的外观细节,比如穿什么衣服、长什么样。在训练时,这些参考图像会作为额外的信息输入,帮助模型更好地保留人物的外貌。

在训练过程中,DreamActor-M1 采用了共享权重的双分支结构:一个处理噪声 token,一个处理参考 token。模型通过对比生成的去噪视频潜变量与真实视频潜变量来进行监督学习,从而逐步学会还原人物动作。

此外,在每个 DiT 模块中,面部动作 token 通过跨注意力机制被融合进噪声 token 分支,而参考 token 的外观信息则通过连接式自注意力和后续的跨注意力机制注入到噪声 token 中。

在模型训练完之后,如何用它来生成一个带动作的动画视频?生动来讲,就是真人带着模型跳舞,用一张人物图片和一段动作视频就能让图片中的人物动起来。敲敲黑板,为了保持人物在不同视角的一致性,参考图可以使一张图,也可以是模型合成的「伪多视角」。

对比其他 SOTA 方法,不难发现,DreamActor-M1 有着更好的保真性。人物在动作过程中能更好地保留自身特征,也鲜有鬼影、变形的情况出现。

DreamActor-M1 与其他动画方法在五项关键指标上的定量对比实验中也表现优异。

不过在一些案例里,我们还是可以发现某些局限性。例如这个说唱的示例,由于视角问题,生成画面中的嘴部动作没法儿跟上示例。

不过,再给这些技术一段时间,可能不仅动捕慢慢会被取代,电影里的危险特技也能有方法代替了。

【免责声明】转载出于非商业性的教育和科研目的,只为学术新闻信息的传播,版权归原作者所有,如有侵权请立即与我们联系,我们将及时删除。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
美国国防部正式宣布终止与拥有86年历史的加拿大联合防御机制!

美国国防部正式宣布终止与拥有86年历史的加拿大联合防御机制!

AI商业论
2026-05-19 08:21:33
反华言论遭反噬!清华AI天才怒辞职位,抗议将中国列为敌对国家

反华言论遭反噬!清华AI天才怒辞职位,抗议将中国列为敌对国家

触摸史迹
2026-05-21 01:19:24
英格兰4队同时夺得欧冠+欧联 分别是维拉、蓝军、红军、红魔

英格兰4队同时夺得欧冠+欧联 分别是维拉、蓝军、红军、红魔

智道足球
2026-05-21 15:50:02
北京今晚到明天有中雨,三区局地大雨,部分列车临时停运

北京今晚到明天有中雨,三区局地大雨,部分列车临时停运

环球网资讯
2026-05-21 18:37:16
普京专机抵达北京,只在中国待24小时,却点名要见一位中国男孩

普京专机抵达北京,只在中国待24小时,却点名要见一位中国男孩

史行途
2026-05-20 08:03:50
军舰安装反无人机网,乞神希望免遭乌无人机袭击,俄罗斯赢麻了?

军舰安装反无人机网,乞神希望免遭乌无人机袭击,俄罗斯赢麻了?

山河路口
2026-05-18 20:58:47
艾司唑仑立大功!老人吃艾司唑仑,不止助眠,还有5大获益

艾司唑仑立大功!老人吃艾司唑仑,不止助眠,还有5大获益

健康之光
2026-05-19 16:58:40
张家辉中半山豪宅终于卖出,1.32亿成交亏719万,卖了6年多次降价

张家辉中半山豪宅终于卖出,1.32亿成交亏719万,卖了6年多次降价

寒士之言本尊
2026-05-20 00:10:45
球队输球,文班亚马却意外收获好消息!联盟或“逼出”最强马刺队

球队输球,文班亚马却意外收获好消息!联盟或“逼出”最强马刺队

鸣哥说体育
2026-05-21 13:20:00
37岁张琳芃近况,转型当教练,身家过亿,定居上海,老婆很漂亮

37岁张琳芃近况,转型当教练,身家过亿,定居上海,老婆很漂亮

大西体育
2026-05-21 15:14:26
课堂上冲老师喊“杀杀杀”的大学生已特事特办完成毕业答辩!

课堂上冲老师喊“杀杀杀”的大学生已特事特办完成毕业答辩!

黯泉
2026-05-21 18:15:43
难得!越媒:连进U17和U23亚洲杯决赛,中国足球青训开始收获回报

难得!越媒:连进U17和U23亚洲杯决赛,中国足球青训开始收获回报

足球大腕
2026-05-21 20:32:51
知名网红韩景枫官宣全家搬离北京!刚购千万别墅,已卖掉多辆豪车

知名网红韩景枫官宣全家搬离北京!刚购千万别墅,已卖掉多辆豪车

裕丰娱间说
2026-05-21 08:43:39
轰动一时的“臭氧层空洞”,正在自己悄悄长好,原因竟然是这个

轰动一时的“臭氧层空洞”,正在自己悄悄长好,原因竟然是这个

中科院物理所
2026-05-20 11:20:11
40天拉下5位院长!杀疯了的耿同学到了最危险时候!谁来保护他?

40天拉下5位院长!杀疯了的耿同学到了最危险时候!谁来保护他?

大江看潮
2026-05-20 06:46:22
阿斯:FIFA将讨论在2030世界杯扩军至66队;南美足联率先提议

阿斯:FIFA将讨论在2030世界杯扩军至66队;南美足联率先提议

懂球帝
2026-05-21 17:26:25
日本乒乓球队公布亚运会参赛名单,张本美和身兼三项

日本乒乓球队公布亚运会参赛名单,张本美和身兼三项

懂球帝
2026-05-21 16:14:31
毛主席83岁给华国锋的珍贵书法,练字真的有意义吗?

毛主席83岁给华国锋的珍贵书法,练字真的有意义吗?

书画相约
2026-05-11 10:09:02
离开北京前,鲁比奥着急立规矩,台湾问题,中方说不松口就不松口

离开北京前,鲁比奥着急立规矩,台湾问题,中方说不松口就不松口

闻识
2026-05-19 17:25:55
电讯报:最可能离队的维拉核心是罗杰斯,身价预估8000万英镑

电讯报:最可能离队的维拉核心是罗杰斯,身价预估8000万英镑

懂球帝
2026-05-21 20:39:05
2026-05-21 21:12:49
中国人工智能学会
中国人工智能学会
中国人工智能学会网易官方账号
4055文章数 1489关注度
往期回顾 全部

科技要闻

好到离谱也不够!英伟达交出816亿美元营收

头条要闻

韩媒称中国领导人可能访问朝鲜 外交部回应

头条要闻

韩媒称中国领导人可能访问朝鲜 外交部回应

体育要闻

常住人口7000的小镇,拥有了一支德甲球队

娱乐要闻

反转!金秀贤与金赛纶未成年时交往不实

财经要闻

英伟达业绩超预!指引再新高仍不够亮眼

汽车要闻

后驱+闪充+激光雷达 第三代元PLUS上市售11.99万元起

态度原创

时尚
房产
艺术
手机
军事航空

全网首档挑战Al设备拍摄短剧现场直播!

房产要闻

顺德澐璟楼王『澐冠』启幕|一场高阶共鸣的静奢美学之约

艺术要闻

崔雪冬 2026年油画新作

手机要闻

国补价4299元起!小米17 Max正式发布:6.9英寸大直屏、小米最强续航

军事要闻

伊朗警告:任何新袭击将促使战场扩大到中东以外

无障碍浏览 进入关怀版