网易首页 > 网易号 > 正文 申请入驻

不止动起来:SentiAvatar重新定义3D数字人动作生成范式

0
分享至

来源:市场资讯

(来源:机器之心Pro)

机器之心发布

当你和 3D 数字人对话时,有没有遇到过这种诡异时刻:它的嘴在动,但表情依旧僵硬;手在挥舞,但和说话内容完全脱节;更糟的是,那种外表像真人但动作不自然的违和感,让人瞬间陷入 “恐怖谷”。

问题的根源在于,人类沟通从来不只是语言或动作的单一呈现。一个耸肩可以表达无奈,一个点头传递认同,而微微扬起的眉毛则暗示怀疑。这些由手势、姿态与面部表情构成的非语言信号,是真实交流中不可或缺的关键维度。

当前大多数 3D 数字人的动作生成仍停留在通用动作拼接层面,难以承载复杂语义与情绪表达。而这种自然、连贯且富有情绪的表现力对 3D 数字角色至关重要:数字人需要它来建立信任,机器人需要它来与人类协作,游戏则需要它让角色更加生动。

AI 初创公司 SentiPulse 联合中国人民大学高瓴人工智能学院博士生团队的最新研究,提出了一套 3D 数字人动作生成新范式SentiAvatar,它是用于构建具备表现力的交互式 3D 数字人框架。团队基于此打造了虚拟角色SUSU,使其能够实时进行语言表达、动作表现与情绪传达


视频链接:https://mp.weixin.qq.com/s/13XKw1FLyDr9V3IxaPZltg

今天,SentiAvatar 框架、3D 数字人 SUSU 角色模型及高质量动作数据集 SuSuInterActs全球同步开源


一眼假的 3D 数字人

困在三个 "无人区"

让 3D 数字人在真实对话中自然地手舞足蹈,听起来只是一个工程问题,但它实际上横跨了三个长期未被同时解决的研究缺口:

第一,高质量数据荒。现有数据集要么以英语语料为主,要么缺乏与动作同步的面部表情,中文对话场景下的高质量全身动作数据几乎空白。

第二,复合语义动作漂移。当描述从简单的“挥手”变成“无奈地耸肩”、“认同地点头” 这种复合语义时,模型的理解能力急剧退化。

第三,对话节奏错乱。模型生成的动作要么像机器人一样匀速机械,要么和语音的重音、停顿完全错位。

能不能让数字人既理解“要说什么”,又能做出能跟上说话的节奏的流畅动作?

问题本质

语义与韵律是两个时间尺度的问题

现有方法在对话驱动的动作生成上陷入两难:全局语义对齐要求模型理解句子级的行为语义,如:无奈地耸肩,并生成宏观动作结构;帧级韵律对齐则要求动作的速度起伏精确响应语音的重音、停顿与节律变化。两者分别工作在句子级和帧级两个时间尺度,单一模型难以兼顾。

以往的共语音手势生成方法(EMAGE、TalkShow 等)将动作视为音频的低阶反射,缺乏句子级语义规划;而文本驱动的动作生成方法(T2M-GPT、MoMask 等)则完全丢弃了音频信号,无法捕捉语音韵律对动作时序的精细调制。

SentiAvatar 的出发点正是将这两个目标解耦,将句子级语义规划与帧级韵律驱动分阶段处理,而非强行塞进一个端到端模型。

SentiAvatar

3D 数字人动作生成新范式


为了解决以上问题,SentiPulse 团队基于统一技术框架SentiAvatar打造了虚拟角色 SUSU,并构建SuSuInterActs 数据集(包含 2.1 万段片段,总计 37 小时),该对话语料通过光学动捕技术采集,围绕单一角色,包含同步的语音、全身动作与面部表情。其次,在超过 20 万条动作序列上预训练了一个动作基础模型 Motion Foundation Model,使其具备丰富的动作先验,能力远超对话场景本身。在此基础上,团队创新提出了一种全新的模型架构 plan-then-infill,将句子级语义规划与逐帧的韵律驱动插值解耦,从而使生成的动作既符合语义,又在节奏上与语音高度一致。

SuSuInterActs 数据集

数据瓶颈是 SentiAvatar 解决的一个硬核问题。现有共语音数据集的两个主要局限:1) 以英语为主 2)缺乏同步的面部表情数据,在中文对话场景下尤为突出。

SentiPulse 围绕单一虚拟角色 SUSU(22 岁,温柔活泼,情感丰富),从头构建了SuSuInterActs 数据集。该数据集包含2.1 万段片段、37 小时的多模态对话语料,涵盖同步语音、行为标注文本、全身动作与面部表情。


数据采集流程分四步:

最终数据集规模:21,133 条片段,36.9 小时,覆盖日常聊天、情感支持、趣味互动等多类场景。每条样本包含四路同步模态:中文对话文本(含行为语义标注)、语音音频(WAV)、全身骨骼动作(63 关节,6D 旋转表示)、面部混合形状系数(blendshape coefficient)(51 维 ARKit 参数)。其中 14,278 条含非默认动作标注,9,412 条含非默认表情标注。

聚焦单一角色是一个有意为之的设计选择,相比 BEAT2 等多角色数据集,它带来了更一致的行为模式,有利于角色特定的动作与表情风格学习。

动作基础模型:200K 序列的异质预训练

对话数据集的动作分布天然受限于对话场景。团队在预训练阶段引入了自研的 Motion Foundation Model 动作基础模型,在 200K + 条异质动作序列(约 676 小时)上训练通用运动先验。数据来源如下:


蒸馏流程值得关注:通过挖掘原子动词、LLM 扩展同义短语、组合模板生成复合动作描述(最多 4 个动作),以及引入奥运运动、仿生动作等专项类别,系统性地扩展了动作先验的覆盖边界。

基础模型以 Qwen-0.5B 为骨干,扩展词表至包含 2,048 个动作 Token(R-VQVAE,4 层残差量化,每层码本 512)和音频 Token(HuBERT K-means 量化)。预训练任务为文本-动作生成,所有文本描述统一翻译为中文,保持语言空间一致性。

核心架构 plan-then-infill

用对话生成动作的核心在于理解高层语义意图,模型需要先知道 “做什么动作”,再决定 “如何逐帧执行”,这一过程建模是一个规划问题。SentiAvatar 采用双通道并行架构 plan-then-infill,身体动作与面部表情分离处理,身体动作通道由两个串联阶段构成。

1. 身体动作通道


第一阶段,LLM 语义规划器接收行为标签文本和稀疏音频 Token,输出稀疏关键帧动作 Token 序列。为支持多轮流式连续生成,模型以前一句话的最后两个关键帧音频 - 动作 Token 对作为上下文前缀,从下一个关键帧位置续写,实现无缝跨句过渡。

第二阶段,Body Infill Transformer在相邻关键帧之间填入中间 3 帧,以逐帧 HuBERT 连续特征(768 维,20FPS)作为条件信号。模型采用 5 帧滑动窗口,首尾帧已知,预测中间 3 帧(12 个动作 Token)。推理时使用迭代置信度解码策略(默认 6 步),逐步接受高置信度预测,避免一次性预测的质量退化。

2. 面部表情通道

直接绕过 LLM 规划阶段,面部表情的动态与语音韵律高度耦合,无需句子级语义规划。Face Infill Transformer结构与 Body Infill Transformer 类似,但操作 2Token / 帧的面部离散表示,直接从音频特征生成面部 Token,再由 Face R-VQVAE 解码为 51 维 ARKit 混合形状系数序列。

两通道共享 HuBERT 特征提取,端到端延迟约 0.53 秒生成 6 秒动作,支持无限多轮流式输出

实时性能:0.3 秒内生成 6 秒输出

FGD/BC 双刷 SOTA

整体实验结果:跨数据集均达最优水平

实验结果表明,SentiAvatar 在 SuSuInterActs 和 BEATv2 两个数据集上均达到了当前最优水平。

注:评测指标 ESD(Event Sync Distance),是一种用于衡量生成动作与驱动信号(如语音节奏)之间时间同步性的客观评测指标,它直接反映了数字人或机器人的动作是否 “对得上拍子”。

定性分析结果:SentiAvatar 动作生成效果最佳

团队将 SentiAvatar 与几种 3D 动作生成主流 AI 模型进行对比。下图中每一行展示特定动作与语音的关键帧序列,相同颜色的文字和箭头代表同一时间,红色箭头表示动作错误。


多模型对比结果:SentiAvatar 呈现出最自然的生成效果,动作语义正确,并且在时间上与音频波形高度对齐。MoMask 能够从文本标签中部分捕捉动作语义,但由于无法获取语音信息,生成的动作节奏较为静态,且与音频不存在对应关系。MEAGE 可以生成与音频同步的动作,但动作较为通用,忽略了标签中指定的语义意图。AT2M-GPT 尽管能同时接受音频和文本输入,但常常会误解动作语义。HunYuan-Motion 因未基于高质量动捕数据进行训练,生成结果中存在明显的身体畸形和不自然姿态,整体表现最差。

消融实验结果:验证核心架构各部分不可替代

在架构消融实验中,移除 LLM 规划器会导致性能大幅下降:R@1 从 43.64% 骤降至 28.06%,FID 从 8.912 劣化至 27.567,说明句子语义规划至关重要;移除 Infill Transformer 同样会导致所有指标下降,R@1 降至 27.52%,ESD 恶化至 0.503 秒,因为仅依赖稀疏关键帧会产生不连续、节奏不自然的动作。

音频条件消融进一步揭示,Infill Transformer 中的连续 HuBERT 特征是帧级同步的主要驱动力,而 LLM 中的离散音频 Token 则更多贡献于整体动作质量和节律规划,验证了 “粗粒度音频规划+细粒度音频对齐” 的协同效果。

在实验能力外,工程落地能力同样关键。SentiAvatar 实现了 0.3 秒内生成 6 秒动作序列,支持无限轮次的流式交互。这意味着数字人可以在实时对话中持续生成连贯的动作与表情,无需等待整句结束再批量处理。

开源与未来

从 "数字人" 到下一代 "数字生命"

今天,SentiAvatar 框架、SuSuInterActs 数据集及预训练模型重磅开源,上线 GitHub。SentiPulse 团队邀请全球对 3D 动作生成感兴趣的研究机构、开发者,共同突破 3D 数字人技术与应用的新边界。

SentiPulse 看到的未来不止于此。当前 3D 数字人的竞争焦点仍在数字人的视觉形象和基础语音动作能力,下一步技术跃迁,是构建像人一样的认知和表达能力:更完整的表达模型、更统一的人格系统、更长期的交互记忆。3D 数字人未来的竞争重心,将不再是谁渲染得更真实,而是谁能构建更完整的认知-表达闭环。

当数字人不再只是 "提线木偶",而是能感知语境、理解情绪、主动表达的交互主体,人机关系的底层逻辑将被重写,下一代 “数字生命” 也即将走进现实。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
网友们这几天都在吃著名毛巾集团洁丽雅的瓜,讽刺其家族“丑闻”

网友们这几天都在吃著名毛巾集团洁丽雅的瓜,讽刺其家族“丑闻”

网络易不易
2026-05-17 12:29:12
性生活过多不会"累"坏肾,真正让肾报废的事可能每天都在做

性生活过多不会"累"坏肾,真正让肾报废的事可能每天都在做

名医在线网
2026-08-15 09:20:06
贝森特掀开底牌:不是美国找茬,是中国两样东西,一样没给

贝森特掀开底牌:不是美国找茬,是中国两样东西,一样没给

菁菁子衿
2026-08-05 17:45:14
小心!欧洲被打服了,中东也不闹了,美国的目标只剩下东亚

小心!欧洲被打服了,中东也不闹了,美国的目标只剩下东亚

西府赵王爷
2025-03-22 15:47:18
被嘲膀大腰圆、不上镜?刘亦菲生图流出,狠狠打脸内娱畸形审美

被嘲膀大腰圆、不上镜?刘亦菲生图流出,狠狠打脸内娱畸形审美

历史的烟火
2026-08-22 04:48:39
橙色的魅力:那不是色彩,是我在灰调中为你保留的暖色落点

橙色的魅力:那不是色彩,是我在灰调中为你保留的暖色落点

疾跑的小蜗牛
2026-08-21 21:01:49
美媒:中国新型“运-15”涡桨运输机揭开神秘面纱,外形酷似欧洲的A400M

美媒:中国新型“运-15”涡桨运输机揭开神秘面纱,外形酷似欧洲的A400M

零度Military
2026-08-21 09:14:23
落选后自费赴美!女篮大宝贝刘禹彤这回真拼了

落选后自费赴美!女篮大宝贝刘禹彤这回真拼了

他想要很多很多的梦
2026-08-19 16:55:16
蛇鼠一窝!恒大二把手夏海钧在美国的邻居,竟然是另一个逃跑富豪

蛇鼠一窝!恒大二把手夏海钧在美国的邻居,竟然是另一个逃跑富豪

阿晭评论哥
2026-07-18 22:00:09
人到晚年才彻底明白:女婿或者儿媳不来拜访,其实背后是在给你敲响这三个“警钟”

人到晚年才彻底明白:女婿或者儿媳不来拜访,其实背后是在给你敲响这三个“警钟”

枫红染山径
2026-08-22 01:53:54
塔利班执政五年:4500万阿富汗人,三分之二不满20岁,半数在挨饿

塔利班执政五年:4500万阿富汗人,三分之二不满20岁,半数在挨饿

汪镛的创业之路
2026-08-20 15:39:25
秒售罄,太火爆!有人开出14倍价格,“到底谁抢到了啊”

秒售罄,太火爆!有人开出14倍价格,“到底谁抢到了啊”

19楼
2026-08-21 15:29:05
我老公对我真的是生理性喜欢,我俩今年四十五,他每天晚上都要抱着我睡,不是那种敷衍的搭把手,是真抱

我老公对我真的是生理性喜欢,我俩今年四十五,他每天晚上都要抱着我睡,不是那种敷衍的搭把手,是真抱

徐侠客有话说
2026-08-13 11:03:24
许家印被判无期头发眉毛全白了!恒大歌舞团佳丽秘辛浮出水面!

许家印被判无期头发眉毛全白了!恒大歌舞团佳丽秘辛浮出水面!

壹月情感
2026-08-22 05:00:13
52岁阿姨自述:我与搭伙老伴同居了一晚上后,第二天果断选择离开

52岁阿姨自述:我与搭伙老伴同居了一晚上后,第二天果断选择离开

千秋文化
2026-08-21 20:01:40
刚保外就医几小时!巴铁前总理突被抓回监狱,军方再次下狠手

刚保外就医几小时!巴铁前总理突被抓回监狱,军方再次下狠手

乐享人生风雨
2026-08-22 04:37:19
“我们正80码开在高速上,车速无法下降”,浙江一家四口自驾游玩,突然刹车失灵,慌忙求助,交警“256秒”紧急救援

“我们正80码开在高速上,车速无法下降”,浙江一家四口自驾游玩,突然刹车失灵,慌忙求助,交警“256秒”紧急救援

极目新闻
2026-08-21 10:19:17
被立案仅2天,郭德纲再迎新麻烦,原来岳云鹏才是德云社真聪明人

被立案仅2天,郭德纲再迎新麻烦,原来岳云鹏才是德云社真聪明人

揽星河的笔记
2026-08-17 22:35:03
百事营收是可口可乐近2倍,为什么多数人却觉得可口可乐更大?

百事营收是可口可乐近2倍,为什么多数人却觉得可口可乐更大?

混沌录
2026-08-19 22:51:06
中国火箭回收双线并进美军慌什么?

中国火箭回收双线并进美军慌什么?

海格看世界
2026-08-22 04:19:10
2026-08-22 05:43:00
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4510781文章数 9334关注度
往期回顾 全部

科技要闻

阿里AI的两面:云赚56亿,千问烧掉138亿

头条要闻

30岁女干部突遇洪水不幸牺牲 更多细节公布

头条要闻

30岁女干部突遇洪水不幸牺牲 更多细节公布

体育要闻

续哈登+招沃特森=骑士赌了

娱乐要闻

冯绍峰七夕带儿子游玩!次日聚会

财经要闻

蔡昉解读经济:扩大消费需求的政策思考

汽车要闻

2026成都车展:小鹏全阵容亮相 三款新车套件上新

态度原创

教育
旅游
时尚
艺术
游戏

教育要闻

重磅:南京市首次全面实施线上均衡分班,同步建档,锁定学籍,数字时代的教育,连运气都变得透明

旅游要闻

暑期消费“热”力足

全网全文背诵:阿姨你找谁啊?

艺术要闻

许家印倒台之前收到两幅字,网友:一个真敢写,一个真敢收啊!

被梗淹没,不知所措,试玩《奥星热浪》后我没绷住

无障碍浏览 进入关怀版