网易首页 > 网易号 > 正文 申请入驻

7B模型联合生成2K视频和音频!阿里开源项目颠覆“先画面后配音”

0
分享至

智猩猩AI整理

编辑:知知

视频展示 DreamX-Creator 1.0 在不同内容场景中的联合音视频生成效果。建议开启声音观看。

当视频生成逐渐从"画面能动"走向"内容可用",声音不应只是最后补上的配乐或音效。对白是否贴合口型、动作是否踩准声响、环境音是否随场景变化,都会直接影响一段生成视频是否自然、是否完整。

为此,阿里 DreamX Team 团队提出 DreamX-Creator 1.0 来解决这一问题,这是一套紧凑的原生音视频生成系统。

DreamX-Creator 1.0 不是“先生成视频,再为视频配音”,而是让音频与视频在生成过程中持续交换信息,同时保留各自的建模能力。

其以 7B 联合生成器为核心,在统一时间坐标下同步建模画面与声音,并配套音视频数据系统、渐进式联合训练、模态感知强化学习,以及自回归单步 2K Refiner。

给定首帧和文本提示,模型能够共同生成在内容与时间上相互关联的视频和音频。


DreamX-Creator 1.0 效果概览。左侧展示 2K Refiner 对局部细节的增强,右侧展示语音、天气与动物等不同场景下连续画面和同步音轨。


论文题目:

DreamX-Creator 1.0: Democratizing Native Audio-Video Generation at 2K Resolution

01

从“视频配音”走向

原生音视频生成

常见的级联系统通常先生成视频,再调用独立模型补充声音。

这种方式容易扩展,但两个模型没有共享同一个生成过程,人物已经张嘴,语音可能尚未开始;物体已经落地,碰撞声却提前或滞后;镜头切换后,环境音仍停留在上一场景。

原生联合生成试图从源头减少这种割裂,却也带来一组更难的问题:怎样构建真正同步且描述完整的数据,怎样让两种模态充分交互而不破坏各自已有能力,怎样直接优化观感、听感和同步关系,以及怎样在联合生成之外,以可接受的计算开销输出 2K 画面。

DreamX-Creator 1.0 将完整系统组织为三段:原生音视频联合生成负责建立画面与声音,音视频强化学习进一步优化质量、提示词遵循和同步关系,独立的单步 2K Refiner 则负责恢复高分辨率细节,同时保留原始音轨。


系统整体流程。从首帧和文本提示出发,联合生成器同步产生视频与音频;模态感知反馈用于后训练;最后由 Refiner 将低分辨率视频提升至 2K。

02

数据系统:同步能力

首先来自同步数据

高质量音频和高质量视频并不天然组成高质量音视频样本。训练数据还需要满足镜头边界清晰、声音有效、两种模态在时间和语义上相关,以及文字描述能够同时覆盖“看见什么”和“听见什么”。

最新版技术报告从公开数据、网络视频、授权内容和内部数据等异构来源构建语料,并依次进行镜头切分、近静音片段剔除、有效性检查、画面与运动质量评估、声音质量评估,以及一般事件和可见语音场景下的音画同步检测。

完成筛选后,系统使用多模态模型联合理解画面和声音,通过语音识别补充对白,再将主体、动作、镜头、语音、音乐、音效与环境声整合成一条具有时间顺序的联合描述。与分别生成图像描述和音频描述再拼接相比,这种联合标注更有利于保留两种模态之间的对应关系。


数据系统包括异构数据收集、片段构建与过滤、结构化多模态标注,以及面向能力的数据组织。

整理后的样本被组织为语音与对话、动作与拟音、环境声与音乐、通用影视内容等能力池。最新版数据构成以语音和事件声为主体,同时覆盖音乐、自然声和混合内容,为不同形式的跨模态依赖提供更有针对性的监督。

03

7B 联合生成器:

专业分工,也保持双向交流

DreamX-Creator 没有把音频和视频 token 全部塞进同一条处理链,而是保留音频、视频各自专用的 DiT 分支。网络前半段主要让两种模态分别建立自身结构;进入后半段后,系统加入成对的 A2V(音频到视频)和 V2A(视频到音频)跨注意力,使动作、对白、环境声和镜头变化能够相互提供条件。

两条分支共享时间坐标,并通过时间旋转位置编码对齐各自的序列位置。

模型还为跨模态信息设置了细粒度输出门控,每个注意力头的输出都会根据当前目标特征和另一模态上下文动态缩放。这样既允许同步线索进入,也降低无关或噪声信息直接干扰主分支的风险。


网络前半段独立处理音频与视频,后半段通过双向门控跨注意力交换信息;右侧展示基于共享时间位置和上下文的逐头输出门控。

同一结构支持 A2V、V2A 和联合生成等内部训练配置。

训练时,模型先以参数高效方式建立跨模态连接,再进行全参数联合适配,最后使用质量与同步要求更严格的数据完成高质量微调。这条渐进式路径将“保留已有模态能力”和“学习跨模态关系”分开处理,为联合训练提供更稳定的起点。

04

模态感知强化学习:

把反馈送到相关分支

常规流匹配训练能够教会模型还原数据分布,却不会直接告诉模型,画面是否自然、声音是否悦耳、提示词是否被遵循,以及动作与声音是否准确同步。

DreamX-Creator 的强化学习将反馈区分为视频、音频和跨模态三类。系统在相同首帧和提示词下生成多组候选,分别评价视觉质量、听觉质量、提示词一致性和音画同步,再把视频反馈主要作用于视频分支、音频反馈作用于音频分支,同步反馈则共同作用于两条分支及其双向交互模块。


相同条件下生成多组音视频候选,再按反馈来源分别计算优势并更新相应分支;共享的同步反馈同时优化音频、视频和跨模态交互。

对于同步反馈,训练还会提高关键时间区域的权重,并更保守地控制浅层模态专用模块所接收的梯度。其目的不是简单叠加多个奖励,而是尽量保留反馈的模态来源,在改善联合表现时减少对已有视觉和声音先验的扰动。

05

单步 2K Refiner:

把高分辨率生成放到独立阶段

联合生成模型需要同时处理两种高维信号;如果再直接承担 2K 视频生成,显存与推理成本会明显增加。DreamX-Creator 因此先生成较低分辨率的联合音视频,再由独立 Refiner 增强画面,并保持音轨不变。

Refiner 的训练依次经历双向多步教师、自回归多步模型和自回归单步学生。推理时,模型按时间块依次处理视频,每个时间块只执行一次去噪评估,同时参考低分辨率输入与此前生成的高分辨率内容,以维持细节和时间连续性。


Refiner 从双向多步教师过渡到自回归多步模型,最终蒸馏为自回归单步学生。

这种设计把高分辨率细节恢复与基础音视频生成解耦,便于分别控制计算预算。不过,画面增强仍可能改变局部运动与声音事件之间的对应关系,因此评估时需要同时观察画面质量和时间一致性,不能只看清晰度。

06

最新评测:

既看自动评估,也看真实偏好

最新版技术报告在 Verse-Bench 上覆盖通用音视频事件和可见人物语音场景,并将原本分开的画面描述与声音描述合并成统一提示词。

除了自动评估,报告还加入盲测用户研究,受试者在隐藏模型身份、随机左右顺序的条件下,从文本与视频一致性、音画一致性、视频质量和音频质量等方面进行成对比较。

与 Ovi、UniAVGen、NAVA 和 DaVinci 等研究基线相比,DreamX-Creator 在盲测的各组对比中总体获得更多偏好,尤其在视频质量方面表现突出。这说明紧凑模型已经具备较有竞争力的联合生成基础,但并不代表所有内容类型和能力维度都已解决。

07

与更大模型仍有明确差距

与 LTX-2.3、MiniMax-H3 等更大规模模型相比,DreamX-Creator 1.0 尚未实现全面持平。技术报告显示,当前版本在音频美感、跨模态语义一致性和部分口型同步场景上仍有提升空间。

用户研究也给出了相似信号,在所抽取的样本中,DreamX-Creator 的视频质量可以接近部分工业级系统,但在音频质量和音画对齐上,与 Wan2.7、Kling v3、MiniMax-H3 仍存在差距。由于这组用户研究对高动态、复杂构图场景的覆盖有限,它更适合说明模型在相对常见场景中的竞争力,而不能据此推导出与工业级系统全面持平。

因此,现阶段更准确的定位是DreamX-Creator 以更紧凑的参数规模取得了具有竞争力的视觉效果和一般音画同步能力,同时把音频质量、复杂事件同步和跨模态语义理解保留为后续需要重点提升的方向。

关注+星标,获取AI前沿进展与开源一线动态

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
5-2绝境大逆转!斯瓦泰克2-1维基奇!赛后坦言生气,说得太实在了

5-2绝境大逆转!斯瓦泰克2-1维基奇!赛后坦言生气,说得太实在了

吴锎旅行ing
2026-10-05 17:04:43
“汽油味”越来越浓,新能源车油箱已经比油车还大

“汽油味”越来越浓,新能源车油箱已经比油车还大

侃故事的阿庆
2026-10-03 19:41:38
市场一巴掌,美联储改口了!5.3%生死线,再加息美国先扛不住

市场一巴掌,美联储改口了!5.3%生死线,再加息美国先扛不住

爱看剧的阿峰
2026-10-05 00:31:07
台湾寻求和解,呼吁道歉,不再说话

台湾寻求和解,呼吁道歉,不再说话

经点星娱
2026-10-04 09:11:54
52岁男子查出糖尿病,天天吃蒸鸡蛋,复查时医生称赞:6点做得好

52岁男子查出糖尿病,天天吃蒸鸡蛋,复查时医生称赞:6点做得好

健康科普365
2026-09-30 19:20:12
卧室里不能进的三样东西,必须立刻扔掉,晚一步白事找上门。

卧室里不能进的三样东西,必须立刻扔掉,晚一步白事找上门。

三农老历
2026-10-05 07:36:58
45岁小沈阳到底多有钱?豪车豪宅只是表面,这几年三笔投入更惊人

45岁小沈阳到底多有钱?豪车豪宅只是表面,这几年三笔投入更惊人

动物奇奇怪怪
2026-10-05 14:31:51
刘青山被枪决后,弟弟为他收尸,曾直言:毛主席当初处决他是对的

刘青山被枪决后,弟弟为他收尸,曾直言:毛主席当初处决他是对的

历史龙元阁
2026-10-04 15:10:13
刘涛往长城上一站,网友说的“国泰民安脸”终于有画面了

刘涛往长城上一站,网友说的“国泰民安脸”终于有画面了

阿废冷眼观察所
2026-10-02 18:34:54
牡丹花下死?古柯再曝刘晓庆猛料,庆奶发声,没把前助理放眼里

牡丹花下死?古柯再曝刘晓庆猛料,庆奶发声,没把前助理放眼里

汪镛的创业之路
2026-08-11 17:55:59
中国各省份名古屋亚运金牌榜,华东4省市占据前4,有4省区无数据

中国各省份名古屋亚运金牌榜,华东4省市占据前4,有4省区无数据

第五才子
2026-10-05 10:24:23
原国家房改课题组长孟晓苏:房价未来肯定会涨,已有牛市抬头迹象

原国家房改课题组长孟晓苏:房价未来肯定会涨,已有牛市抬头迹象

细说职场
2026-10-04 14:18:57
我的身材这么好,之前的你还会喜欢吗?

我的身材这么好,之前的你还会喜欢吗?

疾跑的小蜗牛
2026-10-05 17:20:30
鸭肉为什么是肉类界地板价?不是因鸭不值钱,而是国人太会做生意

鸭肉为什么是肉类界地板价?不是因鸭不值钱,而是国人太会做生意

史之铭
2026-10-02 03:25:11
现在的俄罗斯,大概率仅剩两条道可走:第一,把吃进去的地全还回来,赔到认怂;第二,扯掉“特别军事行动”这层遮羞布,正式宣战

现在的俄罗斯,大概率仅剩两条道可走:第一,把吃进去的地全还回来,赔到认怂;第二,扯掉“特别军事行动”这层遮羞布,正式宣战

扶苏聊历史
2026-10-05 11:46:24
俄政府:2026年俄罗斯天然气对华平均价格将为每千立方米247.9美元

俄政府:2026年俄罗斯天然气对华平均价格将为每千立方米247.9美元

俄罗斯卫星通讯社
2026-10-04 16:08:56
太憋屈!5块金牌,5张非洲脸:谁在羞辱亚洲体育?

太憋屈!5块金牌,5张非洲脸:谁在羞辱亚洲体育?

荆楚寰宇文枢
2026-09-30 22:26:52
U23国脚向余望与李衍慧官宣恋情,女方系李明大女儿

U23国脚向余望与李衍慧官宣恋情,女方系李明大女儿

懂球帝
2026-10-04 20:30:07
拿斧头砍机长的副驾驶身份披露,发了3000条“仇女”消息

拿斧头砍机长的副驾驶身份披露,发了3000条“仇女”消息

中国新闻周刊
2026-10-04 11:40:23
女子报冰岛外国团,发现除了导游全是中国人,当事人:因为该团便宜一半就报了;北极圈地广人稀但处处是乡音,感到非常亲切

女子报冰岛外国团,发现除了导游全是中国人,当事人:因为该团便宜一半就报了;北极圈地广人稀但处处是乡音,感到非常亲切

大风新闻
2026-10-04 20:28:03
2026-10-05 18:00:49
智猩猩
智猩猩
AI 技术内容与服务平台
188文章数 9关注度
往期回顾 全部

科技要闻

DeepSeek Harness国庆假期上新!

头条要闻

缅方称"没中国人死" 中国警方从缅北取证带回3具尸体

头条要闻

缅方称"没中国人死" 中国警方从缅北取证带回3具尸体

体育要闻

30天30队·热:扬尼斯、阿德巴约与克雷

娱乐要闻

蔡康永事件发酵!品牌火速切割

财经要闻

零跑声明切割!蔡康永两面人身份被抵制

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

本地
游戏
房产
教育
公开课

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

曝性感克莱尔回归《生化10》 香艳美人要当主角了

房产要闻

保利大爆发,冲到榜一!海南楼市前三季度,热销榜出炉!

教育要闻

初中根本没有录取线,那家长比学校到底比什么

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版