网易首页 > 网易号 > 正文 申请入驻

WBench 81.7 登顶:京东把视频生成,做成了"可进入的全模态世界"

0
分享至

导语(The Hook)

长视频生成领域有三大老大难:误差累积让画面越生成越糊、角色跨镜头就换脸换声音、长时域推理慢到没法用。2026 年 8 月底,京东 Joy Future Academy 团队把 JoyAI-Echo 1.5 整体开源:一个仓库装了两个模型——Echo-LongVideo能生成 10 分钟以上多镜头连贯音视频,角色长相和声音全程在线;Echo-WM则是一个"可进入"的全模态世界模型,用键盤断断续续地开、转向、后退,它就同步吐出 720p 画面 + 环境音 + 音乐 + 语音。世界模型变体在世界模型权威基准WBench 上以 81.7 平均分排名第一,把 Genie 3(73.9)甩在身后。代码、权重、ComfyUI 支持、UE 数据管线,这次全部放出来了。

硬核科普(Tech Wiki)

长时域音视频生成(Long-Horizon Audio-Visual Generation)

一句话定义:让模型一次生成几分钟到十几分钟的音视频,且角色外貌、声音、场景在镜头切换间保持一致。

类比说明:就像一个剧组要拍 10 分钟短片,前一个镜头的主角和配乐,观众在下一个镜头里必须一眼认出来——现在的视频模型经常"换了机位就换了主角"。

为什么难:扩散模型一次只能生成几秒到几十秒,靠"接着上一段续写"拼长视频时,误差会逐段累积,一致性随之崩塌。

可进入的全模态世界模型(Enterable Omnimodal World Model)

一句话定义:不只是"看"预渲染的视频,而是用户通过相机控制实时"走进"生成出来的世界,画面、环境音、音乐、语音跟着你的操作同步演化。

类比说明:传统视频生成像看电影,世界模型像玩开放世界游戏——区别在于,这个世界不存在于任何硬盘上,它是由模型实时"想象"出来的。

相机意图(Camera Intent)与 6-DoF 轨迹

一句话定义:把键盘按键、游戏手柄、连续姿态等五花八门的控制输入,统一翻译成度量尺度的相对 6 自由度相机轨迹(前进、横移、升降、俯仰、偏航、翻滚)。

类比说明:就像给不同的"方向盘"配了一个统一的"行车记录协议"——不管你用什么设备开车,系统记录的都是标准化的位移和转向。

Self-Gradient Forging(SGF,自梯度强制)

一句话定义:一种让模型用"自己生成的结果"作为上下文继续训练的后训练技术,配 Teacher Forcing(教师强制)逐步过渡,解决自回归推理时"训练和推理看到的数据分布不一致"问题。

类比说明:先让徒弟抄老师傅的成品学习(教师强制),再让徒弟独立干活、师傅在旁边指着偏差纠正(SGF),最后徒弟能又快又稳地独立出师。

核心突破:JoyAI-Echo 1.5 深度拆解

JoyAI-Echo 1.5 不是一个模型,而是基于 LightricksLTX-2骨干构建的统一系统,拆成两个专门变体,分别攻"长叙事"和"交互世界"。两篇论文同时放出:arXiv:2608.23383(系统总述)和 arXiv:2608.23189(EchoWM 世界模型专述)。


图 1:EchoWM 的"可进入世界"概念图——给定参考观测、结构化世界描述和以相对 6-DoF 轨迹表示的用户控制序列,单一模型同时支持第一/第三人称交互、同步环境声与语音、多轮续播。这张图值得看的原因:它是整个工作的"世界观",后面所有设计都服务于"让生成媒体可以被走进去"这个目标。

痛点:为什么之前的方法搞不定?

关键瓶颈

跨镜头一致性:多镜头长视频里,角色外貌和声音随镜头切换漂移;1.0 版本的音频记忆用短窗口采样,容易被背景音乐"污染"。

控制器绑定:已有世界模型(如 Genie 系列)把交互绑定在特定动作标签上,换一个控制器就得重新定义动作空间,第三人称角色控制更是需要专门设计。

长时域效率:双向扩散骨干做自回归续写,多步采样让 10 分钟生成的延迟高到不实用。

方案一:Echo-LongVideo,用"组合式跨镜头记忆"锁住角色

架构创新

视觉记忆:从同一角色的场景不相交片段中采样单帧,经视频 VAE 编码后作为记忆 token 注入。

音频记忆:不再用短窗口,而是对完整镜头音频先做语音过滤(MSST 工具包)再编码,把"这个人说话是什么音色"干净地提取出来,避免背景音乐主导。

RoPE 分区:目标 token 放低偏移区(<500),历史记忆按镜头依次放在 500、550、600……初始记忆放 ≥5000 的高偏移区——用位置编码给记忆"排座位",让注意力知道谁是谁。

四种条件组合:文本生音视频(T2AV)、图像生音视频(I2AV)、记忆+文本(MT2AV)、记忆+图像+文本(MTI2AV),统一接口联合训练。

训练策略:两阶段数据课程——Stage I 用身份中心的"记忆语料"教会模型检索记忆,Stage II 用无字幕、多分辨率(720×720 / 1280×720 / 720×1280)、扩充中文的数据增强通用质量与转场建模。质量过滤包括学习型感知评分、拉普拉斯锐度、OCR/贴片过滤、光流统计和基于感知哈希 + DINOv2 的身份级去重。


图 2:记忆条件化长视频生成与少步加速总览。上半部分是统一条件化接口(单帧视觉记忆、语音过滤音频记忆、分离的 RoPE 坐标),下半部分是记忆鲁棒的联合 DMD 蒸馏——非对称优化(视频全量微调、音频 LoRA)加上音频专属对抗与 RMS 能量约束。对应正文"方案一"整段。

少步加速:多步教师蒸馏成8 步学生生成器。蒸馏做了三件讲究事:①非对称优化——视频分支全量微调,音频分支和跨模态注意力只动 LoRA;②粗到细噪声调度——先高 shift + 大学习率搭视频结构,再低 shift + 小学习率磨音频细节;③训练时对视觉记忆做随机退化,保证推理时记忆质量稍差也能稳住。

方案二:Echo-WM,用"相机意图"统一所有交互

架构创新

统一 6-DoF 接口:键盘指令经固定映射转为局部线速度/角速度增量,SE(3) 积分成轨迹;连续姿态直接进入同一表示。选轨迹而非动作标签的三个理由:数据覆盖广、没有控制器相关的逆映射歧义、保留了垂直运动和翻滚这类连续自由度。

全局尺度校准:不同来源数据的运动幅度差异巨大(动作数据平移幅度中位数 12.7,带语音数据只有 3.9),团队用全数据集统一的 90 分位数做平移尺度校准,避免逐片段归一化抹掉位移差异或造成续播边界尺度突变。

UCPE 注入:相对 6-DoF 轨迹通过统一相机位置编码(UCPE)注入注意力,一半通道走射线几何变换、其余保留 RoPE;相机分支零初始化,与视频自注意力并行,只作用于视频 token。

第一/第三人称通吃:第一人称中轨迹直接控制观察者;第三人称中相机—角色的耦合动态直接从数据学出来,不需要为每个视角设计专用控制器——人类、动物、其他前景主体都用同一套接口。


图 3:EchoWM 总体架构。左:异构输入(键盘、动作日志、估计位姿)统一为校准后的相对 6-DoF 轨迹事件流;中:相对 UCPE 分支注入视频自注意力;右:AV-CPT → Action-SFT → Joint-FT → 自回归后训练的四阶段课程。这是全文技术密度最高的一张图。

四阶段渐进训练

AV-CPT:全骨干在音视频富集数据上预训练,保留完整标注;

Action-SFT:冻结骨干,只训相机分支——数据换为控制干净混合,并刻意移除 narrative 类运动文本,防止模型从文本提示里"抄答案"而非听控制;

Joint-FT:两组参数低学习率端到端联合微调;

自回归后训练:音视频教师强制 → 短时程 SGF(配 DMD 蒸馏压成4 步采样)→ 长时程 SGF(段间末帧继承、sink+FIFO 有界 KV 缓存、层级式长程梯度路径)。

数据引擎:四个互补数据源——内部采集游戏录像(原生音频+动作日志)、互联网人类游玩录像(自然控制时机+语音)、UE 仿真(真值度量位姿,1 个第一人称 + 4 个第三人称机位)、通用网络视频。位姿恢复用 ViPE + VGGT-Omega + MoGe-2 在约 1 分钟长窗口上优化,标注由 Qwen3-Omni 与 Gemini-3-Pro 完成并规范化为七个结构化字段。仓库在 2026 年 9 月 4 日进一步放出了这条 UE 仿真管线的代码(物理轨迹生成 + Movie Render Queue 渲染 + 分布式调度)。

方案三:Director Agent,把长片生成变成"剧组流水线"

对超过 10 分钟的长片,系统引入 Director Agent:从开放式用户意图出发,自动完成剧本开发 → 镜头计划 → 提示增强 → 逐镜头生成 → 分层审查与实时干预 → 镜头通过后记忆准入→ 组装交付。持久项目工作区支持从任意中间镜头恢复;默认全自主,也留了人类在环的检查点。


图 4:Director Agent 闭环——注意"镜头通过后记忆准入"这一步:只有审查合格的镜头才会写入跨镜头记忆库,污染记忆的坏镜头被挡在门外,这是长片一致性的工程保险。

效果:实验证明了什么?

关键指标(WBench Navigation,158 例,0–100 分):

模型

Avg

Quality

Setting

Interaction

Consistency

Physical

EchoWM

81.7

81.5

79.4

87.2

89.8

70.6

EchoWM-Flash

81.0

81.1

88.3

87.9

77.5

70.1

HiDream-O1-World

80.9

81.0

82.2

80.0

88.0

73.3

Genie 3

73.9

EchoWM 平均分第一,Flash 版的 Interaction(87.9)为全场最高——少步蒸馏几乎没有牺牲交互跟随。

SANA-WM-Bench(241 帧短时程):VBench Overall 达 83.91(Simple)/ 83.96(Hard),超过此前最佳的 DreamX-World(82.42 / 82.03);平移误差 T=0.160、CMC=0.162 均为领先水平。

961 帧长时程:Simple 拆分 VBench 81.36 为全场最高,重访一致性 revisit PSNR 达15.10 dB(最高),成像质量衰减 ΔIQ 仅 0.02——通俗说:走了一圈回到原地,场景基本还是原来那个场景。961 帧因果流式版本(EchoWM-Flash)VBench 80.13 / 81.06,均优于 Evoke、LingBot-World-v2、SANA-WM ± Causal Refiner。

用户研究(200 例):对比 LingBot-World-v2 总体偏好胜率 46.50% vs 21.57%;对比 HappyOyster 胜率 63.13% vs 27.06%,其中自动驾驶(75.00%)和多社交场景(81.25%)大幅领先。


图 5:Echo-LongVideo 的 10 分钟级多镜头生成样例——跨镜头的角色外貌与声音一致性直接看图说话,这正是"组合式跨镜头记忆 + 语音过滤音频记忆"交付的效果。

局限性与适用边界(作者自己承认的部分)

Hard 拆分上的旋转误差:961 帧 Hard 拆分中旋转误差 R=12.05°,略逊于 SANA-WM 的 10.02°——难轨迹下的精确转向还有差距。

语义跟随弱项:用户研究中对 HappyOyster 的语义跟随胜率仅 13.63%(对 29.44%),具身机器人场景下更是只有 8.67%——纯指令语义理解的短板被对手抓住了。

域外泛化的边界:训练数据不含 2D/2.5D 游戏与机器人数据,虽然论文展示了超出训练域仍保持视角演化一致,但这属于未经专门优化的"意外泛化"。

许可证限制:基于 LTX-2 构建,JD 的修改部分仅限学术研究和非商业用途,商用需联系 Lightricks。

技术溯源与关联工作团队脉络

Joy Future Academy(京东)联合 HKUST、PKU、HKU、THU、USTC、FDU、北航、斯坦福等机构完成。值得注意的作者签名:Lvmin Zhang(ControlNet 一作、LTX 系列核心开发者)和 Zeyue Xue 出现在 EchoWM 作者列表中——这也解释了为什么整条技术栈能如此深度地构建在 LTX-2 上。

时间

工作

核心贡献

2026-06

JoyAI-Echo 1.0

长音视频生成框架,系统提出误差累积、一致性、延迟三大问题(现归档于 echo1.0 分支)

2026-08

JoyAI-Echo 1.5 / Echo-LongVideo

组合式跨镜头记忆 + 8 步 DMD 蒸馏 + Director Agent,10 分钟级生成

2026-08

EchoWM

可进入全模态世界模型,WBench 登顶

2026-09

UE 数据引擎管线

世界模型的物理轨迹生成 + 渲染 + 分布式调度开源

技术演进路线

从 1.0 到 1.5 的三个关键改进

音频记忆从短窗口升级为"语音过滤后全镜头",声音一致性显著增强;

双向骨干通过渐进式教师强制 + SGF 转化为因果少步生成器(4 步),长时域推理从"不实用"变"可用",并给出消费级 GPU 推理配置;

交互从无到有:世界模型变体引入统一相机意图接口,且开源路线图明确接下来迁移 LTX-2.5 骨干、用稀疏注意力 / Paged KV-cache / FP8-TensorRT 继续砍长 rollout 成本。

资源直达

论文 1(系统总述,JoyAI-Echo 1.5):https://arxiv.org/abs/2608.23383

论文 2(EchoWM 世界模型):https://arxiv.org/abs/2608.23189

GitHub 仓库(代码 + 权重入口 + UE 管线):https://github.com/jd-opensource/JoyAI-Echo

项目主页:https://echo-team-joy-future-academy-jd.github.io/Echo-1.5-Page/

京东探索研究院:https://research.joyai.com/

代码、HuggingFace 权重、ComfyUI 支持均已开源(学术非商用许可)。

关注我们,第一时间追踪具身智能与生成模型前沿干货。

Mbot具身智能实验室

让尖端科技触手可及,人人皆可探索未来


Mbot基础交流群等你加入,下方扫码联系

具身-杰西

Mbot具身-小助手

Mbot-视频号

Mbot-公众号

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
万万没想到!辛纳接下来要疯狂拿分才能守住世界第一

万万没想到!辛纳接下来要疯狂拿分才能守住世界第一

全网球APP
2026-09-18 17:14:46
人社局:正高级职称补贴30万,副高级20万,中级6万!

人社局:正高级职称补贴30万,副高级20万,中级6万!

新浪财经
2026-09-15 22:15:19
张宏民现状:低调现身敬一丹悼念会,65岁仍没孩子,单身定居北京

张宏民现状:低调现身敬一丹悼念会,65岁仍没孩子,单身定居北京

娱圈办事处
2026-09-18 18:59:12
膝盖虚惊一场:巴萨门神为何只休一场就够

膝盖虚惊一场:巴萨门神为何只休一场就够

绿茵狂热者
2026-09-18 00:07:42
零跑C11在上海道路追尾爆燃,车头被烧塌

零跑C11在上海道路追尾爆燃,车头被烧塌

ZAKER新闻
2026-09-18 18:50:14
港圈流传着一种说法:刘嘉玲回香港组的局,王菲从不推脱。那英曾直言,阿菲这人谁约都难请,唯独刘嘉玲一喊就到。周星驰更典型

港圈流传着一种说法:刘嘉玲回香港组的局,王菲从不推脱。那英曾直言,阿菲这人谁约都难请,唯独刘嘉玲一喊就到。周星驰更典型

背包旅行
2026-09-09 18:38:20
2009年,宁波籍留美博士在大学校园餐厅内当着7人的面,将学妹杀害,行凶后他未逃离,留在原地等候警方到场,主动伸手配合警方戴上手铐

2009年,宁波籍留美博士在大学校园餐厅内当着7人的面,将学妹杀害,行凶后他未逃离,留在原地等候警方到场,主动伸手配合警方戴上手铐

人生录
2026-09-12 00:05:19
韩国惊悚片《希望》IGN 9分获编辑之选!豆瓣仅5.6

韩国惊悚片《希望》IGN 9分获编辑之选!豆瓣仅5.6

陈意小可爱
2026-09-16 11:57:36
德国亲美派默茨改口:无条件跨大西洋友谊时代可能已结束

德国亲美派默茨改口:无条件跨大西洋友谊时代可能已结束

泪满过眼
2026-09-18 21:04:14
33万电车两年亏掉21万!车主含泪自述:我买的不是车,是电动爹

33万电车两年亏掉21万!车主含泪自述:我买的不是车,是电动爹

民间胡扯老哥
2026-09-07 07:27:01
马英九之女:被称为“全球第四美千金”,如今全台湾男人都想娶回家

马英九之女:被称为“全球第四美千金”,如今全台湾男人都想娶回家

颜威爱历史
2026-08-27 06:00:11
山西一小伙儿办极简婚礼,新郎婚服29.9元网购,婚车是自家车、没有司仪、朋友兼职摄像,当事人:妻子提出的,加酒席共花费1.6万多元

山西一小伙儿办极简婚礼,新郎婚服29.9元网购,婚车是自家车、没有司仪、朋友兼职摄像,当事人:妻子提出的,加酒席共花费1.6万多元

极目新闻
2026-09-18 09:16:30
皇马击败马竞的最佳方案,穆帅或许需要牺牲维尼修斯的首发位置

皇马击败马竞的最佳方案,穆帅或许需要牺牲维尼修斯的首发位置

福酱的小时光
2026-09-18 19:46:35
整容脸上镜有多拉胯?舒畅和宋佳同框,脸蛋僵硬肿胀表情都做不开

整容脸上镜有多拉胯?舒畅和宋佳同框,脸蛋僵硬肿胀表情都做不开

青橘罐头
2026-09-18 14:25:52
河南平顶山陈杰直播带货,没守初心,更没边界,或成为最短命网红

河南平顶山陈杰直播带货,没守初心,更没边界,或成为最短命网红

老吴教育课堂
2026-09-17 13:19:37
一个冷笑话!郑钦文去打资格赛了 还被横扫了

一个冷笑话!郑钦文去打资格赛了 还被横扫了

安评聊网球
2026-08-02 04:45:06
阿里P8:人一旦失业,就会“扣扣搜搜”。家庭收入从去年140万降到今年50多万

阿里P8:人一旦失业,就会“扣扣搜搜”。家庭收入从去年140万降到今年50多万

蚂蚁大喇叭
2026-09-06 17:09:52
内行人买手机,为何很少选OPPO、vivo?4个现实原因看完恍然大悟

内行人买手机,为何很少选OPPO、vivo?4个现实原因看完恍然大悟

小蜜情感说
2026-09-18 11:30:53
2026艾美奖台上全是白人,台下有色演员只剩沉默

2026艾美奖台上全是白人,台下有色演员只剩沉默

一隅安稳
2026-09-16 15:02:24
解放台湾,难上加难?中国解放台湾,到底存在哪些困难和阻碍?

解放台湾,难上加难?中国解放台湾,到底存在哪些困难和阻碍?

補懂事的孩紙
2026-07-30 17:25:34
2026-09-19 01:51:00
杰西讲具身 incentive-icons
杰西讲具身
一名分享AI前沿的分享官,专注具身智能前沿知识
150文章数 1关注度
往期回顾 全部

科技要闻

直击iPhone 18新机发售:黄牛加价不如前代

头条要闻

俄杜马选举拉夫罗夫"意外"登顶名单 梅德韦杰夫被拿下

头条要闻

俄杜马选举拉夫罗夫"意外"登顶名单 梅德韦杰夫被拿下

体育要闻

好吧,中国男篮辛苦了

娱乐要闻

陈思诚 佟丽娅不想让儿子知道两人离婚

财经要闻

研发0.25亿理财26亿,敷尔佳豪赌三类器械

汽车要闻

纯电/插混双动力+五座/六座双布局 海狮08应该怎么选?

态度原创

家居
亲子
健康
教育
房产

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

带中俄混血宝宝来广州,战斗娃魔丸属性突然觉醒,丽安差点招架不住!

脑动脉瘤的治疗方法,该选哪一种?

教育要闻

家委会气爆了!一小学班委会集资买打印机,被家长投诉,被迫解散,而此后上演的才是大戏

房产要闻

海口房价,降不动了!

无障碍浏览 进入关怀版