网易首页 > 网易号 > 正文 申请入驻

阿里巴巴把"看视频"这件事彻底想明白了:视频=世界+事件流

0
分享至


这项由阿里巴巴集团万象团队完成的研究,以预印本形式发布于2026年7月16日,论文编号为arXiv:2607.15038v1,有兴趣深入了解的读者可以通过该编号查询完整论文。

你有没有想过,一段视频到底是什么?表面上看,它就是一串连续的画面加上声音。但阿里巴巴的研究团队觉得,这个答案太草率了。他们花了大量时间思考一个更根本的问题:如果要让AI真正"理解"视频,该怎么让它看待这个世界?

这个问题之所以重要,是因为现在的AI交互系统越来越需要做到一件事——和人实时对话,不仅要听懂你说的话,还要同时看着你,用声音和画面回应你,而且这一切都要在零点几秒之内完成。这对AI来说难度极高,就像让一个人同时听音乐、打字、说话、还要做鬼脸,缺一不可,还不能慢。

万象团队在此前已经推出了两个版本的系统。第一个版本(v0.1)建立了整个框架的基础,第二个版本(v0.2)把画面清晰度从192×336像素大幅提升到了640×368像素,同时保持了约200毫秒的响应速度。而这次发布的第三个版本(v0.3),最大的突破不是技术参数的改进,而是提出了一个全新的思考框架,一个让所有视频都能被统一理解的方式:**视频等于世界加上事件流**。

一、你看到的每一段视频,都是一个"世界"在"发生事情"

要理解这个框架,可以用一个非常日常的比喻来帮助感受。

你家楼下有一家咖啡馆。走进去,你会注意到一些相对固定的东西:木质的桌椅、暖黄色的灯光、背景里播放的爵士乐、咖啡机发出的白噪音、坐在吧台后面的那个戴眼镜的老板。这些东西不会因为你每次来都变。这就是"世界"——一个持续稳定的背景和环境。

然后,每次来都会发生不同的事:今天有个顾客打翻了杯子,昨天老板对着某人笑了,上周有人在角落里弹吉他。这些随时间变化的事情,就是"事件流"。

阿里巴巴的研究团队认为,任何一段视频都可以用这两部分来理解。世界负责描述那些相对稳定的内容,包括拍摄的场景和环境、画面的视觉风格、出现的角色长什么样、背景音是什么、说话的声音特征是什么。事件流则负责描述那些随时间推移而变化的内容,包括角色在做什么动作、摄像机怎么移动、场景发生了什么变化、说了什么话、出现了什么声音。

一段被录制好的视频,就是某个世界里某段事件流的记录。而一段实时互动体验,则是同一个"世界"中,事件流根据用户的输入在线实时生成。两者在结构上是完全一致的,这正是这个框架最漂亮的地方。

二、用这个框架训练AI,就等于让它看懂了"所有视频"

明白了这个"世界+事件流"的框架之后,它带来了一个极其强大的好处:可以用几乎所有真实视频来训练AI。

以前,训练一个能够实时互动的AI,需要大量专门标注的互动数据——比如人在跟AI聊天时的视频、对话记录等。这类数据获取难度很高,数量也有限。

但如果把任何视频都理解为"世界+事件流",那么几乎地球上所有已有的视频都可以成为训练素材,因为每一段视频天然就是某个世界里发生的一系列事件的记录。训练的目标也变得清晰而统一:给定一个世界和到目前为止发生的事件,预测接下来的事件会是什么,它会怎么演化,画面和声音会呈现成什么样。

研究团队在论文中展示了两个具体的训练数据例子。第一个是一个游戏场景中的机器人角色:世界描述包括了这是白天的郊区街道、路面有黄色车道线、有人行道和草坪、背景音包括脚步声和汽车引擎声、角色是一个穿着白灰色盔甲的人形机器人。事件流则按照时间轴标注了:0到1.75秒在人行道上奔跑,1.75到7.13秒向右转上马路,7.13到17.38秒朝一辆金色轿车跑去,然后走近驾驶座车门,打开车门,进入车内,开车直行,最后右转。

第二个例子是一位中年金发女性在户外鸡圈旁的视频:世界描述包括了绿色遮阳棚、泥土地面、鸡圈、背景音有母鸡咯咯声和公鸡打鸣声以及走路声,声音来自一个用友好教导口吻说英语的女性。事件流则详细标注了她走向镜头、站定解释并做手势说"我要给大家展示我们喂鸡用的所有东西"、转身走向鸡圈、进入鸡圈取出白桶、拿着桶走回桌边、放下桶、打开桶盖舀出饲料、举起勺子展示说"这基本上就是商用颗粒饲料"。

这两个例子生动展示了训练数据的样貌。世界描述只写一次,涵盖那些整段视频都不变的信息;事件则按照时间段逐一标注,每个事件记录三个东西:这段时间区间是什么、发生这件事的是哪个角色(或者与角色无关)、发生了什么。多个角色的视频中,每个事件会明确标注是谁在做,或者标记为"与角色无关"的事件。

这套训练数据体系的优雅之处在于,它把复杂多样的视频内容统一成了同一种结构,而这种结构自然地和实时互动的需求对齐。

三、用数学语言说清楚这个框架是如何运作的

不喜欢数学的读者完全可以跳过这一节,但如果你想知道这个框架背后的逻辑是怎么被严格表达的,这里提供一个通俗版本的解释。

研究团队用一个公式描述了这套系统的核心逻辑。世界被定义为一个结构化的记录,包含视觉背景、声学背景和角色信息等字段,具体有哪些字段取决于这段视频或任务的需要,不是固定死的。每一个事件则是一个有时间区间、关联角色、以及自由描述的记录。

整个模型的工作方式,是根据已经发生的事件历史和当前的输入,一步一步地预测下一个事件。这个过程在数学上写成了一个连乘的概率公式,意思是:整段事件流出现的概率,等于每一个事件在已知世界和前面所有历史的条件下出现的概率的乘积。

这套框架不是新发明的架构,而是对已有的因果序列建模方式的一种重新命名和理解。之前系统里那些持久稳定的条件,被统一命名为"世界W";那些随时间变化的内容,被统一命名为"事件e"。这个命名本身就让"世界"成为了一个真正的一等公民——它在推理时只需要提供一次,然后事件流就可以在线实时生成。

四、如何把这个通用框架专门用于实时对话

有了通用的"世界+事件流"预训练能力之后,下一步是把它专门应用到实时的全双工音视频互动场景中去。

所谓"全双工",就像打电话一样,双方可以同时说话,而不是像对讲机那样你说完我再说。在这个场景里,世界被配置为四个方面:场景设置描述AI所处的环境和布局,角色设置描述AI的身份、外貌和人设,环境音设置描述场景的背景音效,声音音色设置描述AI说话的声音特征。

用户的实时输入——包括文字、语音和视频——就是驱动事件流的输入源。AI的回应,则是一个交织着语音和自由形式行为的事件流,这两者都会被同步解码成音频和视频输出。

这里有一个关键的升级:v0.3版本允许AI在说话的同时做出开放性词汇描述的行为动作。研究团队采用了一种"角色扮演聊天"的格式:AI输出的文字流中,括号外面的是说话内容,括号里面的是行为指令。比如"(从草地里捡起一片绿叶)你看我找到什么了",或者"(捂嘴惊讶)我完全没想到"。

这种设计的聪明之处在于,括号里的行为描述可以是任何能用语言表达的行为,完全不受限于事先定义好的动作集合。以前的系统只能做一些预设好的动作,比如游戏中的前后左右移动,而现在AI可以做出和当前场景相关的各种自然动作:伸手拿旁边的物品,转头朝向某个声音,改变站姿,或者做出情绪化的反应。行为指令和说话内容共享同一个词语流,因此它们的时序和相互关系是一起被模型学习的,不需要外部的控制器来调度。

从功能上来说,这个模型的理解过程类似于机器人领域的"视觉-语言-动作"模型(VLA),区别在于这里输出的动作不是机械臂的控制信号,而是用自然语言写成的行为指令。这些语言形式的输出再去驱动同步的音视频生成。行为指令本身只是短短几个词的语言token,对系统的计算负担几乎可以忽略不计。最终呈现出来的行为会同时体现在视觉层面(姿态、手势、眼神、与场景物体的互动)和声音层面(语调变化、非语言音效),并且在解码之前就已经是同步的,而不是生成之后再去对齐。

五、三个版本怎么变,变了什么没变什么

研究团队在论文中用一张详细的对比表格梳理了三个版本的演进,这里用故事的方式来讲清楚。

第一个版本(v0.1)奠定了整个框架的基础。它把文字、音频、视频全部放在同一条时间线上,用一个Transformer模型统一处理,让感知、说话、倾听、视频同步这些能力变成一个整体,而不是把不同模块拼接在一起。分辨率是192×336像素,延迟约200毫秒,训练目标是互动数据,AI的行为范围主要是说话加上可见的聆听状态(闲置姿态、目光、点头、微表情、唇型同步)。

第二个版本(v0.2)保持了第一版的所有框架不变,专注于提升清晰度。分辨率从192×336跳升到640×368,同时保持约200毫秒的模型侧延迟不变。这个提升的代价本来很高,因为更高分辨率意味着更大的计算量,但研究团队通过引入一种叫做"Ulysses风格上下文并行执行器"的技术解决了这个问题,把昂贵的隐层生成过程分摊到多块GPU上并行处理。训练目标依然是互动数据,AI的行为范围是说话加上更高保真度的聆听行为。

第三个版本(v0.3)保留了v0.2所有的技术参数,包括640×368的分辨率、25帧每秒的帧率、约200毫秒的模型侧响应延迟、约550毫秒的总交互延迟(其中350毫秒是双向网络传输预算)。服务架构也完全沿用了v0.2的方案。v0.3真正改变的是三件事:把整个系统的概念框架重新表述为"视频等于世界加上事件流";把训练目标从专用的互动数据扩展到通用的世界-事件预训练;把AI的行为表达范围从说话加隐式聆听扩展到了说话加开放词汇的自由行为,格式采用角色扮演中的括号行为指令。

值得注意的是,这个新框架的潜力并不局限于实时对话。研究团队在论文中明确提到,同样的预训练能力原则上可以应用于世界模型控制、实时第一人称互动(用动作或导航指令驱动场景世界)、具身操作(用指令驱动工作台世界中的机械臂)等多种下游任务。这篇论文只实例化了实时对话这一种,其他方向留待未来探索。

六、实验结果说明了什么

在实验部分,研究团队沿用了与前两个版本相同的响应边界定义:模型侧信号延迟从160毫秒的用户流单元可供推理器处理时开始计算,到对应的音视频响应单元解码完成准备发送时结束。

由于服务架构与v0.2完全一致,v0.3在相同的硬件和部署条件下保持了约200毫秒的模型侧延迟,同时输出640×368分辨率的视频,帧率维持25帧每秒。加上350毫秒的双向网络传输预算,总交互延迟维持在约550毫秒。研究团队把网络延迟作为外部部署条件固定下来,以便专注于对比模型侧的性能。

在定性行为观察方面,研究团队描述了在生成的640×368对话视频中,v0.3版本的AI在实时说话的同时执行开放词汇的行为动作。语言流中的行为指令被自然地呈现为连贯的面部表情、姿态变化、对声音的反应以及与附近物品的互动。这些动作与说话保持同步,根植于配置的场景,并且与角色的身份和外貌保持一致。在两次明确的行为事件之间,AI保持稳定的闲置和聆听状态。

说到底,这项研究干了一件看似简单实则深刻的事:它把"视频是什么"这个问题重新想了一遍,然后用这个更干净的答案,构建出一个同时能处理训练效率和交互能力两个问题的统一框架。

对普通用户来说,这意味着未来和AI视频聊天时,对面那个"人"不再只会坐在那里点头说话,它可以在听你说话的同时伸手拿起桌上的杯子,可以在听到奇怪的声音时转头张望,可以在你讲了个笑话之后做出真实的表情反应,而且这一切都不会有明显的卡顿或延迟。

值得思考的是,当AI能够在自由描述的场景世界里做出任何语言能够描述的行为时,这个"世界"的边界在哪里?如果世界可以是任何场景,行为可以是任何动作,那么一个能够实时交互的AI角色和一个"人"之间,究竟还差什么?这或许是这套框架留给我们的最值得深思的问题。有兴趣深入了解技术细节的读者,可以通过论文编号arXiv:2607.15038v1查阅完整论文。

Q&A

Q1:Wan-Streamer v0.3的"世界+事件流"框架和之前的版本有什么本质区别?

A:之前的v0.1和v0.2把实时对话互动本身当作训练目标,需要专门的互动数据来训练。v0.3把视频理解重新拆分为两部分:稳定不变的"世界"和随时间变化的"事件流",这样几乎所有普通视频都能成为训练素材,训练规模大幅扩大。核心技术参数(640×368分辨率、25帧、约200毫秒延迟)完全保留不变。

Q2:Wan-Streamer v0.3的AI角色为什么能做出更丰富的肢体动作?

A:v0.3引入了"角色扮演格式",AI输出的文字流里括号外是说话内容,括号内是行为指令,比如"(捂嘴惊讶)我完全没想到"。行为指令可以用自然语言描述任何动作,不限于预设动作集,这些文字指令再驱动音视频同步生成,最终呈现为连贯的表情、姿态和物体互动。

Q3:Wan-Streamer v0.3的总交互延迟550毫秒是怎么构成的?

A:这550毫秒分为两部分:模型侧处理大约占200毫秒,从用户的160毫秒音视频流单元到达推理器开始,到AI的音视频响应单元解码完成为止;另外350毫秒是双向网络传输预算,即用户端到服务器再回来的网络时间,这部分取决于部署环境,不由模型决定。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
华为员工:我的人生很失败,赚了1000多万,买房赔了;孩子成绩全班倒数;媳妇每天不停的抱怨……

华为员工:我的人生很失败,赚了1000多万,买房赔了;孩子成绩全班倒数;媳妇每天不停的抱怨……

LULU生活家
2026-07-21 21:01:36
天王嫂又如何,方媛近况曝光,又矮又壮,一人吃8个菜引争议

天王嫂又如何,方媛近况曝光,又矮又壮,一人吃8个菜引争议

早起的鸟儿有饭吃
2026-07-29 16:33:43
演都不演了,演唱会落泪、高调示爱的谢霆锋,被儿子上了一课

演都不演了,演唱会落泪、高调示爱的谢霆锋,被儿子上了一课

叹知
2026-07-29 11:58:21
大举空袭莫斯科,却“打偏”没击中“野莓”:乌克兰在警告克里姆林宫

大举空袭莫斯科,却“打偏”没击中“野莓”:乌克兰在警告克里姆林宫

鹰眼Defence
2026-07-29 15:44:11
陪玩陪睡只是皮毛!继手伸进裤子后,又一女星自曝,50多都不放过

陪玩陪睡只是皮毛!继手伸进裤子后,又一女星自曝,50多都不放过

不似少年游
2026-06-22 19:32:51
血债必须血偿!残杀同胞的恶徒被引渡回国,逃到美国也必须抓回来

血债必须血偿!残杀同胞的恶徒被引渡回国,逃到美国也必须抓回来

玲儿爱唱歌
2026-07-27 22:59:21
当代版“洛阳纸贵”:王虹特稿《王的猜想》火了,一份报纸被炒到65元,网友纷纷“求代购”;报社最新回应:加急赶印,机器都要冒烟了

当代版“洛阳纸贵”:王虹特稿《王的猜想》火了,一份报纸被炒到65元,网友纷纷“求代购”;报社最新回应:加急赶印,机器都要冒烟了

大风新闻
2026-07-29 10:22:23
油价调整通知

油价调整通知

浙江卫视
2026-07-29 08:31:25
45了还在拍三级片,败光两任的亿万家产,如今坦言后悔嫁给钟镇涛

45了还在拍三级片,败光两任的亿万家产,如今坦言后悔嫁给钟镇涛

寒士之言本尊
2026-07-28 14:52:44
普京再向东方借兵,这次出兵数量十分惊人,俄朝联盟要动真格?

普京再向东方借兵,这次出兵数量十分惊人,俄朝联盟要动真格?

万物知识圈
2026-07-26 22:00:06
特朗普同时警告中俄:向伊朗售武将付出代价

特朗普同时警告中俄:向伊朗售武将付出代价

桂系007
2026-07-25 04:06:29
广东中山发生一起生产安全事故致1人死亡,调查报告发布:施工单位和建设单位未能及时发现事故隐患,均面临行政处罚

广东中山发生一起生产安全事故致1人死亡,调查报告发布:施工单位和建设单位未能及时发现事故隐患,均面临行政处罚

大风新闻
2026-07-28 21:42:07
王炸!武汉诞生一位大富翁!

王炸!武汉诞生一位大富翁!

越乔
2026-07-29 16:22:52
“中国行,印度不行”?印媒:中国歼-16挂10枚空空导弹,印度苏-30MKI能照抄,但效果差

“中国行,印度不行”?印媒:中国歼-16挂10枚空空导弹,印度苏-30MKI能照抄,但效果差

蓝星杂谈
2026-07-29 10:32:16
在上海电视台工作21年,和司雯嘉是好姐妹,43岁离职准备当网红

在上海电视台工作21年,和司雯嘉是好姐妹,43岁离职准备当网红

青橘罐头
2026-07-29 14:18:30
斯通斯加盟国米:马洛塔的一石二鸟之计?

斯通斯加盟国米:马洛塔的一石二鸟之计?

带你逛体坛
2026-07-29 14:13:16
汇率崩盘、股市直接熔断!中美大国斗法,这4个国家反倒快破产了

汇率崩盘、股市直接熔断!中美大国斗法,这4个国家反倒快破产了

老谢谈史
2026-07-29 14:21:21
华为新车官宣:7月31日,改配完成

华为新车官宣:7月31日,改配完成

科技堡垒
2026-07-27 09:57:54
今年“超级爆冷”的985大学,两次征集志愿都无人报考,全国罕见!

今年“超级爆冷”的985大学,两次征集志愿都无人报考,全国罕见!

教育导向分享
2026-07-27 23:07:19
上海发布高温橙色预警:今日中心城区大部最高气温将超37℃

上海发布高温橙色预警:今日中心城区大部最高气温将超37℃

澎湃新闻
2026-07-29 13:40:29
2026-07-29 18:23:00
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9358文章数 567关注度
往期回顾 全部

科技要闻

Kimi K3火爆,奥特曼:开源一定有一席之地

头条要闻

大爷杀死眼镜蛇 5分钟后蛇头"复仇"毒牙刺入其掌心

头条要闻

大爷杀死眼镜蛇 5分钟后蛇头"复仇"毒牙刺入其掌心

体育要闻

毫无存在感的NBA状元,最先谢谢惠顾?

娱乐要闻

55岁影帝黄政民出轨

财经要闻

天丝红牛多地检出成分不合格 企业申诉

汽车要闻

对标小米SU7 腾势Z9S将于8月3日开启预售

态度原创

家居
手机
亲子
本地
艺术

家居要闻

2026建博会(广州) 公装联探展交流活动

手机要闻

小米公布REDMI ChinaJoy日程:7月31日展示“重磅新品”

亲子要闻

产检漏诊,新生儿足部畸形?专家:医学有“盲区”但沟通不该有

本地新闻

跟着影视去旅行:八仙篇

艺术要闻

LV中国总部所在大楼,获“最佳建筑奖”

无障碍浏览 进入关怀版