网易首页 > 网易号 > 正文 申请入驻

终于!世界模型进入“有声时代”:24FPS画面+48kHz立体声实时生成

0
分享至

允中 发自 凹非寺
量子位 | 公众号QbitAI

太卷了!过去两年,视频生成模型把画面参数几乎卷了个遍。

4K、物理一致性,画面越来越真,时长也越来越长。

但传统视频生成模型生成的永远是一段固定、预设的成品视频,你无法干预剧情、不能调整视角、更不能改变下一秒画面内容。

世界模型带来的变化,恰恰在这里。

它会跟随操作实时渲染、动态生成世界

按下前进键,前方场景实时延展生成;转身回望,身后的街道即刻演算而出。

你不再是被动的观看者,而是真正的参与者

而现在,做这件事的团队多了起来。Google DeepMind的Genie 3、腾讯的WorldPlay、蚂蚁的LingBot-World,以及一批创业公司,都在推进这个方向。


△神仙打架,越来越有「头号玩家」那味儿

放眼当下,世界模型已经初步实现了可自由探索、实时交互的视觉场景。画面质量、帧率、持续生成时间以及稳定性,都有了很大提升。

可当你戴上耳机沉浸式体验时,就会察觉致命短板:这片世界,一片寂静。

你漫步街巷,车辆从身旁驶过,却没有呼啸而过的轰鸣;你推开厚重的木门,门板缓缓转动,却听不到一丝铰链摩擦的声响;你看到野兽就在不远处低吼,身躯清晰映入眼帘,耳边却一片死寂。

有画无声,不成世界。

首发!可交互音视频世界模型HelixWorld 1.0

现在,这块最明显的短板,终于有人补上了。

Noiz AI联合来自香港科技大学、清华大学、CMU、Google DeepMind等机构的研究员,刚刚发布了实时可交互音视频世界模型HelixWorld 1.0

丢进去一张图和一句提示词,眼前就会展开一个持续生成的世界。

接下来就不一样了。

你不再坐着看。往前走、转个身,画面和声音会同时跟上。你走到哪,世界就延伸到哪。

这次补上的,是世界对用户行动更完整的实时响应,远不止一条音轨。

在可交互的世界里,声音承担的远不止BGM。

离多远、踩在什么材质上、从哪个方向来,都会让它不一样;身后的脚步、拐角外的碰撞,往往只有耳朵能先听到。

参数也相当硬核,HelixWorld支持24 FPS实时生成画面,同时输出48kHz双声道音频

真正关键的还在后面。画面和声音由原生Transformer架构统一生成,从一开始就绑在一起,不会等视频做完再另配一条音轨。

声音和画面来自同一个世界,用户的每一次操作,都会同时作用在两个模态上。

声画一起生成,声音跟着场景转,还能实时交互,是HelixWorld和现有方案不同的地方。放进现在可交互世界模型的对照里,会更清楚:


△交互式世界模型能力对照

好戏才开始。接下来几周,HelixWorld的模型权重和代码将完全开源。(详见后续章节)

路线:让世界具备原生多模态响应

给视频补一条音轨不难,难的是让不同模态从生成一开始就属于这个世界。

为了达到这个目标,HelixWorld把路径拆成四步。

第一步:构建带空间和动作的音画/世界数据

数据决定上限。世界模型能走多远,很大程度上取决于它训练时见过什么样的世界。

△数据采集与处理流程总览



可交互世界模型既要看见画面,也要知道什么操作引发了下一刻的变化。

视觉侧已有成熟解法,可以用位姿估计模型反推每一帧的相机轨迹,生成动作标签。可一到声音侧,几乎没有现成数据可用

现有技术报告通常会筛分辨率、时长、镜头切换等等,却很少管声音。道理很简单,它们本来就没打算生成有声世界。

但音视频世界模型还得弄清更多事:音轨是不是现场录制,声源在哪,听者转身后声场怎么变,空间会留下多久回响。

麻烦的是,现成数据集给不齐这些答案。

团队干脆两条腿走路,同时从真实世界游戏世界取材。

真实世界的数据来自公开网络视频,其中最宝贵的是第一人称连续行走素材

镜头持续移动,环境声同期录制,声画天然对齐。反射、遮挡、材质这些空间信息都来自真实环境,这一批主要用来保真。

游戏世界则补上精确的空间关系。游戏引擎同时模拟视觉和听觉,几何、材质、声源位置和听者朝向都是已知的。距离衰减、墙体遮挡这些也有明确规则,每一声都能对上物理位置。

更省事的是,游戏数据天然带有动作标注,画面、声音与操作可以直接对齐。

原始素材还得再洗一遍。视觉侧按镜头切片,去掉剪得太碎、运动太少、画质太差的,台标、水印、字幕也滤掉。

音频侧没有现成经验,团队就自己搭清洗流程:去掉左右声道完全相同的伪立体声,清掉和画面对不上的后期配乐,再用语义筛选去掉旁白和外加音效,只留现场声。

留下的片段还要做声画对齐校验。系统逐帧计算声像位置和左右声道能量,再和画面里的声源方位、事件时刻逐一比对。

汽车从画面右侧驶向左侧,声像就该同步从右滑到左;碰撞发生在哪一帧,音轨上的能量峰值也得落在那一帧。空间对不上、时间错开的,直接丢掉。

标注也不再只盯着画面。除了带真实尺度的相机位姿和视频描述,每段素材还会加上音频描述与音视频联合描述,把声音和画面里的声源对应起来。画外声则单独记下,免得模型自己编。

走完整条管线后,团队得到百万量级训练片段,音质、立体声和帧级对齐都达标。随后再用人工标注数据训练分类器,按声画配合度与声场空间感打分,筛出高质量微调子集。

到这里,声音侧终于有了能用的训练数据。

数据解决模型见没见过的问题。下一步,是让声音和视觉进入同一套世界建模。

第二步:让画面与声场共同响应动作

团队以音视频生成基座LTX2.3为起点,引入动作控制。

音频和视频保留各自的latent表征,但会进入同一套Transformer联合生成,并持续交换信息。

模型要学的是:根据当前状态和用户动作,预测下一刻的画面与声音。

人往前走一步,透视、遮挡和声源距离都得变;人一转身,整个声场也得跟着转。原来在正前方的声音,转到侧后方,这才算真转过身了。声画有一路没跟上,沉浸感马上就破功了。

这一阶段仍采用全序列可见的双向模型,先不追求实时。团队先把动作控制和联合生成做准,再来攻速度。

具备动作控制后,团队用微调数据集做针对性微调。

关键不只是模型能不能动,还要看脚步有没有踩对材质、混响是否匹配空间大小、声源方位会不会跟着视角转。动起来还不够,得动得像那么回事。

最基础的一关,是事件发生时声音必须同步出现,回响也要符合空间和动作。循环BGM、素材库音效和事后贴轨造成的伪同步,都要排除。

空间关系不能只凭耳朵觉得像。画质有FID、FVD,音质有FAD,音画同步有Desync,声音的方位和距离对不对得上画面,一直缺自动化标尺。听着差不多还不够,位置必须对上。

到这里,HelixWorld已经能让声画一起响应动作,但训练阶段的模型仍依赖“未来信息”,还无法真正实时交互。

第三步:让模型只看过去也能持续生成

因果化、KV Cache、自生成历史训练

传统视频扩散模型采用双向生成。计算第10帧时,它可以参考第20帧,因此更容易保持连贯。

可在交互世界里,第20帧还没发生,用户下一秒往哪走也不知道,没法提前看后面的帧

HelixWorld因此将双向预训练模型改造成因果模型,只允许它查看过去。同时通过KV Cache复用已计算的历史信息,逐块自回归生成,持续输出音频和画面。

因果化分两步。

第一步用真实数据微调,让模型先学会不依赖未来,也能继续生成音视频。

真正棘手的是第二步,训练和部署面对的历史数据并不相同。

训练时,模型看到的历史干净且正确;部署时,它看到的是自己刚生成的结果,误差早已混在其中。

如果模型始终拿这些数据训练,上线后就会拿着错答案继续作答。小误差一路滚,最后就是声画双双跑偏。

团队的解法很直接:训练时就让模型读自己生成的历史,再去预测正确结果,提前练习带着误差继续往下走。

这一步让模型从生成一小段,迈向持续生成。但能一直跑,还不等于能实时跑。几十步去噪依然太慢,用户按下方向键后,留给声画响应的只有几十毫秒。

第四步:让世界从“生成片段”走向“持续运行”

最后一关是速度。团队要把原本几十步的去噪压到个位数,同时省掉文本条件引导带来的额外前向计算。

主流少步方案DMD,也就是分布匹配蒸馏,常见副作用是画面过曝。

优化过头之后,高光溢出、色彩过饱和、暗部细节没了,画面看着更亮,其实已经失真。

HelixWorld的解法,是把轨迹蒸馏和DMD放在一起

轨迹蒸馏让学生模型沿着教师模型的去噪路径走,给少步生成一个比较稳的基线。DMD负责守住最终分布,避免步数压下去之后偏离教师模型。

再配合因果化后的KV Cache和逐块生成,动作输入、联合生成与音视频输出被串成连续流水线。

上一块刚生成,下一块已经开始算,不用等整段视频做完再一起交出去。

至此,模型终于跨过实时门槛。画面与声音边生成边输出,用户的每一次操作,都能立刻得到回应。

四步走完,HelixWorld的技术链路算是完成了。

开源:底色和底气

HelixWorld的权重和代码,将在接下来几周完全开源,把整套技术摊开来给全世界分享。

仓库链接:https://github.com/NoizAI/HelixWorld

巧的是,开源这边又热闹起来了。不久前Meta也重新回到了开源群,扎克伯格回心转意:限制开源是大错特错。

黄仁勋也给出相近判断:开放权重,是AI生态健康发展的前提。

对Noiz AI来说,开源是长期以来一直在做的事。

该团队组建于2025年底,成员来自Meta、Google、Dolby、清华等机构,开源项目累计超过5万GitHub Stars

创始人陈伟嘉(Vega)在Meta主导Yann LeCun(杨立昆)团队ASR模型落地,当时公司93%以上代码都是开源的;后来还开源出过很火的Mockingbird。

首席科学家田泽越(Zeyue Tian)作为作者开源过AudioX、YuE等工作,其中ChatMusician还被杨立昆转发过。

从Mockingbird到AudioX,再到HelixWorld,开源一直是这支团队的底色

Noiz并不担心被超越。

早在上一年底,团队在这条路线就已经开始布局。

目前模型的API已经在内测中,团队在应用侧也正在悄悄搭建一个全新的交互内容社区,并从创作者和用户中源源不断获取宝贵的使用数据和反馈。这些都是更实打实的底气。

HelixWorld 1.0,是Noiz AI对世界模型下一形态的回应:视觉从成片走向实时漫游,声音也正成为更关键的一环。

开源,更多是希望生态更丰富一点。模型被拆开、复现、接到更多系统里,全行业一起跑,后面那一页也能更早到来。

代码打开了,真正难的部分才开始。

从旁观世界,到参与世界

今天,大多数多模态模型还是围着Prompt转:输入一句话,完成一次生成,任务就结束了。

但真实世界不会因为Prompt结束就停住。环境还在变,人还在动,新事件也还在发生。世界模型得一直跑着,不能用完就关机。

它得知道正在发生什么,记得已经发生过什么,并对接下来的变化即时作出反应。

HelixWorld补上的实时音视频交互,只是第一步。

再往前一步,世界里不会只有一个人。

第一个方向,是多智能体(Multi-Agent)

每个角色都有自己的身份、目标和记忆,彼此可以协作,也可能起争执。故事不会完全按剧本走,更多是角色碰上之后自己发展出来。

第二个方向,是多人现场

当人和智能体同时进到一个空间,模型得听清说了什么,还得分清谁在说、对谁说、声音从哪来。

抢话、停顿、眼神这些,都可能把下一秒的关系带偏。把所有人的声音收进来只是门槛,难处在于读懂整个现场。

接下来,还有更硬的一关:超长时间一致性

如果世界要跑上几小时、几天,甚至更久,角色还得记得自己是谁,昨天推开的门今天得还开着,一次对话和一个决定也得真的留下痕迹。

到这一步,一致性就不止人物不变脸、场景不乱漂。身份、记忆、空间状态和因果关系都得接得上,世界得有自己的历史。

再往远处看,是世界的自主进化

未来就算没有新的Prompt,也没有人在场,世界还能按自己的规则跑下去。

角色会结成新关系,城市和资源也会继续变。你开口,世界会回应。你转身离开,里面的故事仍在继续发生。

当这几件事真正叠在一起,游戏、互动影视、教育这些场景都会被改写。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
今日重要赛事!8月17日,央视CCTV5直播男篮,CCTV5+节目表

今日重要赛事!8月17日,央视CCTV5直播男篮,CCTV5+节目表

薇说体育
2026-08-17 10:32:35
医生提醒:每天吃点它,肌肉一周涨回来,再忙也要看2分钟

医生提醒:每天吃点它,肌肉一周涨回来,再忙也要看2分钟

观星赏月
2026-08-16 07:53:46
未来不出意外,那些二胎、三胎的非编工薪家庭,会越来越难,无力托举子女

未来不出意外,那些二胎、三胎的非编工薪家庭,会越来越难,无力托举子女

舒山有鹿
2026-08-15 09:28:35
马云黄仁勋马斯克山寨三巨头线下合体 网友调侃再也不怕被卡脖子

马云黄仁勋马斯克山寨三巨头线下合体 网友调侃再也不怕被卡脖子

快科技
2026-08-17 10:37:11
2022年林彪女婿葬礼:四大金刚后代合送一个花圈,林豆豆哭成泪人

2022年林彪女婿葬礼:四大金刚后代合送一个花圈,林豆豆哭成泪人

阿器谈史
2025-02-14 10:59:47
女子称花2000元在瑞慈体检,结果与三甲医院差数倍!多方回应

女子称花2000元在瑞慈体检,结果与三甲医院差数倍!多方回应

凤凰网安徽
2026-08-17 11:03:56
性关系:想多活25年,74岁以后,请死死记住这8句话

性关系:想多活25年,74岁以后,请死死记住这8句话

荷兰豆爱健康
2026-08-17 04:51:26
终于来了!养老金调整主基调定了,让人心心念念,估摸你能涨多少

终于来了!养老金调整主基调定了,让人心心念念,估摸你能涨多少

蜉蝣说
2026-08-16 22:01:02
马来西亚“亲华派”失利,给中国提了一个醒,有些手段该变就得变

马来西亚“亲华派”失利,给中国提了一个醒,有些手段该变就得变

浯江孤舟
2026-08-16 20:37:59
上海男子失业48天了,生活费都快没了,妻子花230买个榴莲

上海男子失业48天了,生活费都快没了,妻子花230买个榴莲

刘哥谈体育
2026-08-17 13:39:09
马库斯回应因“搜集宣传日军侵华罪证”被迫关停公司、背上债务:我别无选择!我们一定会继续下去!

马库斯回应因“搜集宣传日军侵华罪证”被迫关停公司、背上债务:我别无选择!我们一定会继续下去!

闪电新闻
2026-08-16 21:09:32
打赏千万要求女主播陪睡后续,聊天记录太露骨,更刺眼的还在后面

打赏千万要求女主播陪睡后续,聊天记录太露骨,更刺眼的还在后面

大鱼简科
2026-08-17 16:55:29
NB,哈登回归!1换1,冲击NBA历史......

NB,哈登回归!1换1,冲击NBA历史......

体育新角度
2026-08-17 09:59:30
打赏千万要求女主播陪睡后续,聊天记录太露骨,更恶心的还在后面

打赏千万要求女主播陪睡后续,聊天记录太露骨,更恶心的还在后面

社会日日鲜
2026-08-16 16:36:05
上映20天狂揽151亿,仅差1亿超越《哪吒2》,我感慨:《阿凡达》都要压不住了

上映20天狂揽151亿,仅差1亿超越《哪吒2》,我感慨:《阿凡达》都要压不住了

草莓解说体育
2026-08-17 14:50:55
特朗普回应白宫发言人离职:莱维特是不可替代的,但我发现她竟然更爱她的孩子而不是特朗普,这让我很在意

特朗普回应白宫发言人离职:莱维特是不可替代的,但我发现她竟然更爱她的孩子而不是特朗普,这让我很在意

极目新闻
2026-08-17 10:06:24
600172,直线拉涨停!

600172,直线拉涨停!

中国基金报
2026-08-17 10:34:13
足坛疯狂一夜:曼城3球惨败,巴黎爆冷丢冠,皇马大胜,利物浦击败科莫

足坛疯狂一夜:曼城3球惨败,巴黎爆冷丢冠,皇马大胜,利物浦击败科莫

足球狗说
2026-08-17 04:46:01
瞒不住了?李小冉5亿宠婚骗局曝光,11年丁克崩盘,郭京飞一针见血

瞒不住了?李小冉5亿宠婚骗局曝光,11年丁克崩盘,郭京飞一针见血

荒野老五
2026-08-15 22:46:34
瑞典大满贯结束,男乒世界最新排名,林诗栋张本智和排名更新

瑞典大满贯结束,男乒世界最新排名,林诗栋张本智和排名更新

范动舍长
2026-08-17 12:06:18
2026-08-17 18:00:49
量子位 incentive-icons
量子位
追踪人工智能动态
13161文章数 176537关注度
往期回顾 全部

科技要闻

马斯克600亿美元买条近路

头条要闻

男子当街制止父亲暴打女儿被判故意伤害罪 当事人发声

头条要闻

男子当街制止父亲暴打女儿被判故意伤害罪 当事人发声

体育要闻

因莫比莱:普通人的平凡故事

娱乐要闻

立案风波席卷德云社多场巡演叫停!

财经要闻

Token调用暴增千倍,算力租赁变天了

汽车要闻

红旗的“慢”,究竟在慢什么?

态度原创

数码
艺术
教育
公开课
军事航空

数码要闻

宏碁非凡Go Air笔记本首发5099元起:酷睿5 320、轻至1.19kg

艺术要闻

庞茂琨水彩随笔 2026年新作

教育要闻

不知道家长遇到这样的题目,还会有解题思路吗?

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

俄遭大规模袭击 24小时内击落1478架乌无人机刷新纪录

无障碍浏览 进入关怀版