网易首页 > 网易号 > 正文 申请入驻

终于!世界模型进入“有声时代”�...

0
分享至

来源:市场资讯

(来源:量子位)

太卷了!过去两年,视频生成模型把画面参数几乎卷了个遍。

4K、物理一致性,画面越来越真,时长也越来越长。

但传统视频生成模型生成的永远是一段固定、预设的成品视频,你无法干预剧情、不能调整视角、更不能改变下一秒画面内容。

世界模型带来的变化,恰恰在这里。

它会跟随操作实时渲染、动态生成世界

按下前进键,前方场景实时延展生成;转身回望,身后的街道即刻演算而出。

你不再是被动的观看者,而是真正的参与者

而现在,做这件事的团队多了起来。Google DeepMind的Genie 3、腾讯的WorldPlay、蚂蚁的LingBot-World,以及一批创业公司,都在推进这个方向。


△神仙打架,越来越有「头号玩家」那味儿

放眼当下,世界模型已经初步实现了可自由探索、实时交互的视觉场景。画面质量、帧率、持续生成时间以及稳定性,都有了很大提升。

可当你戴上耳机沉浸式体验时,就会察觉致命短板:这片世界,一片寂静。

你漫步街巷,车辆从身旁驶过,却没有呼啸而过的轰鸣;你推开厚重的木门,门板缓缓转动,却听不到一丝铰链摩擦的声响;你看到野兽就在不远处低吼,身躯清晰映入眼帘,耳边却一片死寂。

有画无声,不成世界。

现在,这块最明显的短板,终于有人补上了。

Noiz AI联合来自香港科技大学、清华大学、CMU、Google DeepMind等机构的研究员,刚刚发布了实时可交互音视频世界模型HelixWorld 1.0

丢进去一张图和一句提示词,眼前就会展开一个持续生成的世界。

接下来就不一样了。

你不再坐着看。往前走、转个身,画面和声音会同时跟上。你走到哪,世界就延伸到哪。

这次补上的,是世界对用户行动更完整的实时响应,远不止一条音轨。

在可交互的世界里,声音承担的远不止BGM。

离多远、踩在什么材质上、从哪个方向来,都会让它不一样;身后的脚步、拐角外的碰撞,往往只有耳朵能先听到。

参数也相当硬核,HelixWorld支持24 FPS实时生成画面,同时输出48kHz双声道音频

真正关键的还在后面。画面和声音由原生Transformer架构统一生成,从一开始就绑在一起,不会等视频做完再另配一条音轨。

声音和画面来自同一个世界,用户的每一次操作,都会同时作用在两个模态上。

声画一起生成,声音跟着场景转,还能实时交互,是HelixWorld和现有方案不同的地方。放进现在可交互世界模型的对照里,会更清楚:


△交互式世界模型能力对照

好戏才开始。接下来几周,HelixWorld的模型权重和代码将完全开源。(详见后续章节)

给视频补一条音轨不难,难的是让不同模态从生成一开始就属于这个世界。

为了达到这个目标,HelixWorld把路径拆成四步。

第一步:构建带空间和动作的音画/世界数据

数据决定上限。世界模型能走多远,很大程度上取决于它训练时见过什么样的世界。

△数据采集与处理流程总览


可交互世界模型既要看见画面,也要知道什么操作引发了下一刻的变化。

视觉侧已有成熟解法,可以用位姿估计模型反推每一帧的相机轨迹,生成动作标签。可一到声音侧,几乎没有现成数据可用

现有技术报告通常会筛分辨率、时长、镜头切换等等,却很少管声音。道理很简单,它们本来就没打算生成有声世界。

但音视频世界模型还得弄清更多事:音轨是不是现场录制,声源在哪,听者转身后声场怎么变,空间会留下多久回响。

麻烦的是,现成数据集给不齐这些答案。

团队干脆两条腿走路,同时从真实世界游戏世界取材。

真实世界的数据来自公开网络视频,其中最宝贵的是第一人称连续行走素材

镜头持续移动,环境声同期录制,声画天然对齐。反射、遮挡、材质这些空间信息都来自真实环境,这一批主要用来保真。

游戏世界则补上精确的空间关系。游戏引擎同时模拟视觉和听觉,几何、材质、声源位置和听者朝向都是已知的。距离衰减、墙体遮挡这些也有明确规则,每一声都能对上物理位置。

更省事的是,游戏数据天然带有动作标注,画面、声音与操作可以直接对齐。

原始素材还得再洗一遍。视觉侧按镜头切片,去掉剪得太碎、运动太少、画质太差的,台标、水印、字幕也滤掉。

音频侧没有现成经验,团队就自己搭清洗流程:去掉左右声道完全相同的伪立体声,清掉和画面对不上的后期配乐,再用语义筛选去掉旁白和外加音效,只留现场声。

留下的片段还要做声画对齐校验。系统逐帧计算声像位置和左右声道能量,再和画面里的声源方位、事件时刻逐一比对。

汽车从画面右侧驶向左侧,声像就该同步从右滑到左;碰撞发生在哪一帧,音轨上的能量峰值也得落在那一帧。空间对不上、时间错开的,直接丢掉。

标注也不再只盯着画面。除了带真实尺度的相机位姿和视频描述,每段素材还会加上音频描述与音视频联合描述,把声音和画面里的声源对应起来。画外声则单独记下,免得模型自己编。

走完整条管线后,团队得到百万量级训练片段,音质、立体声和帧级对齐都达标。随后再用人工标注数据训练分类器,按声画配合度与声场空间感打分,筛出高质量微调子集。

到这里,声音侧终于有了能用的训练数据。

数据解决模型见没见过的问题。下一步,是让声音和视觉进入同一套世界建模。

第二步:让画面与声场共同响应动作

团队以音视频生成基座LTX2.3为起点,引入动作控制。

音频和视频保留各自的latent表征,但会进入同一套Transformer联合生成,并持续交换信息。

模型要学的是:根据当前状态和用户动作,预测下一刻的画面与声音。

人往前走一步,透视、遮挡和声源距离都得变;人一转身,整个声场也得跟着转。原来在正前方的声音,转到侧后方,这才算真转过身了。声画有一路没跟上,沉浸感马上就破功了。

这一阶段仍采用全序列可见的双向模型,先不追求实时。团队先把动作控制和联合生成做准,再来攻速度。

具备动作控制后,团队用微调数据集做针对性微调。

关键不只是模型能不能动,还要看脚步有没有踩对材质、混响是否匹配空间大小、声源方位会不会跟着视角转。动起来还不够,得动得像那么回事。

最基础的一关,是事件发生时声音必须同步出现,回响也要符合空间和动作。循环BGM、素材库音效和事后贴轨造成的伪同步,都要排除。

空间关系不能只凭耳朵觉得像。画质有FID、FVD,音质有FAD,音画同步有Desync,声音的方位和距离对不对得上画面,一直缺自动化标尺。听着差不多还不够,位置必须对上。

到这里,HelixWorld已经能让声画一起响应动作,但训练阶段的模型仍依赖“未来信息”,还无法真正实时交互。

第三步:让模型只看过去也能持续生成

传统视频扩散模型采用双向生成。计算第10帧时,它可以参考第20帧,因此更容易保持连贯。

可在交互世界里,第20帧还没发生,用户下一秒往哪走也不知道,没法提前看后面的帧

HelixWorld因此将双向预训练模型改造成因果模型,只允许它查看过去。同时通过KV Cache复用已计算的历史信息,逐块自回归生成,持续输出音频和画面。

因果化分两步。

第一步用真实数据微调,让模型先学会不依赖未来,也能继续生成音视频。

真正棘手的是第二步,训练和部署面对的历史数据并不相同。

训练时,模型看到的历史干净且正确;部署时,它看到的是自己刚生成的结果,误差早已混在其中。

如果模型始终拿这些数据训练,上线后就会拿着错答案继续作答。小误差一路滚,最后就是声画双双跑偏。

团队的解法很直接:训练时就让模型读自己生成的历史,再去预测正确结果,提前练习带着误差继续往下走。

这一步让模型从生成一小段,迈向持续生成。但能一直跑,还不等于能实时跑。几十步去噪依然太慢,用户按下方向键后,留给声画响应的只有几十毫秒。

第四步:让世界从“生成片段”走向“持续运行”

最后一关是速度。团队要把原本几十步的去噪压到个位数,同时省掉文本条件引导带来的额外前向计算。

主流少步方案DMD,也就是分布匹配蒸馏,常见副作用是画面过曝。

优化过头之后,高光溢出、色彩过饱和、暗部细节没了,画面看着更亮,其实已经失真。

HelixWorld的解法,是把轨迹蒸馏和DMD放在一起

轨迹蒸馏让学生模型沿着教师模型的去噪路径走,给少步生成一个比较稳的基线。DMD负责守住最终分布,避免步数压下去之后偏离教师模型。

再配合因果化后的KV Cache和逐块生成,动作输入、联合生成与音视频输出被串成连续流水线。

上一块刚生成,下一块已经开始算,不用等整段视频做完再一起交出去。

至此,模型终于跨过实时门槛。画面与声音边生成边输出,用户的每一次操作,都能立刻得到回应。

四步走完,HelixWorld的技术链路算是完成了。

开源:底色和底气

HelixWorld的权重和代码,将在接下来几周完全开源,把整套技术摊开来给全世界分享。

仓库链接:https://github.com/NoizAI/HelixWorld

巧的是,开源这边又热闹起来了。不久前Meta也重新回到了开源群,扎克伯格回心转意:限制开源是大错特错。

黄仁勋也给出相近判断:开放权重,是AI生态健康发展的前提。

对Noiz AI来说,开源是长期以来一直在做的事。

该团队组建于2025年底,成员来自Meta、Google、Dolby、清华等机构,开源项目累计超过5万GitHub Stars

创始人陈伟嘉(Vega)在Meta主导Yann LeCun(杨立昆)团队ASR模型落地,当时公司93%以上代码都是开源的;后来还开源出过很火的Mockingbird。

首席科学家田泽越(Zeyue Tian)作为作者开源过AudioX、YuE等工作,其中ChatMusician还被杨立昆转发过。

从Mockingbird到AudioX,再到HelixWorld,开源一直是这支团队的底色

Noiz并不担心被超越。

早在上一年底,团队在这条路线就已经开始布局。

目前模型的API已经在内测中,团队在应用侧也正在悄悄搭建一个全新的交互内容社区,并从创作者和用户中源源不断获取宝贵的使用数据和反馈。这些都是更实打实的底气。

HelixWorld 1.0,是Noiz AI对世界模型下一形态的回应:视觉从成片走向实时漫游,声音也正成为更关键的一环。

开源,更多是希望生态更丰富一点。模型被拆开、复现、接到更多系统里,全行业一起跑,后面那一页也能更早到来。

代码打开了,真正难的部分才开始。

从旁观世界,到参与世界

今天,大多数多模态模型还是围着Prompt转:输入一句话,完成一次生成,任务就结束了。

但真实世界不会因为Prompt结束就停住。环境还在变,人还在动,新事件也还在发生。世界模型得一直跑着,不能用完就关机。

它得知道正在发生什么,记得已经发生过什么,并对接下来的变化即时作出反应。

HelixWorld补上的实时音视频交互,只是第一步。

再往前一步,世界里不会只有一个人。

第一个方向,是多智能体(Multi-Agent)

每个角色都有自己的身份、目标和记忆,彼此可以协作,也可能起争执。故事不会完全按剧本走,更多是角色碰上之后自己发展出来。

第二个方向,是多人现场

当人和智能体同时进到一个空间,模型得听清说了什么,还得分清谁在说、对谁说、声音从哪来。

抢话、停顿、眼神这些,都可能把下一秒的关系带偏。把所有人的声音收进来只是门槛,难处在于读懂整个现场。

接下来,还有更硬的一关:超长时间一致性

如果世界要跑上几小时、几天,甚至更久,角色还得记得自己是谁,昨天推开的门今天得还开着,一次对话和一个决定也得真的留下痕迹。

到这一步,一致性就不止人物不变脸、场景不乱漂。身份、记忆、空间状态和因果关系都得接得上,世界得有自己的历史。

再往远处看,是世界的自主进化

未来就算没有新的Prompt,也没有人在场,世界还能按自己的规则跑下去。

角色会结成新关系,城市和资源也会继续变。你开口,世界会回应。你转身离开,里面的故事仍在继续发生。

当这几件事真正叠在一起,游戏、互动影视、教育这些场景都会被改写。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
普京最不愿看到的一幕出现:日本没派兵,却把乌克兰战场搬回了太平洋

普京最不愿看到的一幕出现:日本没派兵,却把乌克兰战场搬回了太平洋

浯江孤舟
2026-08-17 13:05:37
电影《牛来》票房破亿,是最响亮的耳光,扇那些这么多年用金箔包屎欺骗观众的人

电影《牛来》票房破亿,是最响亮的耳光,扇那些这么多年用金箔包屎欺骗观众的人

山股长
2026-08-17 13:48:55
郭德纲风波再升级,海外巨额财产被扒,曹云金和师娘特殊关系曝光

郭德纲风波再升级,海外巨额财产被扒,曹云金和师娘特殊关系曝光

荣亭小吏
2026-08-16 07:15:28
权恩妃8月17日土耳其透视装杀疯!不是Waterbomb却更火,1组照片让全球粉丝沸腾

权恩妃8月17日土耳其透视装杀疯!不是Waterbomb却更火,1组照片让全球粉丝沸腾

时光慢旅人
2026-08-18 01:10:13
历史的轮回:“西边的太阳快要落山了”与“紫禁城中静悄悄”

历史的轮回:“西边的太阳快要落山了”与“紫禁城中静悄悄”

读鬼笔记
2026-08-17 13:29:02
制止家暴反被判故意伤害?当事人:只求一个公道

制止家暴反被判故意伤害?当事人:只求一个公道

看看新闻Knews
2026-08-17 17:21:14
刚坐完C919,实话实说:和波音、空客的差距,根本不是你想的那样

刚坐完C919,实话实说:和波音、空客的差距,根本不是你想的那样

李博世财经
2026-08-17 10:19:10
四川大哥践诺“照看老屋”留守深山 25年后房主回乡卖房发现他还在丨看见正能量

四川大哥践诺“照看老屋”留守深山 25年后房主回乡卖房发现他还在丨看见正能量

封面新闻
2026-08-17 20:30:31
国家队又开始撤退了

国家队又开始撤退了

谭谈投研
2026-08-17 22:16:44
终于倒闭了?中国曾经最“暴利”行业,嚣张20年后彻底被时代抛弃

终于倒闭了?中国曾经最“暴利”行业,嚣张20年后彻底被时代抛弃

傲傲讲历史
2026-08-17 11:06:25
建议对《牛来》立案调查!

建议对《牛来》立案调查!

燕梳楼频道
2026-08-17 13:19:11
妻子的闺蜜做了我12年情人,直到我42岁那年,才看懂她的算计

妻子的闺蜜做了我12年情人,直到我42岁那年,才看懂她的算计

千秋文化
2026-08-17 19:33:49
演员海顿潘妮蒂尔去世,年仅36岁

演员海顿潘妮蒂尔去世,年仅36岁

韩小娱
2026-08-17 15:56:07
母女离散6个月未破案,警长直言警方犯下大失误:现场次日即归还家属

母女离散6个月未破案,警长直言警方犯下大失误:现场次日即归还家属

娱圈观察员
2026-08-17 01:15:13
“杭州商务酒局事件”持续发酵!招商高管被免职,副区长简历从官网“消失”

“杭州商务酒局事件”持续发酵!招商高管被免职,副区长简历从官网“消失”

听心堂
2026-08-17 22:07:58
私家车年检迎重大调整!6-15年车主别搞错,免得白跑一趟

私家车年检迎重大调整!6-15年车主别搞错,免得白跑一趟

侃故事的阿庆
2026-08-16 10:42:01
郝蕾首度公开自己患重度抑郁经历:我不会原谅伤害我的人

郝蕾首度公开自己患重度抑郁经历:我不会原谅伤害我的人

观星赏月
2026-08-17 03:23:48
17岁女孩搭乘顺风车遇惊魂一刻:驾驶员在高速服务区独自离车后“失联”,她被锁在暴晒的车内,情绪濒临崩溃,幸好……

17岁女孩搭乘顺风车遇惊魂一刻:驾驶员在高速服务区独自离车后“失联”,她被锁在暴晒的车内,情绪濒临崩溃,幸好……

都市快报橙柿互动
2026-08-17 13:29:34
鼓励告密的人你也有今天啊

鼓励告密的人你也有今天啊

聂作平的黑纸白字
2026-08-16 16:51:28
中俄关系再度发生变化,俄罗斯外交部曾多次表示:

中俄关系再度发生变化,俄罗斯外交部曾多次表示:

迷彩人生
2026-08-13 08:45:25
2026-08-18 02:40:49
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4452497文章数 9312关注度
往期回顾 全部

艺术要闻

震惊!哈里森镜头下的女人,美到全网疯传:这根本不是照片,是梦!

头条要闻

因老板娘一句随口交代 打工走失男子独守深山老宅25年

头条要闻

因老板娘一句随口交代 打工走失男子独守深山老宅25年

体育要闻

C罗:可能是生涯最后一年 未来都规划好了

娱乐要闻

立案风波席卷德云社多场巡演叫停!

财经要闻

爱丽家居跨界玩存储:溢价背后藏着机密案

科技要闻

马斯克600亿美元买条近路

汽车要闻

2027款艾瑞泽8 PRO 年轻人的务实之选

态度原创

教育
艺术
家居
健康
公开课

教育要闻

中国正在崛起的4个专业,将来不愁就业,今年考上的赚大了!

艺术要闻

震惊!哈里森镜头下的女人,美到全网疯传:这根本不是照片,是梦!

家居要闻

2026建博会(广州) 公装联探展交流活动

专家解答青少年脊柱侧弯七大问题

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版