编辑|陈陈
过去三年,AI 内容生成行业经历了几轮密集的技术迭代。从文生图到文生视频,从几秒的短片到分钟级的长视频,每一轮升级都让生成内容的质量和时长向前推进一步。
但仔细观察就会发现,这些进步在本质上属于同一个范式:用户提供提示词,模型输出内容,然后用户观看这段内容。两者之间始终是单向的。
这个范式有一个根本局限,它生产的是内容,不是世界。无论生成的视频多么逼真,用户始终是旁观者,无法真正进入、改变、或持续影响那个画面里的空间。
业界也意识到了这一点,世界模型的概念开始频繁出现在各大 AI 实验室的技术报告和产品发布中,谷歌、World Labs 等都在这一方向上投入了大量资源。但热闹背后,争议同样激烈:目前市面上的产品,究竟是在构造世界,还是只是在渲染画面?
就在刚刚,智象未来 HiDream.ai 给出了自己的答案:发布全球首款原生全模态交互式世界模型 HiDream-O1-World。
该模型基于自研原生全模态 UiT 架构,支持文本、图像、交互等多模态输入,可生成具备长时空一致性和物理一致性的动态世界。用户既能以第一、第三人称视角自由漫游,也能实时编辑角色和场景变化;从写实城市、自然地貌到二次元、幻想世界、3A 游戏风格,从人类、动物到虚构角色,都可以在同一套模型中生成和持续推演,让世界生成进一步走向可探索、可交互。
![]()
https://mp.weixin.qq.com/s/EVlUTW_d3fvrSUVVclSTkg
更值得注意的一项成绩来自第三方评测。
在美团 LongCat 与复旦大学联合推出的交互式世界模型评测基准 WBench 中,HiDream-O1-World 首次参评便登顶 Navi 分榜,超过腾讯混元 1.5、阿里 Happy Oyster 等模型。
HiDream-O1-World 在物理维度(Physical )得分 73.3,排名第一,一致性维度(Consistency) 得分 88.0,综合排名第一。
![]()
Physical 维度主要衡量生成结果的视觉物理合理性与因果正确性,例如物体碰撞、表面交互发生后,结果是否符合基本物理逻辑;Consistency 则考察场景记忆、空间结构和跨帧逻辑能否在持续生成中保持稳定。两项关键指标同时取得高分说明, HiDream-O1-World 在物理一致性与长时空一致性上已经建立起较强优势。
一个能逛、能控、还能持续生成的 AI 世界
而把这些分数放回真实生成效果里,感受会更加直观。
首先是漫游模式。
在该模式下,用户就像置身真实世界,在模型生成的场景中自由漫游。通过屏幕左下角的移动控件,即可驱动角色前进、转向或停留,并支持第一、第三人称视角自由切换,获得更沉浸的探索体验。
如下是 HiDream-O1-World 生成的雪山攀登视频。用户可以操控移动控件控制主体前进方向,并且随着人物不断向前,前方路径和周围环境会随位置变化实时更新;当人物沿原路返回时,此前生成的地形和场景仍能保持一致。整个过程更接近真实登山中的连续探索,视角切换自然,画面整体稳定,几乎没有明显卡顿或漂移。
![]()
https://mp.weixin.qq.com/s/EVlUTW_d3fvrSUVVclSTkg
更进一步,是编辑模式。
在这个模式下,用户可对画面进行实时编辑:驱动角色完成抓取、奔跑、下蹲、跳跃等动作,或调度环境变化,如触发降雨、物体坠落等动态事件。每一次动作转换、场景交互,都建立在真实的物理模拟之上,且都保持全局统一,音视频同步。
在下面这个骑行的场景中,输入提示词 “天气变化为雷雨天”,原本得晴天瞬间雷声大作,天色骤沉,雨点砸落,地面溅起水花。再输入提示词 “天气变化为太阳雨”,阴云渐次透亮,湿润的路面开始反射阳光。场景的变换不仅流畅,而且整个画面都在统一变化。
![]()
https://mp.weixin.qq.com/s/EVlUTW_d3fvrSUVVclSTkg
接下来是多风格、多主体、多场景。
在视觉风格上,HiDream-O1-World 支持高度写实的城市街景、自然地貌和室内空间,光影与材质的表现精细逼真;也支持幻想世界、二次元卡通、3A 游戏渲染等多元艺术风格。在角色类型上,人类、动物、虚构生物都在支持范围之内,每种角色的形态与运动节奏都能精准适配。
比如这座由 HiDream-O1-World 生成的教堂内部,石砌拱顶、立柱、木质书架与成排古籍共同构成了完整的空间结构,随着用户移动和视角变化,画面内容会实时更新,整体呈现出很强的材质质感和空间真实感。
![]()
https://mp.weixin.qq.com/s/EVlUTW_d3fvrSUVVclSTkg
当我们把这些示例放在一起看,HiDream-O1-World 展示出的核心能力已经比较清楚,具有较强的时空一致性以及物理一致性。
而要同时处理视觉、空间、动作、时间乃至物理关系,仅靠在传统视频生成模型上继续叠加控制模块,很难从根本上解决问题。智象未来选择把答案往更底层推进。
UiT:一个统一的架构
智象未来判断真正的智能,必须建立在对整个物理世界的统一理解之上,不是把多种模态拼接在一起,而是从一开始就将世界的规则内化到模型架构之中。
用智象未来创始人兼 CEO 梅涛的话来说,业内常说 model the world,但真正的世界模型更应该是mold the world。表达世界、推演世界、构造世界,三者缺一不可。
这个判断,催生了智象未来核心技术路线:自研原生全模态 UiT (Unified Transformer)架构。
传统的多模态系统,哪怕是目前能力很强的大模型,本质上依然是拼接逻辑:文本有文本编码器,图像有图像编码器(通常是 VAE),视频有视频处理模块,它们各自独立工作,再通过某种翻译层进行信息交换。这种设计的弊端在于模态之间的理解是间接的,跨模态的因果逻辑往往在翻译过程中丢失。
UiT 的做法完全不同,它摒弃了独立文本编码器,把图像像素、文本 Token、视频体素、音频、动作指令、空间坐标等所有原始信号,统一映射到同一个共享 Token 空间,让它们在同一套 Transformer 网络里交互、理解、生成。
这意味着,在 UiT 的视角下,看到一个苹果从树上落下和理解重力导致物体下落,不再是两个独立的认知过程,而是在同一个表征空间中完成的统一推理。模型不再只是在像素层面拟合苹果向下运动的画面,而是真正理解了这个运动背后的物理因果。
这一架构创新,是 HiDream-O1-World 能够在物理一致性和时空一致性上超越同类产品的根本原因。
两大行业难题:时空一致性、物理一致性被攻破
现有交互式世界模型大多依赖隐式时空表征,根据初始图像和相机轨迹直接生成新视角视频,一旦视角变化较大,就容易出现几何结构不合理、物体形变以及跨视角空间不一致等问题。
智象未来被 ECCV 2026 录用的相关研究,将原本隐含在视频生成过程中的几何结构单独提取出来,采用 Geometry-then-Appearance 两阶段框架,把几何生成和外观生成分开建模。
项目主页:
https://yanghb22-fdu.github.io/DreamWorld
![]()
DreamWorld 采用 Geometry-then-Appearance 的两阶段生成方式
第一阶段负责生成目标视角下的几何结构:模型先根据输入图像和用户指定的相机轨迹,将初始场景投影到新的观察视角,得到一组不完整的观测结果。由于新视角会暴露原图中从未出现过的区域,这些观测天然存在遮挡、空洞和结构缺失。团队随后借助预训练 3D Foundation Model 提取多尺度几何特征,再由 Geometry Video Diffusion Model 在几何特征空间中完成缺失结构的推理和补全,生成目标视角下更完整的几何表示。
第二阶段视频扩散模型生成:以第一阶段生成的几何表示作为结构条件,在 VAE 潜空间中进行条件去噪,并最终解码为视频帧。
这个设计的核心是几何 - 外观输出解耦。几何阶段主要关注结构完整、交叉视图一致性、相机轨迹的遵循。外观阶段则主要关注纹理、视觉细节、写实渲染,无需同时承担结构推理的重担。
![]()
直接以 warped partial images 作为条件时,生成结果容易受到结构缺失和投影 artifact 的影响;该研究则先在 geometry feature space 中完成结构推理,再进行 appearance synthesis,从而获得更加稳定的跨视角结果。
几何生成只是第一步,如何让模型在长时交互中记住这个几何结构,同样关键。
为此,HiDream-O1-World 采用了 3D 先验注入 Memory 上下文 + TTT,让生成出来的世界真正被记住。
- Memory 3D 先验记忆注入:Memory 负责给模型建立持续的空间记忆,保存场景中的几何拓扑、空间坐标以及物体之间的关联关系。模型需要记住这里原来有什么、它位于哪里,以及它与周围环境是什么关系。因此,即使用户离开当前区域再重新返回,场景也能够尽可能保持此前建立的空间状态,实现人走了,世界还在。
- Test-Time Training 推理在线自适应:推理阶段动态适配当前相机轨迹、场景结构,实时微调模型表征,让每一次交互、每一次视角切换都严格贴合 3D 几何约束,全程结构稳定、无畸变、无穿帮。
更进一步,模型还要确保画面符合物理规律,为此,智象未来从训练数据与推理机制两端同时入手。
- 在训练阶段,智象未来针对普通互联网视频中相对稀缺的物理难例进行强化,通过刚体碰撞、流体流动、柔性形变等场景,让模型反复学习物体状态变化与运动结果之间的对应关系。
- 推理阶段,借助 Test-Time Training 在线自适应机制,面对训练数据中没有完全覆盖的新场景、新材质,模型可以根据当前环境进行在线适配,保证任意交互下,运动轨迹、物体交互、场景演化符合现实因果逻辑。
世界生成之后,应用边界也会发生变化
如果交互式世界模型最后只用于做一个更自由的视频播放器,它的产业价值仍然有限。
真正有意思的部分,是世界一旦具备持续状态、物理一致性和实时交互能力,它就开始能够承接过去需要游戏引擎、3D 软件、仿真平台共同完成的一部分工作。
AI互动影游是最直接的一类应用。
传统影视内容在拍摄完成后,世界基本已经固定。互动影游虽然加入选择和分支,制作逻辑依然高度依赖提前设计好的剧情树和资产。生成式世界模型提供了另一种可能。
角色、环境与剧情都可以在运行中继续生成。观众可以停下来探索一个原本只是背景的街道,可以让人物改变行动,也可以进入编剧没有逐帧制作过的空间。影视内容由此获得更高的状态自由度。
游戏行业同样如此。
过去制作一个可以自由探索的 3D 世界,需要建模、贴图、绑定、动画、灯光、物理系统和关卡设计等漫长流程。世界模型如果能够根据一张图片或一段描述直接构造可探索环境,前期原型开发和内容生产方式都会发生明显变化。
更大的想象空间可能来自具身智能。
机器人需要的数据,天然带有视觉、动作、空间和物理反馈。真实采集的成本很高,而且场景覆盖极其有限;纯仿真可以无限生成,但视觉分布和真实世界之间又存在明显差距。
交互式世界模型恰好提供了一个中间解法,让高质量训练数据能够被规模化生成。
今年 3 月,智象未来与诺亦腾机器人达成战略合作,双方计划围绕高质量、规模化的具身智能视频数据展开深度合作:诺亦腾提供高精度人体动作捕捉数据作为种子,智象未来则利用自身毫米级可控的视频生成能力,对这些数据做规模化的精细放大与场景泛化,双方预计年内合作生成的具身智能视频数据将达到数万小时以上。这种模式的价值在于,既保留了真实动作数据的物理可靠性,又突破了传统人工采集在场景多样性和规模上的天然局限。
当世界可以被一键生成、自由交互,很多行业都开始被重新想象。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.