![]()
作者 | Judy
来源 | IT桔子
8月17日,IT桔子获悉智象未来(HiDream.ai)正式发布HiDream-O1-World,定位「全球首款原生全模态交互式世界模型」。
在C轮15亿融资刚落地、近三个月三轮累计超21亿、独角兽身份刚确立的时间节点上,智象未来选择用一个全新的产品形态来定义自己的下一阶段。
![]()
一、看得见的「世界模型」
我们最近谈了很多次世界模型,但这个概念对大多数人来说仍旧是模糊的、不可触碰的。
智象未来这次发布的HiDream-O1-World,让我们直接能体验、感受「世界模型」。
HiDream-O1-World提供三种模式:漫游模式、导演模式、交互模式,分别对应不同层次的用户需求和使用场景。
漫游模式解决的是「进入一个世界之后能做什么」的问题。用户可以在生成的场景内自由探索,同时主导叙事走向、实时操控动态变化。产品提供了多视角漫游体验,用户可通过屏幕左下角的移动按钮自由驱动角色行走。
在第一人称视角下,转头、环顾、仰视、俯察的响应灵敏顺滑,画面稳定无漂移——这是交互式世界模型区别于传统全景视频的核心指标:如果转头时画面有延迟或割裂感,沉浸感会瞬间崩塌。
导演模式把交互颗粒度进一步细化。用户可对画面进行实时编辑:驱动角色完成抓取、奔跑、下蹲、跳跃等动作,或调度环境变化,如触发降雨、物体坠落等动态事件。这并非简单的局部微调,而是基于几何、光照、材质到物理逻辑的全局统一,确保每一次交互都真实自洽。
每一次动作转换都建立在真实物理模拟之上。模型支持单次最长3分钟的连续生成,且音视频同步。
这里有一个隐含的技术难度:每个动作指令都要求模型在生成画面时同时考虑物理合理性(角色下蹲后重心变化对后续动作的影响)、视觉一致性(角色外观在动作转换中不能跳变)以及音频匹配(脚步声、环境音与动作同步),导演模式试图把这些复杂度封装在流畅体验之下。
交互模式在维度上做横向扩展:多视角(第一/第三人称沉浸探索)、多风格(写实城市街景、自然地貌到幻想异世界、二次元卡通、3A游戏渲染)、多主体(人类、动物、虚构角色),模型让不同形态的角色按各自「应有」的运动规律与环境自然呼应——无论是街头漫步的行人、空中盘旋的飞鸟还是幻想中的异兽。
三种模式合在一起,HiDream-O1-World的产品轮廓清晰:不再是Sora式的「生成一段更好的视频」,而是构建一个用户可以进入、操控、持续交互的虚拟世界——「画面运动不再依赖像素统计,而是贴近现实世界的因果逻辑」。
![]()
二、从多模态到世界模型:
战略路线兑现
成立于 2023年的智象未来,它的的技术演进有一条清晰时间线:2023年以60亿参数视觉多模态模型起步→2024年推进DiT架构商用→2025年HiDream-I1登顶Artificial Analysis图像竞技场(首个登顶的中国自研模型),同年开源HiDream-E1.1→2026年4月推出千亿参数世界模型架构HiDream-O1-Image(六项基准SOTA),5月开源版登顶AA文生图榜单全球第一,同月发布超两千亿参数的O1-Image-Pro→8月O1-World发布。
近三年时间,智象在模型能力上已从原先的多模态大模型向原生全模态世界模型迭代。
支撑这条路线演进的是其自研的原生全模态UiT(Unified Transformer)架构。
传统多模态模型通常采用拼接式方案,各模态编码器独立运行后再融合;UiT摒弃VAE和独立文本编码器,将图像像素、文本Token、视频体素及音频、动作、空间关系等原始信号统一映射进同一个共享Token空间,由同一套Transformer完成理解、生成和推理。
当模型需要从「生成图像/视频」跨越到「构建可交互世界」时,统一表征在模态协同效率上比拼接架构更有优势——交互要求模型在多种模态间实时切换和协同,拼接架构的延迟和信息损耗会更明显。
智象未来创始人梅涛院士的判断是:真正的世界模型必须同时具备表达世界、推演世界、构造世界的能力——从「model the world」到「mold the world」。
HiDream-O1-World的发布,标志着智象从「多模态生成公司」正式跨入「世界模型」阶段,这是公司既定战略路线的关键一步兑现。
![]()
三、竞争坐标:
世界模型赛道谁在跑,智象站在哪?
产品叙事需要评测数据锚定。
美团LongCat×复旦大学联合发布WBench——这是行业首个交互式世界模型权威评测基准,它的22项细分指标与人类真实体验高度匹配。
HiDream-O1-World的首秀成绩单值得一看:
![]()
●物理维度73.3分:这个指标评估模型对重力、碰撞、流体、刚体动力学等物理规律的理解和再现能力,HiDream-O1-World直接超过腾讯混元1.5和阿里「快乐生蚝」。
●一致性维度88.0分:这里衡量长时程生成中画面、角色、空间的稳定性——长时场景记忆、空间结构留存、跨帧逻辑稳定,实现世界可持续演化。
●Navi分榜登顶:HiDream-O1-World首次参评即拿下空间导航与视角控制的核心标尺。
这组数据勾勒出HiDream-O1-World的差异化标签:物理一致性——不是单纯的渲染画面,而是让模型去「理解」物理规律。
这背后的两套核心机制是:一,Memory+TTT双机制解决长时程时空一致性,这要求Memory 3D先验记忆注入实现「人走世界不刷新、回头场景不重构」,TTT推理在线自适应让每次交互实时贴合3D几何约束;二,数据+架构双轮驱动实现物理一致性,这要求训练层用刚体碰撞、流体流动、柔性形变等物理难例数据驱动,推理层用TTT在线物理适配。
HiDream-O1-World核心技术论文已被ECCV收录,通过了学术同行评审验证。
从更大的竞争图景看,世界模型赛道正出现路线分化:
大语言模型路线:以文本推演世界规律,推理强但视觉精确度不足;
视觉生成路线:画面质量高但物理规律理解有距离;
具身智能VLA路线:物理交互最直接但数据采集成本高;
以及智象选择的原生全模态路线:从底层架构统一多模态能力,协同效率高但全模态同时做好的难度大。
四条路径优劣未定,HiDream-O1-World至少在交互式世界模型这个具体赛道上给出了阶段性坐标。
![]()
四、世界模型的产业图景:
国内外玩家、趋势与市场机会
从全球格局来看,海外的Google DeepMind的Genie系列最早验证了从单张图片生成可交互3D环境的可能性,但更偏学术研究,尚未形成产品化闭环;NVIDIA的Cosmos定位世界基础模型平台,主攻自动驾驶和机器人的仿真训练,走的是基础设施路线。国内方面,腾讯混元侧重长视频生成中的物理一致性,阿里「快乐生蚝」聚焦3D场景理解与生成,美团LongCat则从评测基准切入、同时推进自有世界模型研发。
可以看到,各家路线差异明显。有的从仿真训练入手,有的从内容生成切入,有的先建标准再推产品。智象的选择是原生全模态架构,从底层统一多模态能力,直接瞄准「可交互世界」的产品形态——在赛道整体仍处于早期的阶段,各家都在抢占路线定义权。
不过,HiDream-O1-World的发布验证了世界模型正从「技术验证」走向「生产验证」,交互式世界模型成为新焦点。
HiDream-O1-World强调的物理一致性和时空一致性,本质上就是在回应生产层面的要求——虚拟环境够不够稳定、够不够真实、能不能在实际场景中持续运行。
从「生成内容」到「生成可交互世界」,应用边界正在快速扩展。
那么,世界模型的可用商业场景又是什么?
目前来看,业界普遍有所期待的三个方向有互动影视/游戏、具身智能仿真场景、以及 3D 生产场景等。
其中的一些领域已有可量化的市场规模。互动影游的市场规模测算2025年全球136亿元→2032年359.7亿元(CAGR 15.1%),是O1-World最直接的内容消费场景;具身智能仿真,2025年全球数据市场2.42亿美元(+181.4%)世界模型提供高保真仿真训练环境,将大幅压缩硬件与实地试验投入;而全球物理AI市场,预测则是数万亿美元级别的超级市场。
据报道,智象未来在生态侧已展开前瞻性布局。除了与诺亦腾机器人合作获取具身智能训练数据(计划年内积累数万小时),以及与百图生科合作探索微观世界模型在药物发现中的应用外,智象未来很快还将密集释出更多生态层面的新动作,持续扩大其技术落地版图。世界模型仍处早期,但商业化落地方向逐渐清晰,先发者有望在数据飞轮和生态绑定上建立壁垒。
![]()
五、融资节奏与资本逻辑
智象未来在近三个月就融资三轮,累计超21亿元。
最新的C轮15亿元融资由社保基金四川振兴科创基金、工银资本、弘颐资管、敦鸿资本联合领投,上影新视野基金、华策影视、湖北长江产投、余杭金控、交银资本、厦门国贸资本等跟投,合肥产投、东方富海、金浦投资等老股东持续加注。
产业资本(上影、华策)的进入直接指向互动影游方向的商业化协同。
随着HiDream-O1-World发布,智象的估值叙事已从多模态生成式AI向「世界模型」快速靠近——前者对应内容生产工具的市场空间,后者指向虚拟世界构建、具身智能仿真等更大的天花板。
21亿融资不止打开了一个产品发布窗口,更是一个赛道的身位。
![]()
欢迎读者报名参与活动,与IT桔子在线下见面
此外该活动嘉宾持续招募中,欢迎 A 轮及之后的具身智能公司接洽
联系人:杜月 ( 微信号 moon_du)
* 加好友请备注
微信又双改版了,如果不标星,容易错过我们的推送,也无法看到封面图片。还请点击星标,及时接收每篇新鲜出炉的推文,我们期待与你的每一次见面。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.