网易首页 > 网易科技 > 网易科技 > 正文

全球AI视频模型“四强”会师,为什么“理解世界”变得更加重要?

0
分享至
出品 | 《态度》栏目 
作者 | 纪川 
编辑 | 定西
一年前,中国视频模型在国际权威模型评测竞技场上还只是零星出现。到2026年9月,字节Seedance2.0/2.5、MiniMax H3、阿里Wan 3.0和智象HiDream-O1-Video-1.0(下文简称HiDream V1)已相继进入全球视频生成模型头部方阵。三个月内,四款模型密集上新,意味着中国力量正从单点突围转向集群式上行。
但进入同一梯队,并不意味着走的是同一条路。当画质、时长和人物一致性逐渐成为基础能力,竞争焦点开始从“生成得像不像”转向“是否理解真实世界”。有人押注效率,有人依托规模与生态;智象选择的切口,则是更懂物理规律与事件逻辑。HiDream V1由此成为观察其“原生全模态世界模型”路线的一扇窗口。
1、四支力量,三种路线,同一个梯队
沿着各自的技术路线向下看,四家公司呈现出不同的资源禀赋与竞争逻辑。
字节Seedance背靠大厂完整的算力、工程和产品体系;MiniMax H3依托大模型基座与用户积累,向多模态持续延伸;阿里Wan 3.0则嵌入通义、阿里云等构成的技术生态。智象走的是另一条路:作为AI创业公司,它没有大厂的资源和入口优势,选择押注“原生全模态世界模型架构”,推动图像、视频、3D交互与具身智能在统一底座上演进。HiDream V1补上的,正是其中关于“时间与变化”的关键一环。
不同背景、不同路线的团队同时进入国际主流榜单头部,意味着中国视频模型正在从单点突围转向集群竞争。其优势不只是玩家更多,更在于大厂、AI独角兽等玩家从不同方向探索技术边界,降低了产业对单一路线的依赖。
这也引出一个问题:当市场已有多款高画质、长时长且成本不断下降的视频模型,为什么还需要HiDream V1?
答案不在于“多一个模型”,而在于“多一条路”。当前视频生成仍面临一个核心难题:模型可以把每一帧画得足够逼真,却未必理解事件应该如何发生。例如物体运动是否符合物理规律、动作与声音能否准确同步、前后事件是否具有因果关系。这些问题无法仅靠提升分辨率和延长时长解决。
HiDream V1试图把竞争向前推进一步:在生成之前强化对动作持续时间、物体关系、事件逻辑和音画对应的理解,让视频模型从“会生成”走向“懂世界”。这并非对其他技术路线的替代,而是一种补充:当画质、时长和效率逐渐成为基础能力,对真实世界的理解将成为新的分水岭。中国视频模型的集群优势,恰恰在于多条路线能够同时向前探索。
2、双榜前列,HiDream V1进入全球头部阵营
HiDream V1的首次亮相,先被放进了全球视频模型竞争的公开坐标系。
发布同期,在 Artificial Analysis Image to Video Leaderboard(With Audio)榜单中,HiDream V1位列全球第4;Arena.ai Image-to-Video 榜单暂列第8。
值得注意的不只是智象一家。同一张榜单上,MiniMax H3、字节 Seedance 也都在头部区间——中国名字密集出现在国际视频模型排行里,这本身就是一种产业信号。
榜单不是全部,但它提供了一个外部参照:HiDream V1已经进入全球头部视频模型的同场比较,而中国视频模型作为一个整体,正在这张榜单上形成存在感。
回到产品本身。HiDream V1支持文本、图片、视频等多种模态输入,可生成5至20秒1080p高保真视频,在意图理解、物理规律、动态时长、叙事连贯性、人物一致性和音画同步上完成系统优化。它是智象首个原生全模态视频生成模型。
更值得看的,是 HiDream V1的竞争力并非来自某一个单点能力。画面高保真只是基础,真正拉开差距的,是它试图把意图理解、物理规律、时长规划和音画同步放进同一条生成链路里。换句话说,HiDream V1要让视频里的事件更合理。
智象未来技术合伙人、算法科学家潘滢炜博士告诉网易科技,智象希望做的是"带脑子的、更智能的模型",不是简单把提示词和图片丢进去,让画面动一动。这解释了为什么智象会把视频模型能力的竞争,放到"智能水平"的维度上,而非单纯追逐生成效果。
3、真正拉开差距的,是demo里的细节
物理规律,是整个视频模型行业最难啃的骨头,不只是智象的挑战。
当前不少视频模型已经能生成相当精致的画面,也能按照指令做简单动作。但一旦进入更复杂的物理场景,违和感就会出现:柔性物体不按受力方向运动,物体凭空出现或消失,碰撞反馈不自然,动作完成后镜头仍被强行拉长。这些问题在四家头部模型身上都不同程度存在,区别只在于谁犯得更少。
接下来,从几个看似日常、却很能暴露模型短板的任务,看 HiDream V1的完成效果。
首先是推倒多米诺骨牌。
这个画面考验的不是“骨牌倒下”这一个动作,而是一整条因果链能不能成立。每一块骨牌都必须先接触下一块,下一块才能倒下,同时还要配合清晰的点击声。
实测下,部分模型会在中途断掉,或出现骨牌还没发生接触就自行倒下的情况。HiDream V1的处理更接近真实连锁反应:第一块被推倒后,碰撞一块块传递,骨牌数量、倒下顺序和拐角处的运动关系都保持得更稳定。
同时,对“时长”的理解在这里也很关键。多米诺的时间不是被硬塞进一个固定窗口,而是由事件自己决定:第一块何时倒下,第二块何时被碰到,声音何时出现,都要跟碰撞节奏一致。HiDream V1在这里做的,是让镜头时长服从内容本身。

多米1 (来源:态℃)

多米2 (来源:态℃)

多米3 (来源:态℃)

图注:此视频为HiDream V1生成
提示词:Live-action low angle, one take. The fingertip taps the first domino, and the twelve dominoes fall in order around the right-angle corner, ending beside the blue mug. Each tile must contact the next before it falls; keep exactly twelve alternating red and ivory tiles, the mug upright, and no jump cuts. Add twelve distinct clicks with correct timing.
再看,高速赛车。
这个任务同时考验画面高保真、指令遵循、运动方向和音画同步。赛车高速掠过镜头时,模型要维持车身结构稳定,不能在运动中变形;声音也不能只是一段泛泛的引擎噪音,而要随着车辆接近、掠过和远离发生变化。
实测下,部分模型会出现车身形态漂移,甚至尾部突然变成车头的情况。HiDream V1的赛车主体保持得更稳定,运动方向清晰,引擎声也随车辆位置变化产生了更自然的音调落差。
效果的实现主要源于背后的架构。HiDream V1采用文本、视频和音频信号联合建模,而不是先生成画面、再后期配音。潘滢炜说,音画同步和原生全模态“天然耦合”,相比割裂生成,联合建模的对齐程度会更高,感知上也更自然。 
也就是说,HiDream V1生成的不是一段带声音的视频,而是一段声音和画面共同成立的运动事件。

赛车1 (来源:态℃)

赛车2 (来源:态℃)

赛车3 (来源:态℃)

图注:此视频为HiDream V1生成
提示词:一辆高速赛车以极快的速度从镜头前由左向右疾驰而过。音频:引擎声必须表现出逼真的多普勒效应,从极高音调开始,在经过镜头的瞬间音调显著下降。
最后看线稿上色。
这个任务考验的是模型能不能真正听懂复杂指令。它不只是生成一张漂亮插画,而是要理解顺序、边界和接触关系:先后顺序不能乱,颜色不能提前出现,画笔没碰到的地方不能自己变色,原有线稿结构也要保持稳定。 
实测下,部分模型会出现上色突变、颜色溢出,或者没有严格按照指令推进。HiDream V1的画面更稳定:颜色跟随画笔移动,线稿边界保持清晰,最终形成的是同一张图从黑白线稿到彩色插画的连续变化。
这也是“懂意图”的另一种体现。难点不在画得像,而在听得懂。模型需要把一句复杂提示词拆成可执行的动作序列,再在连续生成中保持一致。

线稿1 (来源:态℃)

线稿2 (来源:态℃)

线稿3 (来源:态℃)

图注:此视频为HiDream V1生成

提示词:Top-down live-action art process, one continuous take. A blue brush gradually fills the line drawing: first the green tree, then red bicycle, yellow sun and blue windows, leaving black contours crisp. Color follows brush contact and never spills outside the drawn shapes; by the end the same drawing is a coherent colored illustration. Show wet paint texture and brush sounds, no morphing or new objects.
此外,网易科技还测试了几组更贴近日常物理世界的场景,包括冰块掉入水中、倒水、纸张折叠等。实测结果显示,HiDream V1在这些场景里也能较好维持物体状态和动作连续性。
把这些实测放在一起看,HiDream V1把一条能力链清晰地展示了出来:从物理因果,到动作时长,到音画因果,再到复杂指令理解和过程控制,模型正在把视频生成从画面能力推向状态推演能力。
4、为什么它能做到:理解、生成、对齐
这背后,不是给视频模型多喂一些物理数据这么简单,也不是在生成后再做规则修补。
智象技术合伙人潘滢炜博士告诉网易科技,HiDream V1的技术路径可以拆成三步:先理解,再生成,再对齐。
图注:HiDream V1技术路径示意——理解→生成→对齐
第一步,是在生成前先做理解。
过去很多视频模型更像是"把图动起来":用户给一张图、一句话,模型直接进入生成。但 HiDream V1会先通过多模态理解模块,对输入图片和文本进行结构化拆解,判断画面中的场景、主体、动作、物理关系、镜头时长、运镜方式以及声音设计。
这一步的意义在于,模型会先把用户意图翻译成更适合视频生成的内部规划。比如苹果抛接,它要先理解这是一个短促动作;乒乓球弹跳,它要先理解弹跳高度、频率和撞击声之间存在物理关联;穿针引线,它要先判断红线、手指、针眼之间的受力关系。
第二步,是把这些理解结果灌进原生全模态生成过程。
潘滢炜提到,物理规律不能只停留在"知道"层面,还要变成跟视觉内容匹配的信号。"你重力落下来,几秒钟之后会在什么地方,这些精准的、跟视觉内容匹配的信号,是要给到模型里的。"
HiDream V1的关键,正是在生成过程中纳入物理规律、动作节奏和音画关系,让画面、动作、声音和时间彼此约束。
第三步,是用后训练进一步对齐合理性。
在预训练之后,智象还会用 Reward 机制强化物理规律、音画同步和整体观感。潘滢炜将其类比为一种 human preference:哪些结果更符合重力、碰撞、光影、空间连续,哪些结果看起来违和,模型会从这种强弱对比中继续学习。
这也是 HiDream V1的能力可以跨越多个场景的原因。穿针测试里,它要处理柔性物体的受力形变;苹果测试里,它要判断事件应该持续多久;乒乓球测试里,它要同时对齐画面运动和声音反馈。这几件事表面上不同,底层都指向同一个能力:模型开始推演一个事件如何发生。
更进一步,这套机制之所以能成立,也和智象的原生全模态底座有关。
5、一个UiT底座,四大模型同源演进
HiDream V1并不是一个孤立的视频模型。它和 HiDream-O1-Image、HiDream-O1-World、HiDream-O1-Embodied 同源,都是从 O1原生全模态架构上长出来的不同任务形态。视频模型多了音频和时序信号,因此更重、更难,但也正因为它接入同一个底座,文本、图像、视频、音频之间才能在同一生成过程中互相约束,而不是各做各的。
所以,HiDream V1能做出这些效果,不只是因为视频能力增强了,而是因为智象试图把"理解世界、表达世界、反馈世界"放进同一套模型逻辑里。

智象在视频生成领域有着深厚技术积累。2024年1月率先实现超15秒视频生成技术突破,同年7月推出全球首个商用DiT大模型HiDream 2.0,12月发布采用扩散自回归架构的HiDream 3.0,持续推动视频模型从生成能力向深层理解演进。今天发布的HiDream-01-Video-1.0,则实现了在面向世界模型方向的新一代UiT 架构上的再次升级。

图注:智象未来视频模型发展历程

潘滢炜用了一个更形象的比喻:O1-Image、O1-World、O1-Embodied 和 O1-Video,是"一个架构上面长出来的几朵不同的花"。它们的基础架构通用,只是不同任务灌入的数据、后训练方式、条件设计不同。视频任务因为多了音频和时序信息,也更重、更消耗算力。
这与行业里其他几条路线形成了有趣对照。
字节 Seedance 和 MiniMax H3走的是"先把视频生成做强"的路线,在单点任务上建立优势,再向多模态外扩。阿里 Wan 3.0依托通义体系,把视频模型嵌入大模型+云服务的整体方案。这些路径都很重要,本质上是从一个任务向外延展。
智象的选择不同:先押注原生全模态 UiT 底座,再让图像、视频、世界模型和具身模型在同一架构下同源演进。
潘滢炜说,这不是"做完A再做B,做完B再做C"的串行关系。原生全模态架构出来后,多个任务是并行推进的,只是视频模型更重,所以发布节奏更慢。
这条路线的代价是,单看一个任务,投入更大、周期可能更长;但好处也很清楚:一旦底座打好,不同模型之间可以互相促进,后续能力迭代会更快。
"对一个人来说,认识世界就是听觉、视觉,包括触觉等等一体的。"潘滢炜说。越接近 AGI 时代的世界模型,模态越齐、对齐程度越高,天花板也会越高。
6、视频之后,世界模型闭环初现
从这个角度看,HiDream V1的节点意义非常清晰。
单看模型本身,HiDream V1是智象未来多年视频模型积累在新一代 UiT 底座上的升级;放在HiDream O1系列中,它连接的则是静态图像、动态视频、空间交互与现实行动,使智象“一个原生全模态底座、四大模型同源演进”的技术版图初步闭环。
按照智象的规划,图像模型负责静态表达,视频模型处理时间与运动,交互式世界模型理解空间及交互,具身世界模型进一步将行动与真实反馈纳入体系。四类模型并非彼此割裂,而是在统一底层架构上共享和迁移能力。相比单点推进视频生成,这一路线的核心价值不在于模型数量,而在于不同模态能否相互增强:图像沉淀视觉表征,视频引入时间与物理变化,世界模型和具身智能再将这些能力推向空间理解与现实行动。
但闭环初现,不等于世界模型已经成熟。正如潘博士所言,目前没有任何模型能够完全解决物理规律问题,复杂因果推理、长时一致性、可控交互与算力成本,仍是全行业共同面对的难题。HiDream V1的真正意义,是把竞争向前推进了一步:视频模型比拼的不再只是画质、时长和价格,还包括对运动、因果与真实世界规则的理解。
这也是中国视频模型集群竞争的下一站。字节、MiniMax、阿里和智象依托不同资源、选择不同路径,却都在从“生成画面”走向“理解世界”。其中,智象提供了一种底层模型架构创新先行的路线样本:视频模型不是孤立的一环,而是通向世界模型的关键接口。
过去,视频生成模型证明了AI可以生成足够逼真的画面;接下来,它们需要证明自己理解画面为何如此发生。HiDream V1补上的不仅是智象原生全模态世界模型版图中的视频一环,更是从“生成世界”迈向“构建世界”的关键一步。
目前,HiDream-O1-Video-1.0已开放内测申请。感兴趣的读者可以扫描下方二维码,申请测试模型能力。
相关推荐
热点推荐
惠州特大涉黑|2018富商伪装企业家称霸一方,泼硫酸报复法官

惠州特大涉黑|2018富商伪装企业家称霸一方,泼硫酸报复法官

黑哥讲现代史
2026-09-21 11:06:19
2-1!火爆马德里德比!马竞战胜皇马,升至西甲第2,穆帅陷入危机

2-1!火爆马德里德比!马竞战胜皇马,升至西甲第2,穆帅陷入危机

简简单单的说
2026-09-21 12:59:34
赫伊森吃红点套餐酿苦果,10人皇马1-2马竞,无缘3连胜+跌至第三

赫伊森吃红点套餐酿苦果,10人皇马1-2马竞,无缘3连胜+跌至第三

侧身凌空斩
2026-09-21 00:17:06
我主刀16年被降职,上头指名要我手术,我:已辞职,院长懵了

我主刀16年被降职,上头指名要我手术,我:已辞职,院长懵了

青青会讲故事
2025-06-30 16:11:45
今日!CCTV5直播亚运会+中国女篮,5+转中国女排,CCTV16中国女足,网络转AC米兰等

今日!CCTV5直播亚运会+中国女篮,5+转中国女排,CCTV16中国女足,网络转AC米兰等

晚池
2026-09-21 01:10:03
广东顺德一纺织公司厂房火灾事故,造成8人死亡,1人受伤

广东顺德一纺织公司厂房火灾事故,造成8人死亡,1人受伤

潇湘晨报
2026-09-21 12:02:35
曹云金64万罚单夜模仿郭德纲上热搜:离开德云社16年,为何绕不开

曹云金64万罚单夜模仿郭德纲上热搜:离开德云社16年,为何绕不开

小椰的奶奶
2026-09-21 13:34:13
普京呼吁选民踊跃投票,俄杜马选举被认为“几无悬念”

普京呼吁选民踊跃投票,俄杜马选举被认为“几无悬念”

环球时报国际
2026-09-21 08:40:06
离谱啊!千元班费私自买月饼送老师被拒收,临时改成班级点心,家长群炸锅

离谱啊!千元班费私自买月饼送老师被拒收,临时改成班级点心,家长群炸锅

火山詩话
2026-09-19 12:15:23
官方标准:事关摩托车,10月1日起实施!解禁摩,取消13年强制报废也快点吧

官方标准:事关摩托车,10月1日起实施!解禁摩,取消13年强制报废也快点吧

周哥一影视
2026-09-20 04:18:43
中秋国庆售票期12306拒出票133万张 铁路购票公平机制逐步筑牢

中秋国庆售票期12306拒出票133万张 铁路购票公平机制逐步筑牢

中国经营报
2026-09-20 13:22:27
张本美和没想到,亚运会才刚开幕,石川佳纯先给她泼了盆“冷水”

张本美和没想到,亚运会才刚开幕,石川佳纯先给她泼了盆“冷水”

寻墨阁
2026-09-20 12:24:32
中国男篮被淘汰第二天,最新主教练曝光,打爆日本韩国,真的稳了

中国男篮被淘汰第二天,最新主教练曝光,打爆日本韩国,真的稳了

宗介说体育
2026-09-21 09:21:53
蔡澜说,刘銮雄追女明星,都是先送3000万,这样90%港姐可以拿下

蔡澜说,刘銮雄追女明星,都是先送3000万,这样90%港姐可以拿下

晓銊就是我
2026-09-07 12:39:23
若不出意外,2027年中国或将迎来3大降价潮,先别急着买!

若不出意外,2027年中国或将迎来3大降价潮,先别急着买!

阿离家居
2026-09-21 11:05:28
两岁男童坠亡后续:爸当晚放了,妈要打官司,爷爷竟在葬礼上大笑

两岁男童坠亡后续:爸当晚放了,妈要打官司,爷爷竟在葬礼上大笑

皮蛋儿电影
2026-09-20 18:05:03
舆论反转!31岁医学美女博士裸辞三甲医院,送外卖,网友:外卖是给学历不高群体谋生活,已经很卷了,有更好工作的人不要瞎掺和

舆论反转!31岁医学美女博士裸辞三甲医院,送外卖,网友:外卖是给学历不高群体谋生活,已经很卷了,有更好工作的人不要瞎掺和

火山詩话
2026-09-19 08:45:03
1270万毕业生,房子卖不动:2026年下半年,普通家庭要面对的四道坎

1270万毕业生,房子卖不动:2026年下半年,普通家庭要面对的四道坎

东亚财评V
2026-09-20 19:04:59
太快了,特斯拉最新款 Model Y 新车开始交付

太快了,特斯拉最新款 Model Y 新车开始交付

XCiOS俱乐部
2026-09-20 19:55:31
一针见血!俄知名导演公开信戳破俄乌战争真相:根本没法收手

一针见血!俄知名导演公开信戳破俄乌战争真相:根本没法收手

老马拉车莫少装
2026-09-13 21:07:52
2026-09-21 14:15:00

科技要闻

吃AI红利的凡人,年薪10万美元,每天3万步

头条要闻

男子补路拉绳警示致农妇遭勒颈身亡 双方达成赔偿和解

头条要闻

男子补路拉绳警示致农妇遭勒颈身亡 双方达成赔偿和解

体育要闻

爵士建仓阶段已经完成?

娱乐要闻

76岁站上红馆开唱,谭咏麟说回馈歌迷

财经要闻

机器人IPO门槛收紧?能否商业闭环成考量

汽车要闻

7年70万辆 新红旗HS5焕新升级,这次变在哪?

态度原创

时尚
游戏
家居
手机
亲子

初秋衬衫别总穿白色,看看这几款牛仔衬衫,减龄百搭又时尚

IGN10分《火纹》新作全剧情需120h!全收集会更多

家居要闻

2026建博会(广州) 公装联探展交流活动

手机要闻

小米18 Pro系列硬件级防窥屏揭秘!双像素方案 开启后画质依旧清晰

亲子要闻

没有特效药!钟南山最新提醒

无障碍浏览 进入关怀版
×