图注:此视频为HiDream V1生成提示词:Live-action low angle, one take. The fingertip taps the first domino, and the twelve dominoes fall in order around the right-angle corner, ending beside the blue mug. Each tile must contact the next before it falls; keep exactly twelve alternating red and ivory tiles, the mug upright, and no jump cuts. Add twelve distinct clicks with correct timing.再看,高速赛车。这个任务同时考验画面高保真、指令遵循、运动方向和音画同步。赛车高速掠过镜头时,模型要维持车身结构稳定,不能在运动中变形;声音也不能只是一段泛泛的引擎噪音,而要随着车辆接近、掠过和远离发生变化。实测下,部分模型会出现车身形态漂移,甚至尾部突然变成车头的情况。HiDream V1的赛车主体保持得更稳定,运动方向清晰,引擎声也随车辆位置变化产生了更自然的音调落差。效果的实现主要源于背后的架构。HiDream V1采用文本、视频和音频信号联合建模,而不是先生成画面、再后期配音。潘滢炜说,音画同步和原生全模态“天然耦合”,相比割裂生成,联合建模的对齐程度会更高,感知上也更自然。 也就是说,HiDream V1生成的不是一段带声音的视频,而是一段声音和画面共同成立的运动事件。
提示词:Top-down live-action art process, one continuous take. A blue brush gradually fills the line drawing: first the green tree, then red bicycle, yellow sun and blue windows, leaving black contours crisp. Color follows brush contact and never spills outside the drawn shapes; by the end the same drawing is a coherent colored illustration. Show wet paint texture and brush sounds, no morphing or new objects.此外,网易科技还测试了几组更贴近日常物理世界的场景,包括冰块掉入水中、倒水、纸张折叠等。实测结果显示,HiDream V1在这些场景里也能较好维持物体状态和动作连续性。把这些实测放在一起看,HiDream V1把一条能力链清晰地展示了出来:从物理因果,到动作时长,到音画因果,再到复杂指令理解和过程控制,模型正在把视频生成从画面能力推向状态推演能力。4、为什么它能做到:理解、生成、对齐这背后,不是给视频模型多喂一些物理数据这么简单,也不是在生成后再做规则修补。智象技术合伙人潘滢炜博士告诉网易科技,HiDream V1的技术路径可以拆成三步:先理解,再生成,再对齐。图注:HiDream V1技术路径示意——理解→生成→对齐第一步,是在生成前先做理解。过去很多视频模型更像是"把图动起来":用户给一张图、一句话,模型直接进入生成。但 HiDream V1会先通过多模态理解模块,对输入图片和文本进行结构化拆解,判断画面中的场景、主体、动作、物理关系、镜头时长、运镜方式以及声音设计。这一步的意义在于,模型会先把用户意图翻译成更适合视频生成的内部规划。比如苹果抛接,它要先理解这是一个短促动作;乒乓球弹跳,它要先理解弹跳高度、频率和撞击声之间存在物理关联;穿针引线,它要先判断红线、手指、针眼之间的受力关系。第二步,是把这些理解结果灌进原生全模态生成过程。潘滢炜提到,物理规律不能只停留在"知道"层面,还要变成跟视觉内容匹配的信号。"你重力落下来,几秒钟之后会在什么地方,这些精准的、跟视觉内容匹配的信号,是要给到模型里的。"HiDream V1的关键,正是在生成过程中纳入物理规律、动作节奏和音画关系,让画面、动作、声音和时间彼此约束。第三步,是用后训练进一步对齐合理性。在预训练之后,智象还会用 Reward 机制强化物理规律、音画同步和整体观感。潘滢炜将其类比为一种 human preference:哪些结果更符合重力、碰撞、光影、空间连续,哪些结果看起来违和,模型会从这种强弱对比中继续学习。这也是 HiDream V1的能力可以跨越多个场景的原因。穿针测试里,它要处理柔性物体的受力形变;苹果测试里,它要判断事件应该持续多久;乒乓球测试里,它要同时对齐画面运动和声音反馈。这几件事表面上不同,底层都指向同一个能力:模型开始推演一个事件如何发生。更进一步,这套机制之所以能成立,也和智象的原生全模态底座有关。5、一个UiT底座,四大模型同源演进HiDream V1并不是一个孤立的视频模型。它和 HiDream-O1-Image、HiDream-O1-World、HiDream-O1-Embodied 同源,都是从 O1原生全模态架构上长出来的不同任务形态。视频模型多了音频和时序信号,因此更重、更难,但也正因为它接入同一个底座,文本、图像、视频、音频之间才能在同一生成过程中互相约束,而不是各做各的。所以,HiDream V1能做出这些效果,不只是因为视频能力增强了,而是因为智象试图把"理解世界、表达世界、反馈世界"放进同一套模型逻辑里。