单张B200 GPU,生成一段新视角视频,最长150秒。这是Viggle AI开源Meridian后给出的实测数字——最短36秒,峰值显存88GiB到113GiB。对做视频生成的人来说,这个硬件门槛不算低,但也不算离谱。
Meridian要解决的问题很具体:一段事件记录拍完之后,怎么重新设计观看视角和时间节奏。它把这件事拆成了空间和时间两条线,分别控制。
![]()
空间和时间,各管各的
镜头的空间变化,指的是环绕、推拉、横移这类运镜和视角调整。事件的时间变化,指的是片段选择、帧停留、快慢放。Meridian把这两件事解耦处理。
解耦带来的直接结果是:用户可以在暂停或慢动作的同时移动摄像机。Bullet Time只是空间控制和时间控制的一种组合,并不是模型能力的边界。
三步走:先搭草稿,再补成片
整个流程分三步:
- VGGT-Ω估计深度和摄像机位姿,构建三维点,形成几何信息;
- 渲染出带空洞的观察视图草稿;
- Meridian模型补全未覆盖区域,并细化画面。
用一句话概括这套逻辑:几何先把新角度的画面"搭"成一张带空洞的草稿,视频模型再把草稿补成成片。MiniMax-H3在其中承担的是把几何渲染的草稿补全为高质量视频的角色。
输入可以是一张图
Meridian的输入支持单图或视频,输出是新视角镜头。这意味着拍完的素材不必重拍,视角可以后期重构。对于需要多机位效果但只有单机位素材的创作者,这条路径省掉的是重新组织拍摄的成本。
模型已开源,来源为魔搭ModelScope社区。推理时间随输出帧数变化,36秒到150秒之间浮动,显存占用同步变化。想跑起来的人,先看看手里的卡够不够。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.