![]()
视频生成圈最近热闹得有点过头。MiniMax-H3 刚一亮相,大家的注意力就集中在一个灵魂拷问上:
DGX Spark 这玩意儿,跑 MiniMax-H3,真能和 RTX 4090 一样快?
这次有人把这个问题直接拉到了台面上,搞了 19 路实测,覆盖了不同分辨率、不同执行链路、不同优化方案,数据颗粒度比很多人的购物车都清楚。以下,我们把结果按逻辑串起来,尽量说人话。
一、先说设定:比的是什么,怎么比的
- 统一任务:生成 5 秒视频
- MiniMax-H3 帧数规则:17k + 5,这次取 k = 7,共 124 帧
- 播放帧率:24 fps,成片约 5.167 秒
- 测试设备: DGX Spark x2 RTX 4090(24G,主机自带内存 32G)
![]()
测法核心很简单:**固定内容负载,换“引擎路线”**看谁更拉,主要包括:
- NVLabs 的 Sol Engine
- ComfyUI 版本模型管线
- 原版模型
- 双 Spark + Cache-DiT
- LoRA 4~8 步加速方案
- 单 Spark 内存拆分方案(这次证明属于“看了个寂寞”)
文中“生成秒”指的是完成计算耗掉的时间,不是视频播放长度。
全部有效样本共 19 路,其中:
- 优化提示词(通过 MiniMax 官方 Context IR 生成):16 路
- 原始提示词:3 路
分辨率分布:
- 864×480:12 路
- 1056×608:2 路
- 1216×672:2 路
- 1344×768:3 路
所有视频都经过分辨率、帧数、帧率、音轨和文件哈希校验,失败请求和二分测试没混进来。
顺便提一嘴优化提示词的成本:单次 Input Token 约 13,135,Output 约 9,908,费用大约在 0.0475 美金。
二、864×480:Base 20 步 vs Turbo 8 步,速度差出多少
先看低分辨率下的“纯速度对比”,忽略提示词内容差异,只看执行模式。
Base 20 步
- RTX 4090:112.093–129.421 秒
- 双 Spark:139.195–146.065 秒
- 单 Spark:348.318–348.752 秒
同一硬件重复跑的结果保留为独立柱,方便看波动。优化提示词和原提示词在速度上差异极小,基本可以视为环境噪声。
Turbo 8 步
- RTX 4090:66.876–67.211 秒
- 单 Spark:189.455 秒
- 单 Spark + 双 55 GiB 并发两路任务:568.242 秒 / 568.053 秒
结论直给:
- Turbo 8 步是 864×480 分辨率下的最低延迟路径
- 同样 Turbo 设置下: 单 Spark 大约是本地 RTX 4090 的2.82 倍慢双 55 GiB 并发单任务约8.45 倍慢
这说明:
- “能塞进两个完整任务”确实体现了 DGX Spark 在容量与并发上的优势
- 但这不代表它在单任务低延迟上能打,反而暴露了带宽竞争问题
到 1344×768,故事更有看头了。
![]()
在相同内容负载下:
- RTX 4090(ComfyUI):446.461 秒
- 单 Spark(原生 ComfyUI):1,184.971 秒
- 单 Spark(Sol-Engine fullopt):414.990 秒
重点来了:
- Sol 路径相对同机 ComfyUI 快了2.855 倍
- 相比 RTX 4090 ComfyUI,Sol-Engine 版的 Spark快约 31.5 秒(7.05%)
换句话说:
Sol 把同机 Spark 的延迟砍掉将近 65%,正式杀进 RTX 4090 的速度区间。四、Sol-Engine 的适配,并不是随便敲两行 prompt
这里有个关键细节,不展开很多人容易误以为“就是换了个入口”。
NVLabs 官方 GB10 演示入口默认只吃 prompt,但 MiniMax-H3 ModularPipeline 内部其实已经内置了fl2va workflow(Image → Video 的关键链路)。
这次的适配做法是:
- 在入口增加“image 首帧参数”,接入现有流程
- 使用 Qwen3-VL 编码画面
- Keyframe VAE 生成首帧条件
- 让注意力保留范围随首帧条件动态调整
效果是:可以直接从原来的 T2V 入口,顺道把 FL2VA 流程跑通,无需重写模型或主干管线。
是不是“最佳实践”不好拍胸脯,但实测证明:首帧条件确实被吃进去了,而不是当成纯文本瞎跑。
五、分辨率越高,越贵:生成时间呈超线性增长
分辨率往上抬,耗时增长非常狠,基本遵循幂律。
- 1056×608: RTX 4090:215.380 秒 单 Spark ComfyUI:618.851 秒(差距约 2.87 倍)
- 1216×672: RTX 4090:305.882 秒 单 Spark ComfyUI:842.333 秒(差距约 2.75 倍)
从 0.415 MP 到 1.032 MP,耗时增长大约:
- RTX 4090:3.45 倍
- 单 Spark ComfyUI:3.40 倍
对四个 ComfyUI 实测点做 log-log 幂律回归:
- 本机耗时 ≈ 像素数的1.348 次方(R²=0.991)
- 单 Spark ComfyUI ≈ 像素数的1.334 次方(R²=0.999)
结论很清晰:
- 像素越多,成本越非线性上涨
- Sol Engine 在 Spark 上的优化是“雪中送炭”;理论上 4090 也适用,这次还没对这头进行同样打磨,不过想象空间很明显
这部分对比严格控制:相同首帧、相同 seed、相同时长、相同输出规格,只看画面表现。
1. 提示词会悄悄改写“镜头语言”
同一台 RTX 4090,Base 20 步下:
![]()
- 优化提示词:人物更稳在画面中、主体更正面
- 原提示词:更容易出现低机位、背身人物、大范围阵法镜头
这其实暴露一个工程细节:提示词不仅是“要什么”,还隐式控制了镜头调度。
2. Base 20 步 vs Turbo 8 步:事件都在,节奏不同
单 Spark 的 Base 20 步和 Turbo 8 步,都覆盖了关键事件(闪电、阵法、飞剑、御剑入云),但:
- Turbo 压缩了过程,中段时间线更像“剪过”的版本
- 比如 3.5 秒附近,Turbo 更偏向正面护盾视角,Base 则保留背身大型圆阵
适合场景:
- Turbo:要快、要叙事节点不丢、对“逐帧镜头预期”要求不高
- Base:更在意镜头节奏和画面细节
A1(4090)和 A3(双 Spark)来自同批增强提示词配置:首帧、seed、帧数、步数完全一致。
四个关键时间点表现高度一致:
- 0.5s:人物、服装、石台环境均保持
- 1.8s:都出现闪电,人物近景俯视;双 Spark 人物略偏右
- 3.5s:正面人物 + 金色圆阵,主体尺度与阵法位置接近
- 4.7s:御剑入云完成,人物居中上升,带暖色尾迹
结论:
双 Spark Balanced Cache-DiT 这套组合,在画面一致性上最接近 RTX 4090 Base 20 步。4. 4090 ComfyUI vs Spark ComfyUI vs Spark Sol:路径不同,结果气质不同
同样增强提示词 SHA、首帧、seed、帧数、步数和模式:
- 0.5s:三路都保留首帧条件,说明 Spark Sol 确实走了 FL2VA,不是纯 T2V
- 1.8s:都有闪电;4090 和 Spark ComfyUI 构图近似,Sol 视角更正面、更贴人物
- 3.5s:ComfyUI 两路还在阵法+飞剑落位阶段,Sol 已经切到飞剑近景,事件节奏明显提前
- 4.7s:三者都完成御剑入云;Sol 人物更小、云层占比更大,但所有要求事件都覆盖
这意味着:
- Sol 强在速度,但不保证复现同一条“生成轨迹”
- 某些在 ComfyUI 上调好的提示词,换到 Sol 上未必给出完全相同风格
- 固定关键帧对比,适合看事件覆盖、朝向与构图;更细节的闪烁、手部、运动连贯性和音画同步,得拉完整视频细看
结合这次测试数据,给几套更落地的“按需求选型”策略:
要单 Spark 跑出接近 4090 的速度
- 推荐:单 Spark + Sol-Engine fullopt
- 理由: 1344×768、20 步场景下:414.990 秒 比单 Spark ComfyUI 的 1,184.971 秒缩短约 65% 比 RTX 4090 ComfyUI(446.461 秒)还略快
- 适合:希望单机承担正式工程任务、对速度要求高
- 推荐:RTX 4090 + Turbo 8 步
- 理由: 在 864×480 下是当前延迟天花板
- 适合:对响应速度极其敏感的场景
- 注意:镜头和节奏不能按 Base 20 步的结果逐帧预期
- 推荐:双 Spark Balanced Cache-DiT
- 理由: 画面一致性最接近 RTX 4090 Base 20 步 耗时 139.195 秒,仅比本地 RTX 4090(约 121.222 秒)慢约 14.83% 但比单 Spark Base 快约 2.51 倍
- 适合:对构图、事件节奏稳定性有要求的产线场景
- 推荐:单 Spark 大容量内存并发模式(双任务示例)
- 表现:两路完整任务可同时跑,但延迟并不友好
- 适合: 批量生成不同 seed 配合后续超分辨率或 MiniMax 2K regenerate 做高清放大
- 不太适合:追求单任务极致低延迟
从实际表现来看,MiniMax-H3 非常适合被拆解到分布式环境里跑:
- 硬件门槛不高: 显存 ≥ 12G 内存 ≥ 32G
- 可以很方便地在消费级设备上运行,也给后续分布式算力生态留了口子
- 典型工作流: 分布式多路并行生成 → 挑 seed → 超分或 2K regenerate → 高清成品
这基本上把“个人算力 + 云端补充 + 工作流拼装”的路径跑通了一个可用模板。
整体结论很直白:
- 执行链路 > 硬件名头
- DGX Spark 并不是“随便跑一跑”就能比肩 4090,但配上 Sol-Engine 后,单卡速度已经可以正面硬刚本地 4090 ComfyUI。
- 双 Spark Balanced Cache-DiT 在“速度 + 画面一致性”之间打了个不错的折中。
- Turbo 8 步适合“要快”,但镜头节奏预期要放平。
- MiniMax-H3 的分布式友好性,给后续视频生成工作流提供了很实在的扩展空间。
如果只看一句话:
选什么,不是看“谁更贵”,而是看“你要速度、一致性,还是并发”。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.