手里已经有一张图,视频必须从这一帧开始,选图生视频模型时真正要算的账,是这一帧之后会发生什么。片子要不要停在另一张精确的图上,能不能超过几秒,带不带生成音频,每秒价格能不能压住——这几件事,不同模型的处理方式不一样。
Veo 3.1、Seedance、Kling、Grok Imagine Video 这四条线,都能通过同一套视频生成 API 调用。提交、轮询、下载的生命周期对每个模型都一样,但时长、分辨率、帧角色、音频选项和价格,各家接受的设置不同。本文对比这些设置。
![]()
四家的输出设置
Veo 3.1、Fast 和 Lite 生成 4、6、8 秒的片段,支持首帧和尾帧控制,带生成音频。Veo 3.1 和 Fast 最高到 4K,Lite 止步 1080p。
Seedance 2.5 生成 4 到 30 秒的片段,480p 或 720p,接受首帧和尾帧,最多吃下 50 个图像、视频和音频参考素材。Seedance 2.0 这条线覆盖 4 到 15 秒。
Kling v3.0 Standard 和 Pro 生成 3 到 15 秒的片段,720p,支持首帧和尾帧控制。音频是可选项,选了就改价。
Grok Imagine Video 1.5 生成 1 到 15 秒的片段,480p、720p 或 1080p,只认首帧,带生成音频。
图放在哪一帧,是两个不同的字段
一张图在请求里可以定义成片中的某一帧,也可以只当参考素材,这两种情况对应两个不同的请求字段。
文生视频里,模型只靠提示词搭场景,开头那一帧你控制不了。图生视频里,图变成首帧、尾帧,或者两者都是——产品视频必须开在一个精确的产品镜头上,就用这个模式。参考生视频里,模型拿到素材但不把它钉在某一帧位置上,比如给同一个角色的好几张图,让模型在组新镜头时保持长相。
图必须出现在片子的某个确定位置,用图生视频;图只需要引导结果,用参考生视频。
这两个模式在 POST /api/v1/videos 上是分开的字段。每个 frame_images 条目带一个 frame_type,取值 first_frame 或 last_frame。不是每个模型都支持两种角色,模型目录里的 supported_frame_images 数组会告诉你它认哪些。如果一次请求里两个字段都发了,frame_images 优先,任务按图生视频处理。
价格怎么算,按 token 计费的那家是个例外
大多数模型按秒计费,所以时长本身就是成本决策。Seedance 按视频 token 计费,不是按秒。Seedance 2.0 的模型页写明,token 数等于高乘宽乘时长乘 24,再除以 1,024。
Seedance 2.5 标价 每百万视频 token 10.70 美元,Seedance 2.0 在 480p 和 720p 下标 7.00 美元,1080p 和 4K 另有费率,Fast 标 4.20 美元,Mini 标 3.50 美元。带视频输入的请求用更低的每 token 费率。
按 Seedance 2.5 起步价每秒 0.1028 美元算,4 秒片段起步约 0.41 美元,30 秒片段起步约 3.08 美元。720p 或换一种输入配置,费用更高。
Veo 这边,Lite 在 720p 无音频下每秒起步 0.03 美元,Veo 3.1 无音频每秒起步 0.20 美元。提示词和运动还在反复调整的阶段,Lite 或 Fast 更省钱。
怎么选,先砍掉一半
时长和帧控制先把名单缩窄。知道片子必须多长、要不要固定首帧、尾帧还是两者都要之后,再在剩下的模型里比音频、分辨率和成本。
8 秒以内、要生成音频的片段,Veo 3.1、Fast、Lite 给 4、6、8 秒三种时长,16:9 或 9:16,支持首帧和尾帧控制,带 generate_audio 选项。Veo 3.1 和 Fast 接受 720p、1080p 和 4K,Lite 接受 720p 和 1080p。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.