7月31日,MiniMax正式发布通用全模态生成模型H3。该模型支持对文本、图像、视频、声音的统一理解,可输出原生双声道音视频,最高支持15秒2K分辨率视频生成。
H3主打商用级多场景内容生成能力,在指令遵循、文字与品牌信息呈现、视频到视频动作迁移等方面表现突出,可应用于广告、电商、品牌、游戏等商业场景。定价方面,2K分辨率下每秒价格不到主流模型的1/3,768P分辨率下不到1/2。核心技术包括Contextual Omni Representation、H3-VAE及H3-Omni Transformer等,通过理解与生成异构训练架构提升训练吞吐近30%。
MiniMax表示,将在未来几天内开放模型权重,以推动开源社区发展并加速国产芯片适配。此前两代模型(Hailuo 01、02)分别在系统构建与架构效率上完成迭代,H3则进一步实现任务与模态的统一。公司称后续版本将推动与M系列模型能力的融合,并持续提升画面精细度。
本文源自:凤凰网科技
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.