7月31日消息,MiniMax正式发布新一代多模态生成模型MiniMax H3,并宣布将于近期正式开源。作为MiniMax从特化任务模型向通用多模态智能演进的重要产品,H3支持文本、图片、音频、视频等多模态输入,可实现统一理解和生成,进一步拓展视频模型在商业内容生产中的应用能力。
据介绍,MiniMax H3不再局限于图片、视频、音频的单一生成或编辑任务,而是基于多模态上下文统一理解创作意图,完成更加自然、连贯的内容生成与表达。模型支持2K分辨率视频直出,可生成最长15秒的音画内容,在提升生成效果的同时,进一步降低高质量视频内容创作门槛。
官方表示,MiniMax H3具备商用级多场景内容生成能力,在指令遵循、文字与品牌信息呈现、V2V Motion Transfer(视频到视频动作迁移)等方面进行了优化,可实现更加精准、可控的多模态内容编辑与生成,适用于广告、品牌营销、电商、产品设计、UI/UX、游戏等商业场景。根据Artificial Analysis视频模型榜单,MiniMax H3在视频编辑能力单项排名全球第一。
据了解,H3也是MiniMax推出的首款开源多模态生成模型。模型借鉴了文本模型训练过程中验证有效的方法,包括复杂问题拆解、Reasoning、Scaling Context和Muon优化器,并将其应用于多模态理解、数据构建和模型训练,进一步提升模型面对开放输入和复杂指令时的泛化能力。
成本方面,MiniMax H3视频生成价格为2K分辨率0.8元/秒。官方表示,公司通过高压缩Tokenizer减少视频生成所需Token数量,并针对视频生成任务在异构训练、负载均衡及GPU利用效率等方面进行优化,在提升模型效果的同时降低训练和推理成本。
MiniMax表示,未来几天内将正式开源H3,企业可结合自身业务进行本地化部署和模型优化,更好满足安全合规需求,同时也将推动开发者及国产AI芯片厂商共同参与模型适配和生态建设,进一步扩大多模态模型的产业应用。(定西)
