7月31日,MiniMax正式发布新一代多模态生成模型MiniMax H3,并宣布将在近期开源。
与以往按图片、视频、声音等单一任务划分边界不同,H3是MiniMax从专用任务模型向通用多模态智能迈出的一步。它的设计思路不再将生成、编辑和参考视为独立环节,而是在统一的多模态上下文中理解创作意图,实现更自然、更连贯的生成与表达。
在能力层面,H3支持文本、图片、音频和视频等多种输入形式,可直出2K分辨率画面,最长生成15秒的音画内容。在 Artificial Analysis视频模型榜单中,H3的视频编辑能力排名全球第一。它在指令遵循、文字与品牌信息呈现、视频到视频动作迁移(V2V Motion Transfer)等维度均有稳定表现,可应用于广告、品牌、电商、产品设计、UI/UX和游戏等商业场景。
H3是MiniMax推出的首款开源多模态生成模型。此前,该公司已先后开源三代M系列文本模型,文本与多模态两条路线并行自研的路径逐步清晰。
在H3的研发中,团队借鉴了文本模型在复杂问题拆解、推理、上下文扩展(Scaling Context)和Muon优化器等方面已被验证的方法,将其迁移到多模态理解、数据构建与模型训练中。围绕不同任务的理解和指令遵循,MiniMax对数据体系进行了多轮迭代,以提升模型面对开放输入和复杂指令时的泛化能力。
定价方面,H3的视频生成价格为0.8 元/秒(2K分辨率),约为业内同类旗舰模型的三分之一。成本的下降主要来自两个方向的技术优化:一是通过高压缩Tokenizer减少视频生成所需的Token数量;二是针对视频长度、分辨率和多模态负载差异大的特点,在异构训练、负载均衡和GPU利用效率等层面进行系统性调优,在追求效果的同时控制训练与推理成本。
MiniMax相关负责人表示:“通过MiniMax H3,我们希望为更多企业和开发者、创作者降低内容创作的门槛。H3将于未来几天内开源,企业可以在本地灵活部署,结合自身数据和业务进行优化,更好地满足安全合规要求;芯片厂商和开发者也能共同参与适配和优化,降低使用成本,扩大应用范围。”
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.