网易首页 > 网易号 > 正文 申请入驻

10秒1080P视频只要五毛钱:Sand.ai开源首个千亿MoE 视频模型,想把成本打下来

0
分享至



8 月 5 日,Sand.ai 发布并开源 MAGI-2 Preview。这是一款统一音视频生成模型:文本、视频和音频进入同一个 Transformer,画面和声音由同一套主干共同生成。模型总参数约 114B,每次生成激活约 6B,这是全球首个开源千亿级 MoE 视频生成模型。

2025 年 4 月,Sand.ai 曾开源 24B 参数的自回归视频模型 MAGI-1。时隔一年多,这家公司再次把主力视频生成模型带入开源体系,参数规模从 240 亿扩大至 1,140 亿。

过去两年,开源视频生成模型的参数规模大多停在十几 B 以内,最大的也不过二三十 B。语言模型那边,开源模型早就进入了几千亿甚至万亿参数,靠的都是 MoE。

虽然说两类模型面对的任务不同,参数规模不能直接代表能力高低,但这组差距仍然说明,视频模型扩展规模要付出更高的计算和通信代价。视频模型的参数规模长期停留在这一水平,也主要受制于这两项成本。MAGI-2 Preview 将总参数推至 114B,尝试解决的正是这个问题。

视频模型为什么一直做不大?

视频的序列远比文本长,模型生成视频,需要把画面切分成大量空间 patch。一帧画面对应一批 token,连续数秒的视频再叠加文本与音频,最终形成的序列远长于普通语言任务。分辨率、帧率和生成时长中的任何一项增加,都会进一步推高 token 数量。

稠密模型中,每个 token 都要经过全部参数。模型参数增加,单个 token 的计算量也会同步上升;再乘上视频的超长序列,训练和推理成本很快变得难以承受。在语言模型中可行的参数扩张方式,移到视频任务上,往往先撞上成本与效率的限制。2026 年 3 月 OpenAI 停止运营 Sora,其背后很大一部分原因就在于:以当时的架构和推理成本,大规模商用几乎不具备经济上的可行性。

语言模型缓解这一问题,依靠的是混合专家模型(Mixture of Experts,MoE)。模型保留一个庞大的专家池,每个 token 只激活其中一小部分,由此把总体容量和单次计算拆开。模型可以继续增加参数,拓展能力上限,但每次推理不必调用全部权重。

把这套方法移到视频模型上,困难主要出现在通信环节。

传统专家并行(Expert Parallel)会先为每个 token 选出需要调用的专家,再把 token 发送到专家所在的 GPU。激活的专家越多、序列越长,设备之间需要搬运的数据也越多;专家负载还会随着输入内容变化,导致不同设备承担的计算量不断波动。

在文本序列中,这套机制尚可运转。但换成视频的 token 规模,跨卡通信就很容易抵消稀疏计算节省下来的算力。视频模型因此需要的不只是 MoE 架构,还包括一套专门为长序列和高频路由设计的分布式系统。

114B 的容量,6B 的激活参数

MAGI-2 Preview 的解法分两步,第一步是把专家切得更细。

传统 MoE 通常为一个 token 的完整隐藏表示选择专家。MAGI-2 Preview 则先把 3,072 维隐藏表示拆成 12 个 256 维子空间,每个子空间称为一个 head。每个 head 拥有 256 个专家,并从中选出 6 个。


(来源:Sand.ai)

由此计算,一层网络包含 3,072 个相互独立的小专家,每个 token 在每层合计激活 72 个。放到整个模型中,MAGI-2 Preview 拥有约 114B 总参数,每次生成实际激活约 6B。

作为参照,DeepSeek-V4-Pro-Preview 每层设置 384 个路由专家,每个 token 选择 6 个;Kimi K3 设置 896 个专家,每个 token 选择 16 个。

大语言模型对“专家”的定义,以及面向的维度和任务与视频模型并不相同,数量不能直接换算成能力。两者对比更能说明的是路由粒度:MAGI-2 Preview 将一个 token 拆进多个低维子空间,让动作、外观、声音和语义分别寻找适合的专家,再把不同专家的输出组合起来。

Sand.ai 将这种结构称为 Ultra-fine-grained MoE。更细的专家分工扩大了能力组合空间,也为统一音视频生成提供了基础。

MAGI-2 Preview 将文本、视频和音频放在同一个上下文中处理。模型内部既有三种模态共享的专家,也有各自的专属专家。声音、口型、表情、动作和镜头节奏从生成开始便相互影响,减少了先生成画面、再串联声音模型所产生的接口和对齐问题。


图丨文本、视频和音频进入同一个 Transformer(来源:Sand.ai)

专家增加到数千个后,传统调度方式很快触及效率上限。对此,Sand.ai 引入了 Head Parallel,改变通信与路由的顺序。

传统 Expert Parallel 先路由、再通信;Head Parallel 先按照 head 分发 token 表示,再由设备在本地完成专家选择和计算。由于分发的数据形状固定,主要通信量只取决于输入表示,不再随激活专家数量线性增长,设备之间的负载也更稳定。

这套机制让 MAGI-2 Preview 能够把专家划分得更细,同时避免通信成本吞掉稀疏计算带来的收益。3,072 个专家能够真正协同工作,前提正在于此。


图丨分层 Head Parallel 架构(来源:Sand.ai)

架构之外,还需要一整套工程系统支撑。

数千个小专家意味着高频路由、反复的数据重排和大量小矩阵计算。通用 MoE 很难在这种负载下保持足够高的硬件利用率。Sand.ai 为此开发了计算内核库 MagiMoE,将路由、排序和专家计算合并执行,减少中间结果与显存搬运。

训练部分由分布式优化器 MagiMuon 支撑。它使用 Muon 处理主体矩阵参数,用 AdamW 更新其余参数,并针对大量细粒度专家重新设计参数组织和跨设备计算方式,使训练能够稳定扩展到千亿参数规模。

专家划分越细,数据也越需要支撑这种分工。Sand.ai 没有把“高质量数据”简单理解为反复过滤,团队希望尽可能保留复杂动作、少见主体、特殊镜头、非典型声音和长尾组合,再通过更准确的标注组织这些数据。这样能让模型更好地模型理解主体、动作、场景、镜头、时序,以及声音、画面和文本之间的关系。

模型、系统和数据由此连在一起。对于视频生成,扩大参数已经不再是单纯的算法问题,模型架构、计算内核、分布式训练和数据管线需要同时变化。

这套改造最终要落到生成成本上。根据 Sand.ai 团队提供的内部测算,在 8 卡 H100、按照当前月租价格折算的条件下,不同推理配置生成一段 10 秒视频的成本约 0.5 元(蒸馏后的模型)。按团队口径,折算到每秒,价格约为行业主流模型的十分之一。

视频生成通常按时长计价。单位成本如果下降一个数量级,批量生成素材、多版本迭代等过去不够经济的用法,才可能进入常规生产流程。

生成效果则有第三方榜单可以对照。在 Artificial Analysis 的图生视频(image-to-video)榜单上,MAGI-2 Preview 排在第 6 位。一个激活参数仅 6B 的开源模型,生成效果已经进入当前视频生成的第一梯队。


(来源:Artificial Analysis)

作为预览版,MAGI-2 Preview 与最顶尖模型仍有差距,Sand.ai 对此并不讳言;对一家资源远少于大厂的创业公司而言,这个结果证明的是另一件事:把功夫花在架构和系统上,同样的卡可以换出更多的生成能力。按团队的说法,正式版会沿着这套已经跑通的架构继续扩大参数和数据规模,探索更长时长的视频生成,进一步提升生成质量、音画同步和长时一致性,并持续降低单位生成成本。

开源改变的是参与边界

这次发布的另一个重点,是开源本身。过去,千亿级视频模型如何设计架构、保持稳定训练,关键细节大多留在闭源公司的内部系统中。

而 MAGI-2 Preview 提供了一个可供拆解和验证的对象。研究机构可以观察细粒度专家如何分工,路由是否会随着人物、动作和声音变化。推理框架与芯片厂商也获得了一种新的公开工作负载:数千个细粒度专家带来的高频路由、数据重排和大量小矩阵计算,需要新的内核、通信策略和硬件适配。

更下游的变化发生在企业侧。影视、广告、游戏和电商企业掌握大量专有素材,其中一部分受到保密、版权和合规要求限制,不适合直接发送给外部 API。开放权重让模型进入企业自己的计算环境成为可能,企业也可以围绕特定人物、商品和镜头语言继续训练。

应用公司同样多了一个选择。调用闭源 API 时,成本、并发、接口能力和产品节奏主要由模型厂商决定;有了开源模型,应用公司可以在外部 API、本地部署和定制模型之间重新计算成本。

114B 模型当然不是下载后便能轻松运行的工具。部署依然需要一定的硬件、通信、工程和运维门槛。它改变的是参与边界:过去主要由头部模型公司掌握的千亿级视频模型,如今开始进入研究机构、基础设施团队和行业企业的视野。

语言模型已经提供了一条可供参照的路径。开源模型不需要在每一项能力上都超过最强的闭源模型;只要进入可用区间,企业就会开始比较部署成本、数据控制、定制空间和供应商风险,闭源厂商也会面临降低价格、开放更多能力的压力。

视频生成可能形成相近的格局。闭源模型继续在产品体验、服务稳定性和商业支持上保持优势,开源模型则提供部署和改造的空间。双方的竞争会从生成质量延伸到价格、数据和开发工具,性能天花板很难再单独决定胜负。

过去两年,视频模型比较的是画面是否逼真、动作是否自然。接下来,决定行业走向的问题会更多地出现在画面之外:一段视频以什么成本生成,模型由谁控制,规模能否继续扩大。

MAGI-2 Preview 不会立即改写视频模型的排名。它带来的变化,是让这些问题第一次有了一个千亿参数级的公开样本,可以由更多人拆解、验证。

参考资料:

1.https://sand.ai/blog/magi-2-preview

运营/排版:何晨龙

注:封面/首图由 AI 辅助生成

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
当“反美斗士”遇上美国签证官

当“反美斗士”遇上美国签证官

报人刘亚东
2026-08-05 14:10:32
“90后”奶爸手搓爆款AI短剧 《归墟》单集成本超1.5万|封面头条

“90后”奶爸手搓爆款AI短剧 《归墟》单集成本超1.5万|封面头条

封面新闻
2026-08-05 17:06:02
被注射不明物仅冰山一角!金子涵再爆猛料,上百位艺人被点名牵连

被注射不明物仅冰山一角!金子涵再爆猛料,上百位艺人被点名牵连

感恩每一刻
2026-07-18 04:28:24
女标枪67米34,男女百米10秒06、11秒10,中美加勒比好成绩频现!

女标枪67米34,男女百米10秒06、11秒10,中美加勒比好成绩频现!

巧妹电影
2026-08-06 13:25:08
美债扩大跌幅 受谷歌发债计划和美联储加息相关报道影响

美债扩大跌幅 受谷歌发债计划和美联储加息相关报道影响

财联社
2026-08-06 20:42:04
明日立秋,叮嘱家人要忌嘴,3不吃,3要吃,合理饮食,养好体质,为秋冬打基础

明日立秋,叮嘱家人要忌嘴,3不吃,3要吃,合理饮食,养好体质,为秋冬打基础

小茉莉美食记
2026-08-06 18:18:47
到2050年中国还能剩多少人?联合国做出大胆预测,答案让人意外

到2050年中国还能剩多少人?联合国做出大胆预测,答案让人意外

锅锅爱历史
2026-07-26 13:00:56
20岁女孩当小姐目标3年赚500万,2022年只赚100万就因偷东西被抓

20岁女孩当小姐目标3年赚500万,2022年只赚100万就因偷东西被抓

情感艺术家
2026-07-10 23:18:50
收受10万余元和香烟约30条!看守所辅警为在押人员转递物品、传递信息,获刑1年

收受10万余元和香烟约30条!看守所辅警为在押人员转递物品、传递信息,获刑1年

红星新闻
2026-08-06 12:41:12
2亿成本,首映仅3387万,《年会不能停2》票房倒挂,董润年亏到怀疑人生

2亿成本,首映仅3387万,《年会不能停2》票房倒挂,董润年亏到怀疑人生

猫飞电影
2026-08-05 10:54:01
央视八套于和伟《重器》开播,戏骨扎堆太香了!

央视八套于和伟《重器》开播,戏骨扎堆太香了!

可乐谈情感
2026-08-06 09:59:03
文班亚马一家近照,拿2.5亿肥约,父母超1米9,弟弟2米冲击NBA

文班亚马一家近照,拿2.5亿肥约,父母超1米9,弟弟2米冲击NBA

大西体育
2026-08-06 19:27:11
0 时 0 分准时生效!中方 16 条新规落地,菲律宾船只再闯就不是警告了

0 时 0 分准时生效!中方 16 条新规落地,菲律宾船只再闯就不是警告了

谛听骨语本尊
2026-08-06 12:23:19
大陆为何还不收复台湾,普京的一句话,得到全体中国人民的认同!

大陆为何还不收复台湾,普京的一句话,得到全体中国人民的认同!

心灵得以滋养
2026-08-06 20:26:31
731国耻日郑丽文竟媚日示好,张亚中怒斥:虚伪表演该收场了

731国耻日郑丽文竟媚日示好,张亚中怒斥:虚伪表演该收场了

健身狂人
2026-08-06 15:04:03
千万别随便跟 AI 掏心窝子!斯坦福研究揭露了一个扎心真相

千万别随便跟 AI 掏心窝子!斯坦福研究揭露了一个扎心真相

人人都是产品经理社区
2026-08-05 19:58:00
被高温高湿暴击的东北朋友,不笑南方人了

被高温高湿暴击的东北朋友,不笑南方人了

新周刊
2026-08-06 13:12:45
日媒突然发现一个扎心事实:中国人的生活里,日本货快找不着了

日媒突然发现一个扎心事实:中国人的生活里,日本货快找不着了

互联鱼
2026-06-02 19:32:57
知名歌手韦唯回忆10年跨国婚姻:完全就是上当,婚后才知道对方比自己大25岁,表面光鲜藏着控制和暴力

知名歌手韦唯回忆10年跨国婚姻:完全就是上当,婚后才知道对方比自己大25岁,表面光鲜藏着控制和暴力

极目新闻
2026-08-04 14:27:22
收评|好险!A股黑四不黑,后市怎么走?

收评|好险!A股黑四不黑,后市怎么走?

龙行天下虎
2026-08-06 15:12:16
2026-08-06 21:32:49
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17062文章数 515178关注度
往期回顾 全部

科技要闻

凌晨谷歌AI地震!4位大牛离职 CEO退居二线

头条要闻

38岁演员求职景区NPC:收入基本断了 每月几千块都没有

头条要闻

38岁演员求职景区NPC:收入基本断了 每月几千块都没有

体育要闻

曝维尼修斯与皇马续约4年 年薪2400万欧

娱乐要闻

周杰伦私生活被扒,澳门传闻水落石出

财经要闻

"杭州六小龙"群核科技物理AI故事有水分?

汽车要闻

上汽通用再签20年:合资2.0时代,玩法变了

态度原创

艺术
时尚
本地
游戏
军事航空

艺术要闻

被西方风景油画治愈的浪漫

上新|| 戴了5年越来越喜欢,我的夏天没它不行

本地新闻

课本里的童年,绍兴正上演

猪猪超可爱的非线性3D探索解谜冒险游戏《猪猪探险家》推出免费试玩版,现可体验游戏序章!

军事要闻

李在明点名批评驻韩美军拖延归还用地

无障碍浏览 进入关怀版