当行业还在不断刷新画质、时长和可控性的同时,另一场挑战也开始出现。
Hailuo等模型,都已经能够生成长达数十秒甚至数分钟、高一致性、高可控性的内容。在Artificial Analysis等国际第三方榜单上,中国视频模型也已经长期位居全球第一梯队,与Google等国际厂商共同定义着这一轮视频生成技术的发展方向。
如果把时间拨回两年前,很少有人会认为,视频生成会成为这一轮AI竞争中进化最快的方向。
彼时,AI生成的视频往往只有几秒钟,人物容易崩坏,动作缺乏物理规律,镜头切换混乱,更不用说生成对白、环境声等复杂内容。等待几十分钟甚至更长时间,只换来一段充满"AI味"的短片,是当时许多人对视频模型最深刻的印象。
短短两年,这条技术曲线却几乎以所有人都没预料到的速度陡然向上。
今天,无论是OpenAI的Sora、Google的Veo,还是来自中国的可灵、MiniMax
但当行业还在不断刷新画质、时长和可控性的同时,另一场挑战也开始出现。
视频模型需要处理的人物、动作、镜头、场景越来越复杂,统一音视频之后,还要同时理解对白、环境声和背景音乐。模型规模不断扩大,训练成本、推理成本以及跨机器通信开销也随之快速攀升。过去依靠不断放大Dense Transformer规模来提升能力的路径,开始越来越接近它的边界。
类似的问题,大语言模型已经经历过一次。
而大语言模型给出的解决方案之一,就是MoE(Mixture of Experts)。它让模型拥有更大的总参数规模,却只在每次推理时激活其中少量专家,从而将模型容量与单次计算量部分解耦,也重新打开了Scaling Law。
那么,当视频生成同样走到模型规模与计算成本的十字路口,它是否也会进入属于自己的MoE时代?
Sand.ai此次发布并开源千亿级MoE视频生成模型MAGI-2 Preview,或许正试图回答这个问题。它总参数约114B,但单次前向计算仅激活约6B参数;更重要的是,这是全球少有团队将千亿级MoE真正应用到统一音视频生成模型,并完整开源模型权重、代码以及训练系统。
![]()
在全球视频生成模型榜单Artificial Analysis的Image to Video上,MAGI-2 Preview排名全球第六。
对于一款114B参数的统一音视频模型来说,真正令人意外的是,其成本并没有随着模型扩大而线性增长。据Sand.ai测算,生成1080P视频的成本约为每10秒0.5元。
对于Sand.ai来说,这是MAGI系列的又一次迭代;对于整个行业来说,它可能意味着视频生成开始尝试另一种扩展路线。
视频生成,开始撞上新的Scaling Law
从2024年年初开始,视频生成几乎沿着一条明线在狂飙。
从最初粗糙的“动图”尝试,到如今分钟级的高清生成、精准的人物一致性,以及极其复杂的调度镜头;更进一步,它正跨越单纯的画面渲染,向着集对白、环境声与背景音乐于一体的“音视频统一生成”演进。无论是OpenAI、Google,还是字节跳动、快手、MiniMax等国内团队,都在持续刷新这个赛道的上限。
这轮爆发背后,支撑整个产业狂奔的唯一铁律就是把模型做得更大。
无论是大语言模型、具身智能,还是视频模型,这一轮AI浪潮最底层的信仰始终只有一个——Scaling Law。
参数规模的膨胀,意味着模型能够刻画更庞大的物理规律、捕捉更微妙的光影与微表情。行业曾笃信,只要源源不断地压入数据与算力,规模效应就终将兑现为惊艳的能力跃迁。
然而进入2026年,这条靠强行膨胀Dense(密集模型)规模来换取能力提升的路径,已经撞上了物理与商业的双重高墙。
关键的症结在于,视频生成本身就是AI领域最重的计算任务,没有之一。相比一维的文本,视频需要同时在二维空间和一维时间上做高强度的特征建模;而当音视频统一生成成为行业新标准后,文本、图像、音频多模态被揉进同一个模型,单段视频包含的信息量呈几何级激增。
在传统的Dense架构下,模型每处理一个Token,都需要将数千亿参数完整地跑一遍。当模态叠加、Token数量指数级膨胀时,算力成本、GPU之间的通信带宽开销以及推理延迟正急速迈向失控。
行业不得不开始直面一个残酷的现实:靠粗暴堆叠模型规模来延续Scaling Law的时代,正在触顶。当算力账本逼近承受极限,模型究竟还能如何继续Scaling?
对这个问题,隔壁的大语言模型(LLM)赛道已经率先交出了答卷。从Mixtral到DeepSeek、Qwen,MoE(混合专家)架构逐渐成为绝对主流。它的逻辑优雅且直观:通过构建极其庞大的总参数库,但在每次推理时只根据任务精确激活少量的专家模块,成功将模型容量与单次计算成本实现了物理解耦,让Scaling Law继续成立。
但为什么在LLM领域大放异彩的MoE,却迟迟没能在视频生成领域落地?
因为视频生成无法简单照搬文本模型的套路,最大的区别来自Token。
首先是数据量级的降维打击。一篇几百字的文本,经过Tokenizer离散化后不过几百个Token;而一段十几秒的高清音视频,即便经过高倍率压缩,离散化后的Token数量也轻易飙升至数万甚至数十万级别。
其次是时空关联的极其复杂。文本Token之间主要处理上下文的语义关系,而视频Token却要同时承担空间像素的平滑、跨帧时间轴的连续性,以及音画同步的毫秒级对齐。当统一音视频模型出现后,每一个Token还需要不断与对白、口型、环境声等信息保持同步。
![]()
也就是说,视频模型不仅处理的数据更多,每个Token之间需要建模的关系也更加复杂。
这样的特性会让MoE遇到工程挑战。当海量的Token伴随着极其复杂的跨帧注意力机制涌入MoE系统时,灾难发生了。每一个Token都需要实时进行专家选择、路由与分配。如果将千亿级的MoE拆解到成百上千张GPU卡上,数万个Token在不同节点间频繁切换专家,会导致设备间的通信带宽瞬间被挤爆,路由开销甚至会直接反吞掉MoE带来的计算节省。
再加上跨机器的负载均衡、显存碎片的极致打理、训练中随时可能出现的专家坍缩与梯度爆炸……对于千亿级的视频MoE而言,写出一个MoE的算法公式或许只需几天,但要让一套支持千亿MoE视频训练的底层系统稳定跑起来,此前全行业都没有现成的参考答案。
这也解释了为何在过去很长一段时间里,尽管全行业都觊觎MoE的成本红利,但在视频生成领域,千亿级MoE的实战验证始终处于一片空白。
连续三次“非共识”,Sand.ai一直在回答同一个问题
如果把Sand.ai此次发布的MAGI-2 Preview看作一次独立更新,那便很容易忽略它真正的意义。
事实上,这已经是Sand.ai连续第三次选择一条当时并非行业主流的技术路线。回过头来看,这几次选择看似分别发生在模型架构、模态融合和训练方式上,实际上都在回答同一个问题,即视频模型如何继续逼近真实世界。
最早的分歧出现在视频生成路线之争。
事实上,这波AIGC浪潮之所以能一夜爆火并彻底席卷全球,最原初的火种正是Diffusion(扩散模型)。因此过去很长一段时间,Diffusion几乎是视频生成领域无可争议的底层范式。其核心逻辑在于“从噪声中重构画面”——模型从一片混沌的随机噪声出发,通过数十轮极其精密的去噪预测,一步步塑造出高清晰度、高连续性的视频帧。
而Sand.ai则在2024年底创立之初,就选择了另一条路——Autoregressive(自回归)。
在Sand.ai看来,视频并不是一组彼此独立的图片,而是一段沿着时间持续展开的连续序列。模型如果能够像生成文本一样,逐帧预测未来,就更容易学习动作之间的因果关系,也更容易扩展到更长的视频生成。这一判断最终落在了2025年4月发布的Magi-1上,也让Sand.ai成为很早公开验证自回归视频路线的团队之一。
紧接着,Sand.ai又把问题向前推进了一步。
现实世界从来不是只有画面。人物说话时,口型、声音、动作和环境变化始终同步发生。但过去很长一段时间,大多数视频模型仍然将画面和声音分开生成,再通过后处理进行拼接。
2025年9月,Sand.ai开始将统一音视频作为下一步技术方向,通过Gaga-1尝试把文本、视频和音频放进同一个Transformer,让不同模态从模型第一层开始持续交换信息,共同完成生成过程,而不是采取业界流行的等画面生成之后再补充声音。2026年3月发布的daVinci-MagiHuman,则进一步验证了这一方向。
到了MAGI-2 Preview,问题再次发生变化。
随着统一音视频模型不断扩大,Dense Transformer带来的训练和推理成本开始快速增长。正如前文所说,继续扩大模型规模,意味着每一次计算都需要激活全部参数,模型容量越大,算力、通信和推理开销也同步增加。
于是,Sand.ai把第三次技术判断放在了模型扩展方式上。
MAGI-2 Preview采用Multi-Head MoE架构,将一个Token拆分为多个子空间,每个子空间独立选择专家参与计算。这意味着,模型虽然拥有114B总参数,但一次前向计算真正激活的只有约6B参数。
这也改变了模型继续扩展的方式。
怎么理解?Multi-Head MoE让模型内部拥有更多专家,却只在每次计算时激活其中一小部分,让模型容量与单次计算量实现一定程度的解耦。对于统一音视频模型而言,这意味着模型可以把更多参数用于学习更复杂的时间关系、物理规律以及多模态交互,而不必让每一次推理都承担全部计算代价。这也让视频模型在继续扩展时,多了一条不同于Dense Transformer的新路径。
![]()
回头看,Sand.ai过去几年的技术演进,其实是在不断突破视频模型的三道边界:时间、模态和规模。自回归解决了时间连续性,统一音视频解决了多模态协同,而Multi-Head MoE解决的,则是模型继续扩展所面临的规模问题。
不过,对于千亿级Multi-Head MoE来说,仅有模型架构还远远不够。前文提到的专家路由、跨设备通信和训练稳定性,都会随着模型规模扩大变成新的工程瓶颈。
为了解决这些问题,Sand.ai同步开发了一整套训练系统。MagiMoE Kernel Library负责专家路由、Token排序和专家计算,让海量Token能够更高效地找到对应专家并完成计算;Head Parallel针对大量细粒度专家带来的通信压力,重新组织不同Head之间的计算方式,减少GPU之间频繁的数据交换;分布式优化器MagiMuon则负责保障千亿参数、海量专家条件下的训练稳定性,让超大规模MoE模型能够持续收敛,而不会因为梯度震荡或负载失衡中途崩溃。
过去几次技术判断,在此刻进一步收束。
真正值得关注的,不只有114B
大模型行业正在发生一场很有意思的变化:模型越来越强,论文越来越多,但真正能够影响行业方向的,往往不是某一家公司的自我定义,而是有没有一套公开、可重复验证的标准。
世界模型就是一个典型例子。
去年WAIC期间,几乎每一家视频模型公司、机器人公司都在谈世界模型,但不同公司打开的却是不同的榜单:有人展示VBench,有人强调WorldModelBench,也有人拿出Physics-IQ或者机器人任务成功率。直到越来越多公开评测体系出现,行业才开始逐渐形成共同的坐标系。模型到底强不强,不再完全由发布会决定,而开始由公开数据和社区验证共同定义。
技术路线也是如此。
过去几年,Sand.ai连续选择了自回归、统一音视频以及Multi-Head MoE三条当时并非行业主流的路线。但无论论文写得多完整,模型效果多突出,这些判断本质上仍然来自一家公司的技术选择。
真正让一条路线拥有生命力的唯一方法,是让更多人验证它,是越来越多人愿意沿着它继续前进。
Llama推动了开源大语言模型生态,Stable Diffusion催生了AIGC图像社区,而DeepSeek则让越来越多团队重新思考大模型训练和推理的技术路线。
Sand.ai此次开源MAGI-2 Preview,争夺的或许也是同一种影响力。
因此,这次MAGI-2 Preview中的重点很多,参数是一个,MoE是一个,同步开发的工程能力也是一个,但还有一个不该被忽视的,是开源。这次,Sand.ai开放了模型权重、代码以及技术报告。Multi-Head MoE成为整个行业都可以验证、复现和继续演进的公共技术路线。
研究者可以验证这种细粒度MoE是否真的更适合视频生成;开发者可以围绕模型继续进行微调、量化以及工作流开发;推理框架团队可以继续优化专家路由、显存占用和通信效率;企业也能够根据自己的数据环境进行私有化部署。
更重要的是,这些来自社区的反馈,会反过来检验这条路线本身;于是这条路线最终能走多远,不再只取决于Sand.ai,而取决于整个开发者生态是否愿意继续沿着它演进。
模型是否真的能够继续扩展?工程复杂度是否足够低?训练成本是否能够进一步下降?这些问题,不再需要Sand.ai自己回答,而会在一次次复现、部署和优化过程中,由整个开发者社区共同给出答案。
这也是过去几年AI竞争正在发生的一种变化。
上一阶段,比拼的是谁能够训练出效果最好的模型;下一阶段,更重要的竞争,正在逐渐变成谁能够提出一条足够开放、足够稳定,也足够具有扩展性的技术路线,让更多团队愿意围绕它继续创新。
Sand.ai给出了自己的答案。这条路线最终是否会成为视频生成新的Scaling Law,还需要时间验证;但至少,它已经把一次模型发布,变成了整个行业共同参与的公开实验。
图片来源|企业供图
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.