3月27日,北京中关村创新中心G08厅,150人的会场坐满了政府官员、学界专家和媒体记者。天工AI董事长兼CEO周亚辉站在聚光灯下,第一次系统讲清楚了昆仑万维从2022年all in AGI与AIGC之后,2026年到底要做什么。
答案是一个叫「3+1」的生态架构:底层4个SOTA大模型,中层3大AI原生平台,顶层1个超级智能体。三层合力,目标指向同一件事——让大模型从工具时代,进化到AI Native平台经济体时代。
![]()
而就在这场发布会前9天,3月18日,昆仑万维的视频大模型SkyReels V4刚刚登顶全球权威评测平台Artificial Analysis的「文生视频(含音频)」第一位置,刷新了Google Veo 3.1在内一众海内外视频大模型的SOTA表现。
四个模型,四条战线
「3+1」架构的底座,是四个各自守一条战线的SOTA大模型:
- Matrix-Game 3.0——游戏世界模型,解决世界模型长时序生成的记忆能力,保证不同时刻在同一位置生成内容具有一致性,5B模型在720P分辨率下依然有40FPS的实时生成效果。
- SkyReels V4——视频生成大模型,2026年3月19日登上Artificial Analysis文生视频(含音频)赛道榜首,超越Google Veo 3.1、OpenAI Sora 2,是集全模态音视频联合生成、修复与编辑于一体的大一统基础模型。
- Mureka V9——音乐大模型,依托自研MusiCoT技术链,在段落内文本控制、生成效率、混音质量与整体听感等维度持续进化,让AI音乐从能生成一首歌,进化为能稳定按创作意图完成一首好歌。
- Skywork6.0——即将发布、面向全自研OpenClaw架构打造的Agent原生大模型。
中层是三大AI原生平台:月活跃用户8000万、覆盖170多个国家、三万多部剧集的「AI版奈飞」DramaWave;主打AI版Spotify的Mureka音乐平台;以及可以口述玩游戏、口述DIY游戏的AI版Roblox猫森学园2.0。
顶层那个「1」,是Skywork super Agent。它是三大平台背后通用的操作系统,长远看,也是面向全球所有内容创作者推出的「一人公司的操作系统」。借助自研的Sky claw架构,它把Skills和工具编排深度整合,实现多Agent协同调度,最终做到一句话出成品——出PPT、做内容发布、做海报、做涨粉、做变现。
游戏模型:蓝海里的硬骨头
中关村论坛期间,昆仑万维首席科学家、中国香港中文大学教授成宇用了一小时,详细拆解了这几个模型背后的技术。
游戏模型Matrix-Game 3.0是最佳的切入点。名字容易让人误解,它本质上是一系列物理仿真驱动下的实时交互式世界模型——而实时交互式世界模型,长期被行业公认为多模态模型发展道路上的终极目标。
但这条路布满荆棘。当前的可交互世界模型普遍面临三大痛点:记忆性差,同一位置在不同时间生成的内容自相矛盾,上一秒还在的建筑下一刻凭空消失;泛化能力弱,换个场景、换种光照模型就失灵;实时交互不足,生成速度跟不上操作,玩家走一步要等几秒加载。
Matrix-Game 3.0的进阶来自三个维度的底层突破。第一是工业级的无限数据引擎:基于Unreal Engine 5构建的合成数据生成系统Unreal-Gen,稳定输出Video + Pose + Action数据,结合NavMesh与强化学习的自主探索Agent实现复杂场景高效覆盖,再通过Tick级同步机制实现视觉、位姿与动作的毫秒级对齐。它还打通了GTA5、荒野大镖客2、赛博朋克2077等多款3A游戏,构建跨游戏的自动化数据采集体系。
第二是长时序抗漂移机制。团队在基础模型训练阶段引入Error Buffer机制,显式建模生成结果与真实之间的误差,并将其作为额外条件重新注入模型;同时通过统一的DiT框架,将长期记忆、局部历史帧以及当前预测目标联合建模。
第三是实时推理能力。通过推理优化加速、小步采样、KV Cache缓存机制,以及在decoder端的蒸馏操作,5B参数模型在720P分辨率下生成速度最高可达40FPS。28B大模型则通过第一人称与第三人称分别训练独立高噪声模型、共享统一低噪声模型的设计,兼顾沉浸式体验与资源分配效率。
在这套框架下,AI不再只是生成静态场景或预设动画,而是构建一个具有记忆和推理能力的动态游戏世界,玩家与世界的每一次交互都会被系统记录并影响后续生成内容。这种无剧本的游戏体验,正是行业公认的AI游戏终极形态。
视频之战:在最激烈的战场建立根据地
SkyReels V4登顶,是在全球AI竞争最激烈的主战场上打赢的一场硬碰硬的战役。环顾四周,这个赛道聚集了OpenAI Sora、Google Veo、快手Kling等全球最顶级玩家。
这条赛道有行业公认的四大顽疾:音画分离导致同步失衡,口型对不上台词、动作配不上音效;多模态参考下控制失效,用户想精准控制角色动作、场景变化、镜头语言往往事与愿违;内容生成缺乏叙事逻辑与物理常识,画面流畅却毫无故事性;创作与编辑工具碎片化,商用落地遥遥无期。
行业里绝大多数解决方案都是在原有架构上修修补补。昆仑万维选了一条最难的路:从底层架构重构整个视频生成的逻辑。SkyReels V4是全球首个同时支持多模态输入、联合音视频生成、统一生成/修复/编辑任务的视频生成模型。
它的核心底座是自研的音画一体双流架构。不同于业界先生成画面再匹配音频的传统路径,SkyReels V4采用双分支设计,视频与音频分支共享同一个MLLM文本编码器,从生成起点就实现多模态语义深度融合。初始层用自研双流MMDiT结构保障音画模态精准对齐,后续层切换为单流结构提升计算效率,视频分支通过额外文本交叉注意力强化语义控制,双分支间通过双向交叉注意力实现时序同步,再用RoPE位置编码缩放技术解决音视频时序分辨率的天然差异。
结果是台词口型、动作音效、配乐节奏的毫秒级对齐。在生成效果中,人物运动轨迹流畅自然,落地溅起的雪雾、滑行时带起的粉雪都与实景拍摄无二,雪板摩擦声、破风声也与人物运动轨迹完全吻合。
可控性方面,无论是首帧/首尾帧参考、多图参考、运动参考,还是多帧/网格图参考,SkyReels V4都能实现精准控制。短剧创作者只需提供一组分镜网格图,系统就能一键生成逻辑完整的叙事短片。
更关键的是叙事能力。SkyReels V4引入全模态语义Reward体系实时纠正逻辑偏差与物理错误,用阶梯式课程学习路径让模型从低分辨率短时长的简单任务,逐步升级到商用级复杂叙事任务。参数与成本上,它已实现1080P分辨率、32FPS帧率、15秒时长的商用级突破;通过低分辨率全序列+高分辨率关键帧的生成策略,搭配VSA稀疏注意力机制,计算成本直接降低3倍。
音乐模型:把推理塞进创作里
Mureka V9最大的不同,是把推理能力融入了音乐创作。
过去以Suno为代表的其他模型,创作音乐主要依靠在海量曲库里学习旋律、节奏、人声的组合规律,用户给提示词,模型按规律输出,却不懂自己写下的音符承载着什么。
Mureka V9借助MusiCoT(Music Chain-of-Thought)技术,让模型在拿到提示词之后先完成一套完整的创作思考:这段音乐要表达什么核心情感?歌词段落如何安排?主歌与副歌的结构如何递进?旋律怎样推进才能与歌曲整体的表达氛围、歌词含义相一致?
相比V8版本,V9新增了更细粒度的歌词文本控制能力,能更好理解不同段落中的表达重点、语义重心与演唱意图,适配强调情绪转折、语义推进和关键词落点的创作场景。整体混音质量与音色质感上,V9也做到了人声与伴奏关系更协调,整体听感更清楚。
从游戏世界模型到视频生成,再到音乐创作,昆仑万维这套「3+1」架构的野心,是面向全球五亿内容创作者提供多模态创作服务。战略已经披露,技术拆解也已经摆上台面,剩下的问题只有一个:这套架构能不能撑起那个「一人公司」的设想。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.