2024年8月,谷歌研究团队一段《DOOM》游戏演示视频在业内悄然流传。画面里,玩家扣动扳机后,怪物应声倒下的每一个像素,都不是来自传统游戏引擎,而是模型在毫秒内自行推演的结果。
那声枪响在当时并未引起足够重视,行业聚光灯仍集中在Sora、可灵等离线生成模型上。但两年后,也就是2026年年中,实时视频生成赛道迎来爆发:Anthropic被曝洽谈以约60亿美元收购实时视频生成初创公司Decart;Runway、World Labs、Odyssey等玩家单轮融资两三亿美金成为常态;英伟达、AMD、Adobe、丰田等巨头纷纷出现在各家股东席上。
![]()
资本狂热的背后,一个关键问题浮出水面:实时视频生成的技术路线尚未形成共识,钱该押在哪一边?
三条路线,三种世界入口
当前桌面上的玩家大致分属三条路线。
第一条路线的代表是字节跳动的Seedance、快手的可灵、生数科技的Vidu。它们将替代实拍、剪辑与特效做到极致,不断增加视频清晰度与时长。但这条路只改变了生产方式,视频依然是一段被提前做好、供人观看的成品,观众始终坐在屏幕外面。
第二条路线的玩家试图打破这面墙。World Labs、Odyssey,以及国内的爱诗科技、智象未来,都在往实时流式生成方向走。它们要做的是一个可以实时演化的数字世界:用户可以操控视角、改变环境、用指令让世界长出新的地貌。这把人从观众变成了玩家,但仍需要用户通过键盘、鼠标和Prompt驱动内容生成,进入的门槛依然存在。
第三条路线则更进一步,代表玩家是形界智能的Rise系列。他们管自己叫做全域沉浸式生成(Immersive),这个词恰好是《头号玩家》中绿洲(OASIS)全称的第四个单词。其核心逻辑是:交互的终极形态,不是人去适应模型,而是模型来适应人。用户不需要学习指令,只要通过摄像头,用最自然的动作、表情、姿态,就能进入和影响视频中的世界与交互。
三条路线没有绝对的对错:第一条路线的目标是更好的生产工具,第二条路线通往实时互动的数字世界,第三条路线的野心则是成为更低门槛的世界入口。
成立首月融资数千万,排队投资人已到三轮后
注意到形界智能,不仅因为它是全域沉浸式生成赛道上为数不多的玩家,更因为它的融资进度。这家成立于2026年5月的创业公司,成立首月便完成了数千万元首轮融资。截至今天,成立不到3个月,排队入场的投资人已经等到了两轮乃至三轮后。
投资人的看好逻辑不尽相同。
有人看中的是全域沉浸式生成在内容与游戏方面的潜力。早期国内短视频社区起家靠短视频,走的是内容社区加广告的商业模式;但有了直播,不仅带来了新的流量入口与粉丝粘性,也通过带货、打赏、PK等玩法带来了低成本、高效、稳定的商业转化。AI视频的演进正在复刻同样的路径:当离线生成的画质、时长、一致性一步步逼近商业化临界点,实时就成了下一个必须拿下的要塞。也只有实时,才能诞生更紧密的互动,从而生长出比纯内容生产更广阔的商业模式。
也有人看中的是公司创始人的身份背景以及企业的技术积累。
形界智能的CEO王裕鑫,中科大博士毕业,五年里发了二十多篇顶会论文。他的上一段工作经历中,作为元石科技007号员工,他曾牵头组建国内较早一批MoE架构大模型预训练团队,一度被海外知名AI技术评论人Simon Willison(Django联合创始人)评选为2025年与DeepSeek、MiniMax、智谱、千问和Kimi并列的中国Top6大模型团队。
一定程度上,这是一个已经在大模型战场上证明过自己的技术团队,一头扎进了更新的战场。而几年的创业公司经历,也让王裕鑫比同龄创始人多了几样东西:对产品工程落地的体感、对技术周期的判断力,以及与投资人、客户打交道的经验。
两篇顶会论文,踩中行业两个痛点
2026年初看到沉浸式视频生成的机遇后,几乎没有犹豫,当年5月,王裕鑫就带领一群中科大院长优秀奖获得者、华为天才少年、字节Top Seed、阿里星的顶尖技术人才成立了形界智能,并在当月拿下数千万元天使轮融资。
团队的两项成果Stream-R1与Stream-T1在同期直接登顶Hugging Face每日论文榜前二,连Hugging Face联合创始人与知名AI研究者AK都公开推荐。
这两篇论文踩中了行业的两个痛点:
- Stream-R1从训练侧改造了流式视频的蒸馏过程,让奖励信号参与不同rollout、不同帧和空间区域的训练权重分配;
- Stream-T1则转向推理侧,通过候选搜索、历史噪声传播和记忆管理探索流式视频的Test-Time Scaling。
两者分别从训练和推理两端提高流式生成质量。
技术上的三座大山
在此基础上,形界智能更关注的问题是如何让每个人以更低的交互成本进入一个世界。在王裕鑫看来,要实现这个目标,技术上还需翻过三座大山。
第一,视频流原生输入:视频不用经过独立理解模型再转换成控制指令,可以端到端地实现视频输入视频输出,以实现极低的交互延迟。
第二,理解与生成联合建模:用户输入与生成输出可以在同一时序内共同建模,让模型真正理解用户的意图并实时响应。
第三,也是最具挑战性的一点,如何让模型在极低延迟下保持生成内容的连贯性与物理合理性,这需要从架构层面重新设计流式生成机制。
这三座大山,恰恰也是全域沉浸式生成与离线生成、传统实时流式生成最本质的区别所在。离线生成追求的是单次生成的质量上限,传统实时流式生成追求的是交互响应的速度,而全域沉浸式生成要同时兼顾两者,并且还要让交互方式从指令驱动进化到自然行为驱动。
技术路线仍未形成共识,资本已经提前冲了进来。一张拥挤的牌桌上,坐满了焦虑的投资人、野心勃勃的创业者、新一代技术极客,以及翘首以待的游戏、直播、教育乃至自动驾驶与具身智能行业的玩家。他们都在等一个信号:门什么时候打开,又将被谁打开。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.