![]()
![]()
根据彭博社报道,字节跳动正在研发一款面向实时空间场景的交互式视频生成模型,最快可能于10月发布。项目由字节最高决策层直接协调跨部门资源与算力。
模型基于Seedance视频生成架构构建,支持接收用户的语音与动作输入并实时生成虚拟环境;生成主要依托云端集群,目标帧率为每秒20帧,生成延迟约0.05秒;初步应用场景指向直播、短剧和轻量游戏,并将与PICO头显联动。
模型底座的呼之欲出与PICO近期的密集调整形成了呼应。
7月21日,PICO创始人周宏伟因个人规划卸任并离开公司,由李晓凯接任业务负责人。李晓凯本科毕业于浙江大学,拥有耶鲁大学光电材料与器件博士学位,长期参与PICO核心技术与产品研发,重点涉及光学显示、专用芯片和空间感知。
8月24日,PICO官方宣布将原定9月2日发布的旗舰设备PICO Space Pro延后至第四季度,其延期正是为了与新的实时生成模型协同发布。作为李晓凯治下的首款关键硬件,PICO Space Pro是PICO从传统VR迈向MR空间计算的转型之作,不仅搭载了字节自研的底层协处理芯片与双目超清VST彩色透视系统,还可能采用外接计算或电池模块的分体式构型以降低面部负载。
![]()
结合字节在音视频生成、多模态交互、自研芯片和云计算等领域的投入,这家公司正在尝试把过去依赖预先制作和离线分发的内容机制,推进为由模型即时计算、持续响应用户的空间模拟系统。
![]()
两条路线的汇流
技术底座的演进,最直观地投射在视频生成管线的迭代节奏上。
2025年4月,字节研究团队公布Seaweed-7B;6月,Seedance 1.0正式面世,在多镜头叙事、主体一致性与复杂运动捕捉上实现显著突破。2026年2月,Seedance 2.0进一步将文本、图像、音频与视频统一置于同一生成框架下,发布后迅速登顶Artificial Analysis视频生成总榜;7月迭代的Seedance 2.5,则将单次音视频生成时长拉升至30秒,全面支持多轮叙事与局部精准编辑。
但从生成视频跃迁至生成世界,单靠Seedance远不足够。视频生成的本质是在有限时长内维持像素级拟真与主体连贯;世界模型的核心,则是在开放时空中维系空间几何拓扑、因果链条与交互状态记忆,并能随物理输入即时推演下一个时空切片。
为了拼全这块拼图,字节在过去一年系统性重组了视觉生成、多模态与物理仿真的研发谱系。
在这张复杂的协同网络里,除统揽全局的周畅之外,曾妍扮演着极为关键的角色。她主导的 Seedance 管线聚焦于时空连续与渲染生成,与范浩奇的研发方向分工协作、互为支撑。
曾妍:攻克时空连续与视觉生成的极限
曾妍出生于1997年,是字节最年轻的4-2之一。她本科毕业于西安交通大学,随后在加拿大蒙特利尔大学获得计算机硕士学位。2021年9月,她以校招算法工程师身份加入字节 AI Lab,自入职起便将核心研究靶心锚定在多模态预训练与视频生成的前沿领域。
![]()
作为 Seedance 管线的核心操盘手,曾妍早年在字节深耕视觉大模型。2023年,她以第一作者身份提出 PixelDance,首次通过“首尾帧+文本”联合引导机制,迫使模型学会解构并合成两组视觉状态间的连贯运动轨迹。
彼时字节内部视频团队尚处双线赛马状态:曾妍团队推进 PixelDance,另一支团队深耕 Seaweed。2024年末,曾妍率队并入 Seed 部门,双线力量终告汇流;底层骨干网亦全面由传统 UNet 转向更利于吞吐海量算力与数据的 DiT 架构,Seedance 管线由此定型。
此后,曾妍全面主导了 Seedance 2.0 的预训练。2025年末,面对模型参数是否激进突破2000亿的内部路线分歧,她顶住保守派压力力推规模扩张,锁定核心卡力与高质量数据。Seedance 2.0 在复杂多模态理解与多主体物理交互上的跃升,再次验证了 Scaling Law 在扩散架构上的适用性。
凭借在 Seedance 系列战役中的关键战功, 曾妍在一年内完成从 3-2 到 4-2 的二连跳 (对应新职级体系 L7 核心骨干/权威技术专家层级),从 2021 年校招生入职到跻身战略核心技术层级仅耗时不到五年,成为字节技术谱系中最年轻的核心操盘手之一。
在整个世界模型的拼图里,曾妍团队解决的是世界模型的“表象生成”——画面是否写实、运镜是否符合感知惯性、多模态信号能否稳定推演后续像素。这奠定了实时世界模型最底层的视觉渲染与短程时间预测基座。
范浩奇:构筑3D拓扑与环境记忆的骨架
范浩奇所锚定的,则是更偏底层的几何空间建模。
范浩奇曾供职Meta FAIR实验室近七年,与何恺明等学者深度合作,参与开创了MoCo、SlowFast及时空掩码自编码器(VideoMAE)等里程碑式CV研究。2023年入职字节后,他主导推出了原生多模态模型BAGEL,依托大规模图文交错及视频流训练,验证了未来帧推演、三维空间操纵、跨视点切换及虚拟导航等初步能力。
![]()
2026年春节后,Seed正式新设世界模型研究组,由范浩奇领军并向周畅汇报。综合《智能涌现》等信源,该团队选定3D仿真路线,初期破局点对准强交互的数字娱乐与轻量游戏。这条路径直面世界模型最严苛的本质难题:空间拓扑一致性、环境状态记忆与物理交互闭环。
与此并行,原本由李航(偏重仿真数据推演)与王文千(侧重自然物理数据)分头领衔的两支VLA(视觉-语言-动作)团队,亦在此轮整合中整编并入周畅体系,试图贯通视觉、语言与物理动作指令;后续归入的Seed Robotics,则负责将这些空间感知与控制策略顺滑延展至实体终端。
从组织架构来看,字节已完成实时世界模型拼图的集结:Seedance输出高帧率、低延迟的视觉流,范浩奇团队搭建3D空间结构与状态记忆中枢,VLA与Robotics团队提供跨模态动作响应机制。
然而,这并不等同于技术管线的无缝啮合。目前可能的技术架构,是由Seedance承担端到端的超低延迟画面流渲染,由世界模型在后台维护几何坐标、空间拓扑与长效状态记忆,最后实时接入头显等终端的多维感知信号。
![]()
云端生成与终端补偿的工程权衡
在整套交互链路中,XR头显不再只是单纯的显示媒介,而是承载高维物理信号的双向感知枢纽。
传统移动终端的交互依赖触摸、文本与语音等离散输入;XR设备则能在毫秒级尺度上,持续捕获头部6DoF位姿、手势运动及三维空间拓扑。若进一步集成眼动追踪,设备还能实时截获注视点数据。这些连续的时空物理信号,既构成了驱动生成模型的动态输入变量,也沉淀为模型持续对齐物理规律的高质量强化学习反馈。不过,鉴于PICO Space Pro尚未公开全套传感器阵列规格,其具体硬件感知上限仍有待官方验证。
将重载生成任务锚定在云端,是当前算力约束下的必然工程妥协。实时空间世界模型对算力峰值、高并发显存带宽及功耗的极端要求,远超轻薄化头显的物理承载极限;此外,处于高频算法迭代期的庞大参数模型,也必须依赖数据中心以实现集中调度与无缝版本热更新。
然而,云端协同不可避免地踩中了延迟与带宽的“物理红线”。
20 FPS的生成速率,意味着相邻帧之间存在约50毫秒的时钟间隔。彭博社披露的“0.05秒延迟”未标明具体测试工况——它更可能仅指代云端单帧推理延时或稳态输出节奏,绝不能将其直接代换为从用户体感动作到屏幕最终成像的“端到端全链路时延”,更无法与XR核心的动显延迟(Motion-to-Photon, MTP)画等号。
真实的物理闭环横跨传感器采样滤波、位姿外推预测、网络上行封包、云端推理推演、超高清编码压缩、下行推流分发、本地解码、画面重投影到最终面板点亮的完整链路。
XR行业通常将MTP延迟严格压制在20毫秒以内,以规避人眼前庭系统与视觉信号不匹配所诱发的晕动症(Simulator Sickness)。尽管实际眩晕感会因刷新率平滑度、运动剧烈程度及算法预测补偿而呈现个体差异,20至30毫秒并非绝对的生理死线,但云端数十毫秒的固有延迟一旦未经处理直接投射至眼眸,足以撕裂交互的沉浸感。
这也解释了PICO为何必须在终端算力与自研芯片上双线筑墙。
2025年11月,字节跳动技术副总裁杨震原首度公开了PICO自研头显芯片的攻坚节点:该芯片于2022年6月立项、2024年流片回片并推进至量产阶段,主要承担高频SLAM空间定位、运动状态估计、图像画质增强及超低时延逆畸变处理。
杨震原当时提及该系统实测延迟可下探至12毫秒。尽管这一指标的具体测试链条并未完全对外解构,不能与整机端到端MTP简单画等号,亦无从验证其是否已在工程层面与尚未公布的云端生成模型完全打通,但软硬件协同的底层架构已清晰成型:
云端模型负责宏观时空演进与环境生成,本地端侧 算力 则接管高频姿态解算、轨迹外推与异步时间扭曲( ATW /ASW)重投影。
即使因网络抖动或算力瓶颈导致云端生成帧出现短暂顿挫,终端自研芯片仍能依据用户瞬时头部姿态实时偏转现有帧缓冲,确保视线所及的画面在物理空间内严丝合缝。
至此,这套协同架构完成了清晰的工程角色定格:云端负责计算“世界发生了什么”,终端则负责让这个被计算出来的世界,严密跟得上人类肉体的节拍。
![]()
世界生成之后
过去两年,字节在数据中心、AI芯片、网络基础设施和算力采购上的投入持续增长。
9月初,字节已经从近30家银行获得约296亿美元贷款。贷款的名义用途是一般公司用途,但消息人士称,其中很大一部分将服务于AI投资,包括芯片采购和海外数据中心建设。市场还曾传出字节考虑将2026年资本开支提高至最高700亿美元。
过去十几年,字节最擅长的是预测用户下一条想看什么。现在,它想把这种能力再向前推一步——直接生成用户下一刻将进入的世界。
这也是世界模型必须与PICO捆绑出现的原因。单有模型,它很容易沦为效率更高的视频渲染器;单做头显,PICO又始终受困于XR生态旷日持久的内容荒漠。字节真正瞄准的,是一个自我咬合的飞轮: 用模型粉碎空间内容的生产门槛,用内容赋予硬件留存价值,再借由硬件捕捉的连续语音与物理交互,反哺回底层模型的迭代。
眼下,视频生成、3D仿真、VLA、具身智能、云端算力与PICO硬件已被推上了同一张牌桌。但组织形态的合流,从来不等于产品逻辑的跑通。真正的临界点,不是这个虚拟世界能否以20帧的速率流转,而是它能否沉淀用户的选择、持续咬合物理反馈,并让人找到第二天清晨再次戴上头显的理由。
10月的模型更新与第四季度的PICO Space Pro,注定只能交出半张答卷。
剩下的真正悬念在于:当数字世界可以被即时计算、实时生成,字节推开的到底是一种定义未来的全新交互媒介,还是一段造价更昂贵、感官更沉浸的“高清视频”?
![]()
![]()
![]()
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.