9月8日消息,据彭博社报道,字节跳动正在开发一款用于实时空间视频生成的AI模型,创始人张一鸣亲自监督这项工作,最早可能下个月就会推出。
报道援引了不愿透露姓名的知情人士的话。
其中一位人士提醒说,具体时间尚未确定,计划可能会有所变动。TNW尚未独立核实该说法,字节跳动发言人也未回复彭博社的置评请求。
该模型将基于字节跳动现有的视频生成系统 Seedance 构建,使用户能够创建用于直播、短剧和游戏的交互式虚拟世界。
报道中的规格说明才是最有趣的部分:按需视频的帧率约为每秒 20 帧,延迟约为 0.05 秒,视频在云端生成,而不是在设备上生成。
最后一个细节就是策略。远程渲染空间内容可以减轻头显的计算负担,从而降低硬件的处理能力,进而降低成本。
字节跳动旗下拥有 Pico,这是其扩展现实部门,据报道,该模型旨在生成能够对 Pico 用户的声音和动作做出反应的世界。
如果成功,XR 领域的竞争将从硬件规格转向模型、云容量和内容分发,而这三方面字节跳动已经拥有。
这一切并非凭空而来。36氪今年早些时候报道称,字节跳动已为2026年设定了四大人工智能发展重点,其中世界模型位列榜首,其次是保持世代视频在视频领域的领先地位、改进代码以及实现豆宝的商业化。
据称,全球车型占据了该公司所有车型方向中最大的数据预算,金额高达八位数人民币,36氪的消息人士称,这笔钱是竞争对手支出的三到四倍。
同一份报告明确设定了目标:在年底前发布至少一个世界模型,并将其与 谷歌的 Genie进行比较,Genie 现在允许用户在实时渲染的街景图像中漫步。
2026年初的内部测试显示,字节跳动在同一方面仍落后全球最先进水平约10%。如果下个月发布,则比原计划提前了。
据 36Kr 报道,该公司正在同时推进两条路线:一是面向具身智能和机器人的视觉-语言-动作方法,二是面向娱乐和游戏的 3D 模拟。
空间视频模型属于第二种,这种模型也已经拥有了一定的用户基础。
世界模型,就目前大家所使用的意义上而言,是一个能够充分学习环境行为方式,从而渲染出一个能够对用户在其中的操作做出连贯响应的环境的系统。
视频公司之所以不断涌现于这个领域,是因为培训材料本身就是视频,而那些拥有最多视频素材,并且最有经验将其压缩成快速渲染格式的公司,则拥有一个独特的优势。字节跳动花了十年时间,为了一个不同的目的,打造了类似的流程。
彭博社认为,张的参与使他与李飞飞和闫乐存等研究人员并肩而立,这些研究人员认为,基于视觉和物理理解(而不是仅仅基于语言)的模型才是能够在现实世界中行动的系统的道路。
目前,一些以娱乐产品为主要产品的公司正在对这种案例进行商业测试。
资金实力毋庸置疑。据彭博社报道,字节跳动上周获得了300亿美元的贷款,并且一直在考虑斥资高达700亿美元用于人工智能领域的建设。
Seedance 已经为 CapCut 和豆宝提供了技术支持,而且就其国内市场而言,该公司仍然是阿里巴巴、DeepSeek 和 Moonshot AI 的有力竞争者。
对 Meta 和苹果来说,这种影响并非立竿见影,而是令人尴尬。两家公司都在头戴式设备领域投入巨资,但这些设备并未成为主流。此外,欧洲本土的 XR 专家也一直依靠高端硬件 而非数据中心提供的廉价设备来发展业务。
云端渲染的世界模型在保真度上并不能胜过 Vision Pro。它只是把保真度的问题留给了其他人。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.