过去一年,3D生成赛道最热闹的叙事是"单资产生成"——输入一张图,输出一个可以旋转的模型。但影眸Hyper3D这次发布的世界生成模型WorldGen,把这件事往前推了一大步:不是生成一个孤立的物体,而是直接交付一个可交互、可编辑的完整3D场景。
上传一张场景图,2到3分钟后,你拿到的不再是"一张图+一个模型",而是一整套场景——里面的每件资产都保留物理属性,可以直接拖进Unity、Unreal Engine这类引擎里做二次创作。换句话说,它跳过了"先生成单个资产、再人工拼装"的中间环节。
![]()
从单资产到场景,卡在哪了?
传统3D生成的做法,是把整个场景当作一个模型来生成。问题在于,所有内容容易被合并成一个不可拆解的整体,场景生成完就"焊死"了,没法继续用。影眸团队换了个思路:把场景拆解成可单独操作的资产,同时保留它们之间的空间关系和物理关系。
这个技术基座来自SIGGRAPH 2025最佳论文CAST。它通过对象拆解、遮挡补全、空间放置、物理纠错四步完成场景重建,和谷歌、Meta的论文同期获奖。但论文到产品之间还有一道坎——多模块串联时的错误累计问题。影眸团队花了近一年时间解决这个问题,才让WorldGen达到能进生产管线的形态。
四个方向已经跑起来了
WorldGen不是停留在演示阶段。文章里提到了四个已经验证过的应用场景:
- 具身智能:与地瓜机器人、谋先飞形成闭环方案,机器人训练需要的场景可以直接生成
- 游戏:与Unity中国合作打通工程闭环,场景生成后能直接进引擎用
- 影视:结合Seedance 2.5实现镜头调度与风格生成
- XR:适配空间计算与沉浸体验场景
这几个方向有个共同点:都需要"可编辑的场景"而不是"静态的模型"。游戏要改关卡,影视要调机位,机器人要换障碍物位置——这些需求,单资产生成满足不了。
世界模型,为什么选3D当载体?
现在行业里谈"世界模型",大多指向视频生成——输入一段文字,输出一段视频。但影眸的理解不太一样:真正的世界模型需要某种载体来承载世界的外观与属性,而影眸选择的载体是3D。
这个选择背后的逻辑是:视频生成的世界模型,输出的是像素;而3D世界模型,输出的是带物理属性的资产。前者适合"看",后者适合"用"。WorldGen的定位显然是后者——不是生成一个只能观看的世界,而是交付可交互、可编辑、可进入真实生产环境的3D场景。
从单资产到完整场景,这一步跨过去之后,3D生成才真正从"玩具"变成了"工具"。至于场景级生成能不能成为下一个标配,就看这四类应用场景里,哪个先跑出规模了。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.