网易首页 > 网易号 > 正文 申请入驻

世界模型再迎新突破,兔展智能UniWorld-View登顶WorldScore榜单

0
分享至

AI 生成图片、生成视频已经越来越常见。

真正困难的,不再是 "生成一段内容",而是让 AI 理解真实世界。

例如:

  • 给 AI 一张图片,它能不能推断出照片背后没有拍到的场景?
  • 给 AI 一段视频,它能不能按照指定机位,自然生成新的拍摄视角?

这些问题,正是世界模型希望解决的核心能力。近年来,世界模型也逐渐成为视觉 AI 领域的重要研究方向。



WorldScore 榜单

最近,兔展智能联合北京大学、鹏城实验室研发的 UniWorld-View 登顶李飞飞团队 WorldScore 世界模型榜单(训练数据来自北大系初创企业元空智能),并完成国产昇腾算力适配与代码、权重开源。

官方地址:

https://github.com/PKU-YuanGroup/UniWorld-View

UniWorld-View 尝试回答的,并不是 "如何让 AI 生成一张更漂亮的图片",而是另一个更难的问题:

AI 如何理解没有被拍摄到的世界。

AI 如何 "看到" 没有拍到的世界?

很多人第一次看到 UniWorld-View,会觉得:它像是一个可以 "任意换机位" 的视频生成模型。

事实上,它完成的远不只是视角切换。

你随手拍一段视频,或者只提供一张图片,UniWorld-View 就能够按照指定的相机轨迹,生成新的视角画面。

推、拉、摇、移,甚至绕着场景完成 360° 环绕,都能够保持较好的空间一致性。

更重要的是,无论是单图 3D 生成,还是视频 4D 生成,UniWorld-View 采用的是同一套模型、同一套代码完成不同任务,实现了真正意义上的 "Uni(统一)World-View"。

1、单图新视角合成

























2、动态视频新视角合成





















从一张图片或一段视频,到理解没有拍到的空间

先说为什么这件事难。

所谓新视角合成(Novel View Synthesis),本质上,是让 AI 根据有限的视角,推断没有拍摄到的空间,并生成对应的新画面。

难点在于 “大基线(large-baseline)” 上。

说得简单一点,就是:

只给 AI 看一张正脸,让它推断侧脸,甚至后脑勺应该是什么样子。

对于人来说,这或许并不难。

但对于 AI 而言,它不仅要生成新的内容,还需要保证空间结构、遮挡关系和物体位置保持一致,这也是世界模型研究的重要挑战之一。世界模型的目标正是让 AI 不仅生成内容,还能够学习和预测真实世界中的空间关系与环境变化。

过去,无论是 NeRF、3DGS 等重建路线,还是近年来大量生成式路线,都在尝试解决这个问题。

前者依赖大量、多角度的数据完成三维重建,问题也很明显,可随手拍的单目视频,视角覆盖约等于没有,喂给它们,轻则空洞伪影满天飞,重则直接摆烂;后者虽然敢画,但大多数方法只是把相机位姿当个 “口头指令”(一个抽象的条件向量)塞进扩散模型 —— 没有显式 3D 建模,走两步就飘,转大角度直接失控。

于是,近年来不少研究工作开始先用几何模型把画面撑成 3D 点云,再把目标视角的点云渲染图喂给视频扩散模型当条件,几何归几何,生成归生成,相机控制一下子准了。ViewCrafter、英伟达 GEN3C,走的都是这条路。

但在研发过程中,团队发现,这条技术路线仍然存在一个容易被忽视的问题。

点云渲染为什么容易 "穿帮"?

问题,就出在点云渲染。

点云是一堆孤立的点:既不知道谁跟谁相连,也不知道哪面朝外。

当相机视角变化较小时,这些问题也许并不明显,生成模型还能糊弄过去。

但一旦进入大角度的新视角生成,错误就会迅速放大,渲染图的穿帮主要体现在两个方面。

第一,是前景与背景容易发生撕裂。

深度边界处没有连接信息,视角一变,前景纹理就像口香糖一样被扯到背景上,或者背景像素直接糊到前景脸上。

第二,是背面漏光。

由于点云没有 “面” 的概念,不会自动遮挡。相机绕到物体背后,正面的点会直接透过来,相当于隔着后脑勺,看到了一张脸。

尤其是上了大基线,条件图里全是错误几何信号,扩散模型直接被带偏:结构扭曲、伪影乱飞。

针对这些问题,UniWorld-View 提出遮挡感知点云渲染(Occlusion-aware Point Cloud Rendering)。

第一步,是双重投影(Double-Reprojection),专治撕裂



遮挡感知点云渲染:解决前景背景撕裂

把源画面投影到目标视角,再原路投影回来。

来回一倒腾,凡是 “回不来” 的像素,就是会被遮挡的区域。

把这些区域沿相机轨迹逐帧累积成遮挡 mask,渲染时直接挖掉 —— 该是洞的地方就老老实实留洞,交给生成模型去补,而不是留一堆错误纹理误导它。

第二步:法向过滤,专治背面漏光。


法线过滤点云渲染:解决背面漏光


给每个点估计法向量,和视线方向算个夹角:背对相机的点,直接踢出渲染。

两招下来,条件图里的错误信号清零,剩下的全是可靠几何 + 明确的待补区域。

双分支架构,一个管构图,一个管上色

几何理顺了之后,还有另一个问题。

点云渲染图能够提供准确的空间结构,但纹理细节仍然存在缺失;而原始视频保留了丰富的外观信息,却无法直接对应目标视角。

换句话说,怎么让生成结果既贴合目标视角,又和原视频长得一模一样?

UniWorld-View 的答案是 “双流条件注入”:

几何流”:点云渲染图 + mask,编码后加到潜变量上,负责把生成内容死死钉在 3D 结构上;

外观流”:源视频走新设计的 “Ref-DiT 模块”—— 新视角特征当 Query,源视频特征当 Key/Value 做 cross-attention,让模型自己去原视频里 "翻素材",哪儿缺补哪儿,连点云伪影造成的糊纹理都能顺手修掉。

一个管构图,一个管上色,二者共同作用,使模型在大角度视角变化下,依然能够保持较好的空间一致性与视觉质量。


模型框架图


4D 重建

既然能任意换机位,那多换几个机位,“单目视频不就变成多视角视频了”?

多视角视频一到手,4D 重建(动态 3DGS)就从不可能任务变成了常规操作。

常规生成式方法的相机是 “边走边拍”,空间变换和时间推进耦合在一起,视角在 4D 空间里分布极不均匀。

为进一步保证空间一致性,UniWorld-View 直接把两者解耦,分两步走:

先拍定妆照”:把时间冻结在第一帧,绕场生成一圈静态环绕视图,当整个场景的外观锚点;

再开机拍动态”:在固定机位上生成同步多视角视频,每个机位的第一帧用 “定妆照” 对齐,前景的自遮挡靠迭代生成逐步补全。

最终,生成的多视角视频可以进一步用于 4DGS 优化,实现从单目随手拍到可自由视角漫游的 4D 场景的完整流程。













随着生成式 AI 不断发展,视觉模型已经逐步完成了从 "生成图片" 到 "生成视频" 的演进。

而世界模型关注的,则是进一步理解空间、预测变化,并学习真实世界运行规律。近年来,越来越多研究认为,世界模型有望成为下一阶段通向具身智能、机器人等方向的重要基础能力之一。

Open-Sora Plan,到UniWorld,再到UniWorld-View,兔展智能过去几年一直围绕视觉 AI 底层能力持续迭代。相比单纯提升生成效果,团队更关注统一理解、生成与空间认知能力,这也成为此次 UniWorld-View 探索世界模型的重要基础。

此次兔展智能 UniWorld-View 登顶 WorldScore 榜单,并完成国产昇腾算力适配与代码、权重开源,不仅展示了兔展智能团队在新视角生成方向上的探索成果,也为世界模型相关研究提供了一条新的技术路径。

作为由北京大学校友与北京大学视觉领域青年领军人才联合创立的高科技企业,兔展智能团队将持续围绕视觉空间人工智能开展研究。近期,公司也正将相关能力进一步产品化,推动视觉 AI 从模型走向实际应用。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
再过一年养老真要变天!退了的、上班的、跑外卖的,都给我听两句

再过一年养老真要变天!退了的、上班的、跑外卖的,都给我听两句

朗威谈星座
2026-07-24 09:02:37
年纪大了,行房要坚持“4不要”,尤其是最后1个,可能伤身!

年纪大了,行房要坚持“4不要”,尤其是最后1个,可能伤身!

医学原创故事会
2026-07-21 19:42:04
张柏芝小儿子身世曝光,外界多年猜测落空,最该被谴责的从不是他

张柏芝小儿子身世曝光,外界多年猜测落空,最该被谴责的从不是他

探源历史
2026-07-28 05:28:27
如果王虹、邓煜留在国内高校能获奖吗?网友说:别说拿菲尔兹了,连副教授都评不上,还在为职称、论文、课题、应酬发愁呢!

如果王虹、邓煜留在国内高校能获奖吗?网友说:别说拿菲尔兹了,连副教授都评不上,还在为职称、论文、课题、应酬发愁呢!

黯泉
2026-07-27 10:19:46
日本原计划1956年再次侵略中国

日本原计划1956年再次侵略中国

孝沛与世界
2026-07-27 23:55:45
普京开始“借刀杀人”,三国被点名,俄罗斯这一招不光彩

普京开始“借刀杀人”,三国被点名,俄罗斯这一招不光彩

牛锅巴小钒
2026-07-28 05:10:33
配享太庙!抗击渐冻症7年的蔡磊迎一大好消息,各大官媒同步发文

配享太庙!抗击渐冻症7年的蔡磊迎一大好消息,各大官媒同步发文

云舟史策
2026-07-21 11:30:22
杨幂捂了12年的女儿,近照刷屏全网:怪不得,她不晒...

杨幂捂了12年的女儿,近照刷屏全网:怪不得,她不晒...

陈意小可爱
2026-07-27 17:25:40
深圳新鹏城三连败!体育总监遭炮轰:被小丑毁掉,不懂球的门外汉

深圳新鹏城三连败!体育总监遭炮轰:被小丑毁掉,不懂球的门外汉

奥拜尔
2026-07-27 13:32:40
35岁后90%男人都逃不过这种身材,我靠这3招逆袭成猛男

35岁后90%男人都逃不过这种身材,我靠这3招逆袭成猛男

像素与芯片
2026-07-27 00:15:26
一个人能活多久,多半取决于这七个习惯

一个人能活多久,多半取决于这七个习惯

洞见
2026-07-26 21:34:29
澳门政府发布美素佳儿奶粉铅超标事件最新检测结果

澳门政府发布美素佳儿奶粉铅超标事件最新检测结果

界面新闻
2026-07-27 23:04:41
1982 年,飞行员黄植诚和马红成婚,8 年后她借出国名义在美国失联。安保人员搜查住所,卧室内查获的物件让人震惊

1982 年,飞行员黄植诚和马红成婚,8 年后她借出国名义在美国失联。安保人员搜查住所,卧室内查获的物件让人震惊

磊子讲史
2026-07-15 12:02:40
19点43分立秋!今年是“闭眼秋”,两句农谚讲透天气和收成

19点43分立秋!今年是“闭眼秋”,两句农谚讲透天气和收成

宝哥精彩赛事
2026-07-27 09:04:51
钱再多有啥用?女排教父袁伟民的现状,给所有中老年人提了个醒

钱再多有啥用?女排教父袁伟民的现状,给所有中老年人提了个醒

皮皮电影
2026-07-27 13:35:53
725凯道大游行,蓝营3大佬缺席,洪秀柱亲自揭示为什么没去?

725凯道大游行,蓝营3大佬缺席,洪秀柱亲自揭示为什么没去?

天仙无味小仙女
2026-07-28 03:17:11
罗马诺:切尔西领跑亨德森争夺战,球员本人愿意接受转会

罗马诺:切尔西领跑亨德森争夺战,球员本人愿意接受转会

懂球帝
2026-07-28 01:33:09
1996年,姚文元刑满释放的当天,小心翼翼地问狱警:我能出去了吗

1996年,姚文元刑满释放的当天,小心翼翼地问狱警:我能出去了吗

z千年历史老号
2025-06-17 14:05:17
土耳其暂停优惠比亚迪退置工厂!销量降98%,10亿项目为何卡住?

土耳其暂停优惠比亚迪退置工厂!销量降98%,10亿项目为何卡住?

史之韵
2026-07-25 19:43:49
华为目前“最值得捡漏”的折叠屏,12GB+512GB跳水4000元,且买且珍惜

华为目前“最值得捡漏”的折叠屏,12GB+512GB跳水4000元,且买且珍惜

小愚测评
2026-07-27 23:47:42
2026-07-28 06:35:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13613文章数 142704关注度
往期回顾 全部

科技要闻

长鑫科技上市首日收涨465%,市值3.28万亿

头条要闻

王虹报告现场座无虚席 导师满脸笑意扒窗聆听

头条要闻

王虹报告现场座无虚席 导师满脸笑意扒窗聆听

体育要闻

说过不会再回NBA的男人,又回来了

娱乐要闻

具俊晔零成本拿下大S房产

财经要闻

破产德企如何托起长鑫科技的逆袭之路

汽车要闻

2026宝马摩托车文化节举行 三款新车上市

态度原创

本地
时尚
旅游
教育
公开课

本地新闻

跟着影视去旅行:八仙篇

比勃肯鞋、穆勒鞋还火?今夏时髦精都在穿它,高级又松弛!

旅游要闻

神川铁桥声名远扬,纳西先民扎根坝区,铸就丽江文明根基!

教育要闻

陕西公示拟新增硕士学位授予单位和学位授予点

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版