如何让无限多个智能体看到同一个世界?RhOS-World:Khora,给出了破局的答案。
上周,X上悄然被一段“世界模型生成的游戏宇宙”刷屏了,甚至还煞有介事地搞起了全球玩家击杀排行榜。
在目前开放的可玩Demo演示里,8个玩家正同处在一个3D空间中。他们不仅能上下楼梯、到处转悠,甚至还能端起武器相互攻击、一枪毙命。乍一看,这画面平平无奇,甚至有点像早期的粗糙独立游戏。
如果你以为这只是个普通的小体量联机游戏,那就大错特错了。真正让硬核极客们在评论区集体炸锅的细节在于——如果用Unity或虚幻等传统游戏引擎来写,8人联机确实是小儿科;但这个3D射击世界背后,根本没有任何一行传统物理引擎的代码!
这8个人看到的所有视角、踩过的每一级台阶、打出的每一颗子弹以及中弹后的倒地反馈,全都是由一个AI世界模型在底层实时“脑补”出来的。
懂行的朋友都知道,以往的世界模型一直被死死困在“单机游戏”的魔咒里。它们只能围着单一观察者转,一旦尝试塞进多个人,AI就会当场精神分裂——要么多视角的物理逻辑彻底崩塌(玩家A看到的墙,玩家B直接穿了过去);要么为了强行对齐画面,算力成本呈指数级暴涨,直接把显卡烧冒烟。
而这个Demo的出现,意味着AI终于跨越了多视角物理一致性的天堑,真正摸到了《头号玩家》里那个绝对同步的共享联机宇宙的门槛。
但如果你以为“不用游戏引擎跑通8个人同屏”就是现阶段AI的极限,那就太小看他们了。
就在大家还在疯狂计算“用纯AI跑这8个人得烧掉多少张显卡”时,背后的技术团队RhOS.ai与Ophilus.AI一起扔出了王炸:RhOS-World: Khora。在这套全新发布的世界模型架构里,玩家数量的上限根本不是8个,而是直接飙到了极度离谱的1024人!
在线试玩:https://ophilus.ai/khora
博客链接:https://rhos.ai/research/khora
01. 场景直击:当1024个智能体同处一个世界
忘掉那些只能单向生成几秒视频,三四个视角的“世界模型”吧。想象这样一个极限测试:成千上万个智能体同时涌入同一个类似《CS:GO》的三维空间中。有人在开火,有人在跳跃,有人在掩体旁来回移动。
![]()
镜头拉近,16个人物在复杂地图中穿梭。上下楼、跳跃、位移——所有的3D空间交互与Z轴高度变化,在每个视角中实现了完美的动作一致性。
![]()
![]()
![]()
不仅仅是在一个简单的房间内行动,而是能在截然不同的复杂场景中自由穿梭,物理规律始终稳定如初。
![]()
这不是预渲染的CG动画,而是一个普通用户可以直接在线操控、实时推演的世界模型物理引擎。
![]()
看着上面这些Demo,如果你了解目前AI世界模型的技术边界,一定会感到头皮发麻。
在这个实时运行的多智能体世界模型中:没有穿模,没有物体凭空消失,没有因为视角的转动而产生任何“赛博幻觉”。无论是Z轴的高度变化,还是复杂的人群移动,所有视角的画面都保持着绝对严苛的空间与物理一致性,甚至是视野范围之外的世界演化,也能毫不费力的持续更新。
为什么这个Demo如此颠覆?
因为在过去一年,世界模型虽然一路狂飙,但它们都被困在一个隐性假设里——“单观察者视角”。只要脱离了单视角预测的舒适区,尝试维护多视角一致性,让哪怕仅仅几个智能体同时进入同一个环境,现存的AI世界模型就会陷入死局:如果强行把多个画面拼接在一起让模型预测,计算复杂度会随着视角数量呈几何级数增长,陷入数学上的“维度诅咒”;如果让视角A学习视角B,一步步用弱因果关系推演下一个视角,只会导致误差无限放大,物理世界全面崩塌。
![]()
如何让无限多个智能体看到同一个世界?这是横亘在所有具身智能和世界模型面前的一道天堑。
而RhOS-World: Khora,今天正式给出了破局的答案。
02. 揭秘幕后:STBoard(时空黑板),让扩展边际成本归零
真正需要扩展的,从来就不应该是“视频流”,而是“观察者”。
世界始终只有一个,不同的视角,只是在不同坐标下观测它。基于这个最简单的第一性原理,RhOS.ai团队在Khora模型中提出了STBoard(时空黑板)架构。
之前的方法在死记硬背不同视角和画面之间的表面对应关系,模型结构天然和“视角数量”死死绑定,加一个视角,模型就得加一堆Attention,很容易崩溃。
Khora呢?它剥离了“视角数量”与“模型结构”的关系。
在这个架构中,RhOS.ai构造了一块存在于模型内部的、所有智能体共享的“物理黑板”STBoard。这块黑板不记录任何像素和画面,它只持续更新维护整个4D世界的绝对物理状态(State)。
当那1024个智能体在世界中疯狂交互时,模型底层只发生极简的两步:
1.写入:每个智能体根据自己的动作,把局部产生的物理变化(如位置偏移、碰撞)“写”入黑板。
2.读取:每个智能体再从黑板上“查”出当前的世界状态和其他人的坐标,渲染出属于自己视角的画面。
智能体之间,完全不需要直接通信!这就意味着,在Inference(推理)阶段,哪怕你再塞进去一万个智能体,模型的底层结构也不用发生一丝一毫的改变。更进一步地,在10个智能体的数据上训练出来的模型能够直接泛化到1024个智能体,无需任何微调!智能体数量,终于从一个令人抓狂的AI结构难题,降维成了纯粹的工程部署问题。
![]()
03. 终局推演:从《CS:GO》的疯狂,到机器人的群体觉醒
为什么要费尽心机,让一个AI引擎去跑通1024个智能体的模拟《CS:GO》?
绝不仅是为了做游戏。这是为了通向真实物理世界的“群体智能(Multi-Agent)”。
如果STBoard能够在极其复杂的虚拟空间中,毫不费力地统摄上千个智能体,让它们在激烈的物理对抗中不崩溃;那么在现实世界里,它的升级版就能完美接管一座无人工厂。
想象一下未来的柔性制造流水线:几十上百台机械臂不再是各自为战的孤岛,它们不需要彼此之间进行海量的延迟通信。它们只需要统一接入STBoard,共享同一套物理时空直觉。
未来,RhOS.ai将更加深入游戏宇宙、仿真环境、驾驶场景,以及真实世界机器人的探索。
![]()
![]()
![]()
![]()
结语
Scale up不彻底,等于不Scale up,这是此时代的AI哲学。
第一视角的具身学习正如火如荼,但落地的彼岸仍有些遥远。RhOS.ai在做好具身的同时,选择先在最简单的物理世界——游戏中做第一个隐式世界模型POC,在保证时空因果的一致、合理的同时,解决多智能体/机器人分布式学习的基本难题。
当真实的机器人可以合格地在真实环境运行而不被kick out时,分布式的飞轮学习将代替冷启动的数采变成主旋律,彼时,共享式的机器人世界模型将是核心。
![]()
![]()
博客链接:https://rhos.ai/research/khora
在线试玩:https://ophilus.ai/khora
更多研究:https://rhos.ai/
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.