8月17日消息,未来图灵获悉,面向全球具身模型开发者的常态化仿真评测平台RoboColiseum正式于8月14日上线。平台由高校、科研机构、开源社区、机器人企业和模型公司等多方联合共建,面向全球高校、科研机构、模型企业与研究者开放,实时更新评测结果。RoboColiseum平台项目负责人吴墨在今日的媒体交流会上说:“我们做这个平台的目的和初衷,就是为全球的科研机构、高校和模型企业的研发者提供一个7×24小时开放的仿真评测平台,帮助模型去验证性能、去做迭代。”
![]()
当前具身智能正处在“模型爆发、标尺缺位”的阶段。模型究竟强在哪、短板是什么,行业内没有一把统一的尺子。RoboColiseum试图回答这个问题:用一套与真机高度一致的仿真环境,让模型在同一标准下比较和改进。
吴墨给出了两个关键数据:“我们经过详细的仿真和真机对比实验,仿真评测和真机的模型表现一致性可以达到89.5%。对于模型成功率的统计,每个任务的差异都小于10%。”他解释,这一结论来自十几个评测任务、每个任务50到100次真机与仿真对照实验的线性拟合对比。平台因此可以作为真机测试前的高置信度筛选工具,帮助开发者缩短“训练—评测—改进—部署”的迭代周期。缩短“训练—评测—改进—部署”的迭代周期。
![]()
仿真环境高度还原真实世界
![]()
![]()
Sim2Real实验对比
平台目前已推出4类能力子榜、78个高保真仿真评测任务,覆盖超过3000个泛化case。四个维度分别是:指令跟随,考察模型能否理解颜色、数量、形状、逻辑等自然语言信息并执行正确动作;空间理解,检验绝对位置、相对关系、堆叠与空间对齐等能力;扰动适应,通过改变背景、光照、材质、机器人初始状态和相机位置,检验模型在非理想环境中的稳定性;通用操作,覆盖开门、倾倒、舀取、上货、分拣、双臂协作等多步骤任务。
![]()
四维评测体系
为什么设计这四个维度?吴墨解释:“我们总结下来,一个机器人在真实世界完成一系列任务,需要具备不同维度的能力。先理解指令,再理解空间关系,在执行中抵抗扰动,最后组合原子技能完成操作。”他还透露,精操作和长程任务是目前多数模型的短板,后续将作为新维度补充进平台。
使用门槛被大幅压缩。传统benchmark需要下载代码、部署环境、适配算力,RoboColiseum把这些环节封装成自动化服务。吴墨说:“注册到提交最快5分钟,最快30分钟完成仿真评测。模型代码和权重无需上传,只需在本地部署推理服务并接入标准接口。”平台还支持通过AI对话完成数据下载、模型训练和评测提交,进一步降低使用门槛。
![]()
5 分钟提交注册,30 分钟获得评测结果
公平性如何保障?吴墨回应了行业对刷榜的担忧:“仿真训练集和评测集完全隔离,每个任务做充分泛化,杜绝轨迹回放或指定轨迹的方式。平台还会对模型输出的轨迹做校验,并做链路一致性优化,对每个任务评测多次取平均结果。”他补充,所有提交和评测过程实时公开,平台不参与任何分数修改。
平台已提供ACoT-VLA、π0、π0.5、GR00T等国际具身基座模型的基线成绩和训练代码、权重,开发者可自行复现核验。针对不同用户群体,吴墨表示高校可以获得免费算力和低门槛上手方式,大模型公司可以拿到统一标准做横向对标。
RoboColiseum的名称源自古罗马圆形竞技场。吴墨说,平台希望成为“公开、中立、谁都可以登台的竞技场”,同时也是开发者反复测试、定位短板的“训练场”。
具身行业为何迟迟没有统一评测标准,原因在于行业和模型发展太快,很多基准推出后不更新;真机评测成本高、效率低,大部分基准只能做仿真,但仿真与真机的gap又大。RoboColiseum正是针对这两个痛点设计:评测维度持续更新,并用89.5%的一致性数据建立可信度。RoboColiseum的目标,是成为行业内比较权威的基准,让大家有一个统一的标准,真正能快速迭代算法。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.