一个AI模型在3D开放世界里连续跑了60多个小时,最终得分只有14%。听起来不怎么样,但放在MazeBench这个评测里,这个数字已经是GPT-6 Astra交出的“大分”——而且是在完全禁用Python的赛道上拿到的。
MazeBench到底在考什么
![]()
MazeBench专门针对长程空间推理设计。题目里的谜题往往需要超过100步的操作,还要反复跟不断变化的环境交互。具体来说,这个评测把100颗宝石藏在200多个房间里,智能体得自己旋转视角、搬动箱子、从错误里恢复,再执行可能超过100步的计划。
禁用Python的赛道难度陡增。允许用代码的智能体可以逆向推导物理规则,直接跑求解算法,把完整的空间规划外包给程序。而Astra走的是另一条路:它似乎能把一个长计划“记在脑子里”,不靠Python替它解算环境,自己一步步执行出来。
14%对2%,差距拉到7倍
横向对比更直观。Claude Fable 5.1在同一评测里只拿到2%,Astra的14%是它的7倍。MazeBench的创建者还透露,Astra甚至超过了GPT-5.6 Sol在允许用代码条件下跑出的13%。也就是说,Astra不用Python的成绩,比上一代模型用Python的成绩还高一个百分点。
创建者观察到,Astra经常在批量动作里提前规划10到20步。这种批量处理直接把原本预计30亿token的轨迹压缩到大约3.5亿token,但整个运行仍然持续了超过60个小时。
长计划能扛,真3D还不行
剩下的失败集中在真正的3D谜题上。这说明Astra的进步主要体现在持续规划能力,而不是完整的空间理解。它能长时间维持一个计划并执行下去,但面对需要真正三维空间感知的题目,仍然会卡住。
换句话说,这次14%的含金量不在“空间理解有多强”,而在“不用外部工具也能把长计划扛住”。对关注智能体规划和自主执行的人来说,这个信号比单纯的分数更值得琢磨。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.