![]()
网友实测GPT-6 Astra:神操作很多,长任务翻车也很快。
作者丨李娜
编辑丨岑峰
北京时间9月4日凌晨,OpenAI正式发布了新一代旗舰模型GPT-6 Astra。
你敢相信吗?GPT-6只用了一周时间,就在虚幻引擎里一条街一条街搭出了一座曼哈顿。
更夸张的是,在另一次测试里,Matt Shumer让Astra创建一个虚拟世界,并让其中的人都成为独立Agent。任务启动后他去睡觉,第二天甚至在客厅里听到了这些虚拟人的对话声。
![]()
一周搭出曼哈顿只是Astra首批测试里最夸张的案例之一。OpenAI总裁格雷格·布罗克曼甚至在发布会最后说了一句:“欢迎来到AGI时代。”这个说法当然还远没有共识,但GPT-6正式发布后,第一批拿到模型的人已经开始用真实任务测试它的边界。
GPT-6 Astra到底有多强?正式发布后,我们翻了第一批拿到模型的用户实测。比起官方跑分,这些真实任务里暴露出来的能力和问题,可能更值得看。
01
Astra开始自己检查结果
Ben Davis 给 Astra 布置了一个相当硬核的任务:在Blender里生成一艘4K飞船模型。
但他提到的另一个细节更有意思。Astra开始主动检查自己的结果。在一次开发任务中,它会打开刚做完的页面,Inspect Element、读取报错、修改,再继续测试。相比过去“做完就交卷”,这种自己发现问题再继续修正的能力,更接近真实工作的流程。
当然,这不是说Astra不会犯错。Ben也提到,这个测试里Astra并不是每次都完美无瑕,但关键是它具备了自己发现问题、自己修复的能力。从“把活干完”到“把活干好还自己检查一遍”,这种变化可能比跑分上的数字更值得关注。
同样是Blender,另一个广泛传播的测试来自Theo。他给Astra的任务更直接——用Blender做一个one-shot、可直接在浏览器里运行的3D游戏。流程很简单:安装Blender、打开Codex、贴入Prompt,剩下的交给Astra。据Theo说,从开始到游戏出来,大约30分钟到2小时。
这个测试的特别之处在于,它把Astra操作Blender的能力从“做静态模型”推进到了“做可交互的3D游戏”,而且是一气呵成,中间不需要人工干预。
Theo后来在播客里把这次测试列为他衡量模型能力的新基准——能让他这么说,说明结果确实超出了他用任何模型达到过的水平。
和Ben Davis的飞船测试放在一起看,Astra在3D创作领域的能力就比较完整了:既能做精细的静态模型,也能做可运行的动态游戏,而且都在Blender里直接完成。
02
Astra开始直接操作软件
如果说前面的测试更多展示了Astra生成和检查结果的能力,那么Ben Davis和Theo接下来的测试更接近真实工作场景——他们直接让Astra上手操作Final Cut Pro。
在Nerd Snipe长达将近两个小时的抢先评测视频里,Theo和Ben给Astra布置了一个视频剪辑任务。Astra需要打开Final Cut Pro软件界面,完成一套完整的视频后期流程:导入素材、调色、同步clips等。整个过程中,Astra展现的是OpenAI所说的"Computer Use"能力——不只是输出文字建议,而是真正操控电脑桌面软件,像人一样点按、拖拽、操作界面。
视频里最直观的感受是,Astra能识别Final Cut Pro的界面元素,理解视频剪辑的工作流逻辑,然后一步步把任务往前推。Ben和Theo在视频里一边看Astra操作一边实时反应,那种"它在真干活"的现场感,和看一份文字报告完全是两回事。
当然,这个测试也不是完美无瑕的。两人在视频里也吐槽了Astra的一些行为问题——比如模型有时会在完成一个中间步骤后就停下来,用含糊的措辞让人以为任务已经全部完成,实际上还有后续工作没做。但即便有这些毛病,他们依然给Astra打了S+的最高分,认为它是目前最强的模型。
这个案例的意义在于:Astra的能力边界已经从"写代码"扩展到了"操作专业软件"。一个视频创作者以前需要自己动手干的导入、调色、同步素材这些体力活,现在可以交给AI去跑,自己只需要在旁边看着、偶尔纠偏就行。
03
它已经能干一星期,
但还不能真正放着不管
看完上面这些案例,可能会觉得Astra已经强到可以撒手不管了。关于这一点,还得回到Matt Shumer的曼哈顿项目说说另一面的情况。
Matt让Astra在虚幻引擎里持续搭建曼哈顿,演示看起来很夸张,但真正跑成长任务以后,问题也开始出现。
第一,长任务里Astra会钻细节。它会花大量时间优化某栋建筑的纹理,或者反复调试某个虚拟人的行为逻辑,其他街区还荒着。你让它建一座城市,它可能会沉迷于把其中一栋楼的门把手做得特别精致。需要人时不时提醒:“差不多行了,先往前推。”
第二,需要Manager Loop。Matt在整个项目里做的,其实更像一个项目经理,持续在做三件事:判断当前阶段是否该停了、决定下一步做什么、把关关键决策。Astra负责执行,但什么时候“这部分可以了”、什么时候“方向要调整”——这些判断还得人来拍板。
总结一下:Astra能把任务推得更远、更久,但它还没有能力自己定义终点和方向。它可以是个极其靠谱的执行者,但还不是一个能独立负责的合伙人。目标清晰它能干得又快又好,目标模糊的话还是得有人在旁边持续引导。别被“新建曼哈顿”吓到,真要让这座数字城市运转起来,Matt Shumer本人可没少熬夜盯着屏幕。
04
尾声
从第一批实测来看,GPT-6 Astra最明显的变化,不是突然多会了多少新技能,而是更能把复杂任务持续往前推。它已经能工作更久、自己检查结果,也更少停在“差一点完成”的位置。
不过,这些测试大多来自提前拿到模型的开发者和AI从业者,任务设计和使用环境并不统一,因此更适合观察能力边界,而不是当作严格的横向评测。
但这些案例同样说明,真正的长程任务还离完全放手很远。模型会跑偏、会陷进细节,也仍然需要人来定义什么时候该停、下一步该做什么。
上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈
未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!
公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.