网易首页 > 网易号 > 正文 申请入驻

GPT-6 Astra得分99.9%,OpenAI宣布AGI来临,但换个考场成绩就打了六折,奥尔特曼两天前刚说AGI是营销术语

0
分享至


追求AGI(通用人工智能)长达11年后,OpenAI宣布“AGI实现了”。

当地时间9月3日,OpenAI发布的新一代旗舰模型GPT-6 Astra在AI通用学习能力ARC-AGI-3测试中,最高取得99.9%的成绩。

OpenAI联合创始人兼总裁格雷格·布罗克曼(Greg Brockman)随即宣布:欢迎来到AGI时代。

然而,99.9%的成绩背后隐藏着一个关键细节:如果换成统一的测试环境,得分就从99.9%骤降至62.7%。

过去11年,OpenAI内部对AGI的定义反复变化,首席执行官山姆·奥尔特曼甚至在几天前刚刚表示,AGI是一个营销术语。

在收入、估值和IPO速度被Anthropic全面超越的背景下,OpenAI总裁此时高调宣布AGI,究竟是技术跃迁,还是营销造势?

GPT-6 Astra操纵电脑完成excel比赛(4倍速)视频来源:OpenAI

99.9%还是62.7%?GPT-6 Astra的AGI成绩单出现两个结果

OpenAI称GPT-6 Astra为其迄今“最智能、最对齐”的模型。

与此前版本相比,GPT-6 Astra的能力提升已经不再局限于聊天、写代码等单一任务,而是进一步进入计算机操作、软件工程、专业工作和网络安全等复杂场景。

OpenAI公布的数据显示,电脑操作能力测试中,GPT-6 Astra得分达到72.6%,高于上一代GPT-5.6 Sol的65.7%;在专业工作自动化测试中,得分从18.1%大幅升至41.4%;在Terminal-Bench 4.0中,GPT-6 Astra得分57.9%,超过Anthropic的Claude Fable 5.1。

网络安全能力的跃升更加明显。

GPT-6 Astra在ExploitBench中获得100%的成绩,并成为OpenAI首个达到其Preparedness Framework中网络安全能力“关键”级别的模型。

OpenAI表示,在获得相应工具和权限后,GPT-6 Astra能够自主寻找此前未知的安全漏洞,并开发新的利用方式,而不再需要人类逐步指导。


ExploitBench 图片来源:OpenAI

但在所有成绩中,最引人关注的还是ARC-AGI-3测试。

与数学、代码或知识问答不同,ARC-AGI-3测试的核心是AI在面对一个此前从未见过的环境,能否通过探索、交互和试错,自行理解规则、发现目标并解决问题。

简单来说,它测试的是AI能否“自己学会怎么办”。

此次测试中,GPT-5.6 Sol的成绩只有7.8%,GPT-6 Astra最高则达到99.9%。测试机构ARC Prize Foundation表示,GPT-6 Astra在96%的测试关卡中使用的行动次数少于受测人类的中位数,行动效率已经达到甚至超过人类基准。


ARC-AGI-3 图片来源:OpenAI

也正是这项测试,让布罗克曼认为GPT-6 Astra达到了AGI。

不过,GPT-6 Astra的AGI测试成绩中也有明显矛盾。

GPT-6 Astra得分99.9%的测试环境,主要来自Provider Adapter(供给适配层)框架。在这一模式下,GPT-6 Astra能够使用OpenAI专门设计的上下文管理机制,在连续操作之间保留内部推理状态,并对超长对话进行压缩,从而更充分地发挥模型能力,相当于给GPT-6 Astra的测试“开小灶”。

而在所有模型使用统一、中立的Standard Harness环境中,GPT-6 Astra的得分仅为62.7%。

测试机构认为,未来真正的AGI应该能够在统一测试环境下解决ARC-AGI-3。


ARC-AGI-3 图片来源:ARC Prize Foundation

在第三方机构Artificial Analysis的“智能指数4.1.1”测试中,GPT-6 Astra得分61.2,仅略高于GPT-5.6 Sol的60.9,低于Claude Fable 5.1的65.7和Claude Opus 5的63.1。

OpenAI至少5次修改AGI定义:超过人类、创造1000亿美元利润、营销术语……

2002年,DeepMind联合创始人Shane Legg提出AGI后,这一概念逐渐进入AI研究的主流语境。

过去几十年,AI已经在国际象棋、围棋、图像识别、数学和编程等单项能力上多次超过人类,但这并不意味着机器拥有通用智能。

真正的AGI,关键在于“general”(通用)。

因此,一批研究者提出,判断AGI至少需要同时考虑能力强度和能力广度,自主性则是另一项需要单独衡量的维度。

ARC测试创造者François Chollet则认为,真正重要的并不是AI已经掌握多少技能。真正应该衡量的,是一个系统面对陌生任务时,以多高效率获得新技能的能力——也就是泛化和学习能力。

但在OpenAI内部,AGI的定义不断变化。


图片来源:AI

2015年底,OpenAI创立。山姆·奥尔特曼回忆称:“之所以那时候创办OpenAI,是因为我们相信AGI可能会实现。”于是,OpenAI将公司的使命概括为“确保AGI造福全人类”,直到今天也没改变。

2018年,OpenAI在《章程》中给出了最著名的定义版本:AGI是在大多数具有经济价值的工作上超过人类的高度自主系统。

2023年,OpenAI又将AGI概括为“总体上比人类更聪明的AI系统”。这一表述更加宏大,却也更难衡量——什么叫“总体上更聪明”,没有明确的验收标准。

2024年,OpenAI发布o1推理模型。当时,OpenAI员工Vahid Kazemi在X上发文:“我们已经实现了AGI”。他定义的AGI是“比大多数人在大多数任务上做得更好”。

同年,OpenAI试图将通往AGI的道路拆成五个等级:聊天、推理、行动、发明创新、组织工作。

但AGI在OpenAI内部逐渐从一个技术概念,有了明确的经济门槛。

2023年,微软对OpenAI追加100亿美元融资协议规定,只有当OpenAI开发出的AI系统能够产生至少1000亿美元利润时,才被视为达到AGI门槛。

不过,2025年微软与OpenAI重新调整合作协议,并规定OpenAI宣布实现AGI后,需要经过独立专家小组验证。2026年4月,双方再次修改协议,取消了此前与AGI挂钩的重要合同安排。

在GPT-6 Astra发布会上,布罗克曼说,“已经没有合同意义上的AGI触发条款了。”在他看来,AGI已从合同义务变成“使命概念或精神概念”。

山姆·奥尔特曼本人对AGI的态度和预期也在不断变化。

2024年底,他一度认为AGI可能比外界预期更早到来。不到一年后,他又说什么是AGI并不重要。今年8月26日,他接受采访明确表示,OpenAI还没有达到AGI。

就在GPT-6 Astra发布的两天前的9月1日,奥尔特曼公开表示:“充其量,你可以说AGI是一个定义非常糟糕的术语。我本来想说,它就像一个无关紧要的营销术语。”

OpenAI的商业焦虑:急于给GPT-6 Astra贴上AGI标签

不存在公认标准、没有了合同约束,为什么OpenAI偏偏选择在这时宣布“AGI来了”?

过去几年,OpenAI仍然拥有ChatGPT这一全球最具影响力的AI产品,但在商业价值更高的企业市场,竞争格局已经发生明显变化。

风投机构Menlo Ventures的调查显示,2023年,OpenAI一度占据约50%的企业大模型支出,Anthropic仅为12%;到2025年,Anthropic的份额已经升至40%,OpenAI则降至27%。

在编程这一AI最重要的商业化场景之一,Anthropic的优势更加明显:市场份额约54%,OpenAI约21%。Claude Code的流行成为Anthropic快速增长的重要推动力。

进入2026年,竞争压力进一步反映到收入和估值上。

7月底,Anthropic的ARR已经超过650亿美元,相比2025年底约90亿美元增长超过6倍;OpenAI ARR接近600亿美元。今年5月,Anthropic完成650亿美元融资后,估值达到9650亿美元,也超过OpenAI此前的估值。



英国《金融时报》甚至将GPT-6 Astra的发布视为OpenAI重新超越Anthropic的一次反击。

据媒体报道,OpenAI发布GPT-6 Astra,是在上市前重新确立技术领先地位。OpenAI最新估值达到8520亿美元,仍处于高投入阶段。据《金融时报》披露,2025年OpenAI支出约340亿美元,收入约130亿美元,剔除一次性会计项目和部分非现金支出后仍亏损约80亿美元。

GPT-6 Astra发布后,OpenAI Pre-IPO衍生品(代号OAI)市值飙升21.6%,达1.48万亿美元。

没有统一“验收线”,谁有资格宣布AGI来了?

美国认知科学家、纽约大学心理学与神经科学荣誉退休教授加里・马库斯(Gary Marcus)在社交媒体上评论GPT-6 Astra说,格雷格・布罗克曼刻意模糊AGI的评判边界,指望外界不会察觉其中的漏洞。按照传统标准来看,这套模型并不符合AGI的定义。

2025年,由等多名AI研究者和学者参与撰写的《AGI的定义》一文提出,AGI是能够达到甚至超过受过良好教育成年人所具备的认知广度与认知熟练度的人工智能。按照推理、记忆、感知等10个认知领域进行评估,不能依靠单一测试高分就宣称实现AGI。

加里・马库斯还表示,GPT-6 Astra在ARC AGI-3测试上取得的成绩固然出色,但即便这项测试名字带有AGI,也不能就此证明它就是通用人工智能。他推测,在开放式真实世界任务上,该模型还会暴露出大量问题。技术乐观派提前拿到了预览机会,持怀疑态度的研究者却没有。这是一套高明的营销策略,但往往会产生误导。

有人工智能领域资深人士向《每日经济新闻》记者(以下简称每经记者)表示,GPT-6 Astra已经可以在部分困难任务上达到甚至超过专家水平,但尚未稳定覆盖“大多数具有经济价值的工作”。ARC-AGI-3接近满分尤其说明AGI判断不能由单项基准决定。

他对“AGI已经实现”的技术结论持审慎态度,但基本认同人工智能进入可以投入广泛的行业应用规模化闭环落地的阶段。

上海财经大学特聘教授胡延平向每经记者表示,GPT-6 Astra局部个别小目标接近或达到了AGI水平,但还不能说AGI已经完全到来。按照OpenAI所定义的AGI,首先“高度自主”这一点就没有实现。

判断是否达到AGI可以从六个维度,一是知识维度、二是泛化维度、三是任务维度、四是行动维度、五是感知维度、六是学习维度。这六个维度都需要逐步建立非常系统的基准测试体系和工程化的动态测试框架,才能对AGI的进展进行持续的“可视化”。

不过,胡延平也表示,对于AGI,业界没有特别清晰和一致的共识,不过有被广泛引用的模糊内涵:AI在所有认知任务中达到甚至超越人类表现的能力。问题是达到还是超过?达到人类平均水平还是各领域顶级专家水平?因此,AGI是AI行业模糊的共同目标。

上述人工智能资深人士告诉每经记者,目前业内对AGI没有统一定义,也没有一条得到普遍认可的“验收线”。“前沿人工智能机构正在向更通用、更自主、更强大的智能系统靠拢,但AGI并不是整个行业统一使用的最终目标。

他认为,在巨额算力投入、激烈模型竞争和上市预期同时存在的情况下,把技术突破描述为“AGI时代到来”,显然有利于强化技术领导者形象、融资能力和客户预期。但是,AGI标签本身不会自动转化为利润,商业化最终取决于单位任务成本、可靠性和能够替代多少真实工作。“企业最终购买的是可稳定完成的工作,而不是某个模型是否获得了AGI称号。”

免责声明:本文内容与数据仅供参考,不构成投资建议,使用前请核实。据此操作,风险自担。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
“中国教师”小程序上线!教育部给1870万教师发了一份“礼物”,手把手教你领!

“中国教师”小程序上线!教育部给1870万教师发了一份“礼物”,手把手教你领!

教师吧
2026-09-05 10:35:48
是风是电!克雷桑17秒闪击位居中超历史第五,前五泰山占三席

是风是电!克雷桑17秒闪击位居中超历史第五,前五泰山占三席

懂球帝
2026-09-05 20:50:11
检索结果为0!武大撤下曾教授相关报道,曾经重点宣传的青年教授,如今官网查无此人,真相待揭晓

检索结果为0!武大撤下曾教授相关报道,曾经重点宣传的青年教授,如今官网查无此人,真相待揭晓

火山詩话
2026-09-05 16:42:20
“许昌不大,我非找到你不可”!顾客团购小龙虾苦等20多分钟,写差评遭商家威胁

“许昌不大,我非找到你不可”!顾客团购小龙虾苦等20多分钟,写差评遭商家威胁

火山詩话
2026-09-05 08:01:47
“好像被割一样痛”!母子俩草地休憩后,全身莫名刺痛,医生从皮肤里挑出近30处“细针”

“好像被割一样痛”!母子俩草地休憩后,全身莫名刺痛,医生从皮肤里挑出近30处“细针”

环球网资讯
2026-09-04 19:23:18
18岁女孩惨遭已婚男友殴打致死:ICU 里面目全非,母亲哭到眼睛反复就医,知情人爆料更多内幕

18岁女孩惨遭已婚男友殴打致死:ICU 里面目全非,母亲哭到眼睛反复就医,知情人爆料更多内幕

笔尖下的人生
2026-09-05 15:39:48
民进党!极有可能在下一届台湾地区选举后,成为长期一家独大政党

民进党!极有可能在下一届台湾地区选举后,成为长期一家独大政党

乐趣纪史
2026-09-05 10:40:13
“长的这么漂亮,还是带家去吧!”高一女生不想住校,因颜值逃过一劫!

“长的这么漂亮,还是带家去吧!”高一女生不想住校,因颜值逃过一劫!

林林先生
2026-09-04 11:10:12
一副美瞳戴上就不取,想起来才换下一副!14岁女孩这样“省事”半年,左眼真菌溃烂仅剩指数视力

一副美瞳戴上就不取,想起来才换下一副!14岁女孩这样“省事”半年,左眼真菌溃烂仅剩指数视力

极目新闻
2026-09-05 12:36:48
“眼神都拉丝了!”家长晒母子互动视频,引全网不适:儿大不避母的结果

“眼神都拉丝了!”家长晒母子互动视频,引全网不适:儿大不避母的结果

妍妍教育日记
2026-08-31 23:54:51
法学界陈枫发声:建议取消英语主课地位,教育该回归本土文化根基了

法学界陈枫发声:建议取消英语主课地位,教育该回归本土文化根基了

小徐讲八卦
2026-09-04 15:56:54
明明去巴萨更有望冲击欧冠和拿高薪,为什么劳塔罗却直接拒绝报价,甘愿留守米兰

明明去巴萨更有望冲击欧冠和拿高薪,为什么劳塔罗却直接拒绝报价,甘愿留守米兰

大卫的篮球故事
2026-09-04 19:58:57
男子自驾撞上羊群致53只羊死伤,赔偿8.48万元后羊却归羊主人所有,律师解读:赔了钱,羊为什么不能带走?

男子自驾撞上羊群致53只羊死伤,赔偿8.48万元后羊却归羊主人所有,律师解读:赔了钱,羊为什么不能带走?

大风新闻
2026-09-04 10:55:08
郭涛儿子落榜!被迫上北电国际班,一年学费12万,上完学至少80万

郭涛儿子落榜!被迫上北电国际班,一年学费12万,上完学至少80万

寒士之言本尊
2026-09-04 19:27:54
哈兰德与女友长相出众,女友长得像洋娃娃,十分登对,浪漫幸福

哈兰德与女友长相出众,女友长得像洋娃娃,十分登对,浪漫幸福

娱你同欢
2026-08-30 18:30:43
男子坚持在APP上看视频赚钱,一年总收益136元,连续12天尝试提现失败:看了几千分钟视频、上万条广告,简直浪费时间;官方:已立案调查

男子坚持在APP上看视频赚钱,一年总收益136元,连续12天尝试提现失败:看了几千分钟视频、上万条广告,简直浪费时间;官方:已立案调查

鲁中晨报
2026-09-05 11:06:06
全世界都被普京骗了?打乌克兰只是幌子,真正目标其实已悄悄布局四年

全世界都被普京骗了?打乌克兰只是幌子,真正目标其实已悄悄布局四年

扶苏聊历史
2026-08-27 16:15:02
钾是香蕉28倍!入秋隔天吃这菜,腿脚有劲精神足!

钾是香蕉28倍!入秋隔天吃这菜,腿脚有劲精神足!

美食店主
2026-09-05 08:18:38
用我丈夫的经历劝告大家:普通家庭在40岁过后,能安安稳稳守着一份工作,真不要轻易辞职去创业

用我丈夫的经历劝告大家:普通家庭在40岁过后,能安安稳稳守着一份工作,真不要轻易辞职去创业

小马达情感故事
2026-09-04 18:40:08
被郑钦文淘汰!16岁俄罗斯少女发文告别美网 特意用中文感谢球迷

被郑钦文淘汰!16岁俄罗斯少女发文告别美网 特意用中文感谢球迷

念洲
2026-09-05 14:46:48
2026-09-05 21:08:49
每日经济新闻 incentive-icons
每日经济新闻
中国主流财经全媒体平台。
1654333文章数 2728048关注度
往期回顾 全部

科技要闻

华为何庭波,再次更新韬定律论文

头条要闻

菲副总统莎拉最新发声:我会被杀 我不信任法院、警察

头条要闻

菲副总统莎拉最新发声:我会被杀 我不信任法院、警察

体育要闻

科比和勒布朗:冠军年份的背身

娱乐要闻

她曾被名导抛弃,凭《生逢其时》翻红

财经要闻

被曝试药后死亡,药企董事竟怒怼记者

汽车要闻

全新第四代博越Li‑HEV系列 怎么开都省

态度原创

健康
教育
艺术
游戏
房产

脑梗取栓成功≠活下来,还有这三关

教育要闻

代际传递创伤:孩子叛逆是因为妈妈从来没被尊重过

艺术要闻

吴冠中 画了幅故乡,值1395万!

叛忍之战,IG五局战胜TES,送去冒泡赛!世界赛也不要想了吧

房产要闻

嘉禾郡|全新样板间盛大开放|三重豪礼解锁,至高可省20万!

无障碍浏览 进入关怀版