网易首页 > 网易号 > 正文 申请入驻

GPT-6 突然降临!100000 块 GPU 炼出 Astra;OpenAI 宣告 AGI 来到

0
分享至


2026 年 9 月 4 日,OpenAI 发布新一代旗舰模型 GPT-6 Astra。


此次发布另一个受到关注的焦点,是 OpenAI 总裁 Greg Brockman 对 AGI 的表态。


在媒体吹风会上,OpenAI 总裁 Greg Brockman 承认,AGI,也就是通用人工智能,本身仍然是一个“模糊、灰色的概念”,但他认为,未来人们回头看时,可能会把 Astra 视为 AGI 到来的一个节点。

“我认为,现在我们已经进入 AGI 时代,并不是不合理的。”Brockman 表示。

当被问及 OpenAI 是否正式宣布已经实现 AGI 时,Brockman 并没有给出这一结论。

Brockman 表示,AGI 已经不再与 OpenAI 此前和微软协议中的某个合同触发条件绑定,而更多成为一种“使命或精神层面的概念”。

Brockman 称,是否认为 Astra 已经达到 AGI,可以由每个人自行判断;就他个人而言,他认为“已经到了”,但这只是一个开始。

媒体吹风会最后,Brockman 说道:“欢迎来到 AGI 时代。”


OpenAI 研究人员 Aidan Clark 表示,Astra 首次在得州 Stargate 基础设施上使用超过 10 万块 GPU 进行预训练,同时也是 OpenAI 首个在训练过程中大量使用前代模型参与监督的模型。

这是 OpenAI 至今规模最大的一次模型训练。

相比 GPT-5.6 Sol,Astra 在科学研究、CAD、桌面软件操作和网络安全等专项任务上的能力有较大提升。


不过,在目前竞争最激烈的编程能力上,Astra 并没有与其他头部模型拉开明显差距

编程得分升至 74.1%,但没有坐稳第一

在 DeepSWE v1.1 Agent 编程测试中,Astra 得分达到 74.1%,高于 GPT-5.6 Sol 的 70.8%。


不过,这一成绩并没有形成明确领先。

Meta 此前公布,Muse Spark 1.3 在最高推理设置下取得 75.4%;公开的 DeepSWE 排行榜中,Gemini 3.8 Flash 和 Claude Opus 5 的成绩也在 74% 左右。


DeepSWE v1.1 一共包含 113 项任务,Astra 与 Muse Spark 1.3 相差 1.3 个百分点,实际大致只对应一到两个任务。不同结果的误差范围也存在重叠,因此目前很难仅凭这一项测试判断哪款模型拥有绝对领先的编程能力。

OpenAI 自己公布的对比图没有纳入 Muse,同时采用了 Fable 5.1 的 67.4% 成绩,因此 Astra 在官方图表中的领先幅度,要比放到更广泛的同类模型中比较时更大。

ARC-AGI-3 得分 98.6%

相比编程测试,Astra 在其他专项任务上的提升幅度更大。

其中最突出的是 ARC-AGI-3,Astra 得分达到 98.6%。

不过,这一成绩需要结合测试方式来看。

OpenAI 在测试 Astra 时使用了 Responses API Harness,可以在多轮任务之间保留推理信息,并通过 Compaction 管理长上下文。

OpenAI 此前已经展示过,即使不改变底层模型,仅调整 Agent 系统和运行方式,也可能大幅提高 ARC-AGI-3 的成绩。

因此,这项 98.6% 的结果反映的是 Astra 与 OpenAI Agent 系统结合后的整体表现,而不能简单理解为基础模型本身取得了 98.6%。

Astra 在 FrontierMath Tier 4 上还取得了 97.6% 的成绩。


这一结果覆盖了 Tier 4 共 43 道题中的 41 道私有题目。负责运行 FrontierMath 的 Epoch AI 表示,OpenAI 为该 benchmark 的开发提供了资金,同时拥有其中部分内容的独家访问权限,因此这一背景也需要纳入对成绩的判断。

CAD 重建得分达到 95.9%

在 BenchCAD Vision2Code 测试中,Astra 得分达到 95.9%。

BenchCAD 要求模型根据渲染图重建 CAD 程序,并根据生成的 3D 模型与原始模型之间的几何重合程度进行评分。

在包含 1000 个 CAD 文件的 Vision2Code 子集中,Astra 配合 Python 工具得分为 95.9%,Fable 5.1 为 84.3%,GPT-5.6 Sol 为 83.3%。

OpenAI 同时指出,Claude 的测试使用了经过修改的评测设置,因此不同模型之间不能完全直接比较。

但仅与 GPT-5.6 Sol 相比,Astra 在这一任务上的提升幅度依然较大。

在 Terminal-Bench Science 科学 Agent 测试中,Astra 得分达到 64.6%。


该测试要求 Agent 使用命令行完成来自 5 个科学领域的 70 项研究任务。Anthropic 此前公布 Fable 5.1 的成绩为 52.6%,而现有公开排行榜中,Opus 5 的最高成绩约为 30%。

OpenAI 和 Anthropic 都在尝试将模型从回答科学问题,推进到直接参与科研工作流程。

Codex 开始解决长任务中的“上下文丢失”

对于开发者来说,Astra 在 Codex 中一个更实际的变化,是处理超过上下文窗口的长任务。

目前 Codex 主要依赖 Compaction,将此前的工作压缩成摘要,为后续任务腾出上下文空间。

这种方式可能会丢掉后续仍然需要的重要细节,例如此前某个修复为什么失败、哪些测试已经执行过,或者用户在任务开始时提出过哪些要求。

Astra 可以跨上下文窗口保存笔记,并重新搜索此前的消息和工具输出,而不是完全依赖压缩后的摘要。

这一功能目前仍处于实验阶段,需要通过 config.toml 手动开启。OpenAI 表示,未来数周内计划将其变成 Astra 在 Codex 中的默认功能。

Astra 还可以在向用户提出问题后,继续执行那些不依赖用户回答的工作,而不是因为一个待确认问题让整个任务停下来。

OpenAI 展示了 Astra 操作 KiCad、Excel、Blender 和 Power BI,同时还展示了浏览器表单填写和网站 QA 等任务。

在 OSWorld V2-Offline 桌面应用测试中,Astra 得分达到 72.6%,高于 GPT-5.6 Sol 的 65.7%;平均完成一项任务所需时间则从约 75 分钟缩短至 40 分钟。

Anthropic 此前公布 Fable 5.1 在 OSWorld 上取得 77.9%,但 Anthropic 同时表示,其使用的是不同版本的 OSWorld,因此不应该与此前公布的成绩直接比较。

OpenAI 还调整了 Codex 的 Harness。在 Mind2Web 测试中,Astra 配合新的 Harness 后,完成任务的速度达到目前 Sol 版本 Codex 的 1.9 倍。

API 输入 10 美元,输出 50 美元

Astra 上线 API 后,每 100 万输入 Token 收费 10 美元,每 100 万输出 Token 收费 50 美元。

这一价格约为 GPT-5.6 Sol 当前促销价格的 2.5 倍,与 Anthropic Fable 5.1 的定价相同。

相比之下,Muse 的标准价格为每 100 万输入 Token 1.25 美元、输出 Token 4.25 美元;Google Gemini 3.8 Flash 的首发价格为输入 0.75 美元、输出 3.75 美元。

不过,更高的 Token 单价并不一定完成一项任务的最终费用更高。如果模型能够以更少步骤完成任务,同时减少重试,总成本仍有可能下降。

OpenAI 表示,在多项评测和合作伙伴测试中,Astra 完成任务所消耗的 Token 更少。

Brockman 对此表示:“真正重要的是完成一项任务的价格。”

网络安全能力达到 Critical 级别

Astra 的另一项重要变化来自网络安全能力。


OpenAI 表示,Astra 已经跨过其 Preparedness Framework 中的 Critical 网络安全能力门槛,成为 OpenAI 首个达到这一等级的模型。此前 OpenAI 已因为 Astra 可能达到这一等级而收紧测试和访问限制。

在 OpenAI 的测试中,Astra 已经能够针对经过加固的浏览器和操作系统开发漏洞利用程序。

在使用近期 V8 漏洞进行测试时,Astra 还发现了两个此前未知的漏洞。OpenAI 表示,正在向相关软件维护者披露这些漏洞。

不过,OpenAI 强调,其公布的高级网络安全测试成绩反映的是获得 Daybreak Blue 权限后的 Astra,而不是普通用户默认能够使用的生产版本。

在 ExploitGym 测试中,Astra 得分为 42.4%,GPT-5.6 Sol 为 30.3%。


但此次 OpenAI 取消了通常存在的 6 小时时间限制,因此这一成绩不能简单与此前结果横向比较。

在 ExploitBench 上,两款模型的成绩均达到 100%。

通过普通方式使用 Astra 的用户,将无法直接使用部分高级网络安全能力,包括部分漏洞发现任务。

OpenAI 首先会向经过审核的安全防御人员提供限制更少的访问权限,并计划通过 Daybreak Blue 在未来数周扩大开放范围。

Daybreak Blue 并不是一个单独的 Astra 模型,也不是特殊推理模式,而是一套面向获得授权的防御性网络安全工作的访问机制。

对于 API 用户,一旦网络安全安全检查被触发,任务会直接停止,而不是暂停并等待批准。

OpenAI 的 Mia Glaese 还提醒,可信访问项目之外的用户,在进行网络安全工作时可能遇到速度下降、暂停或任务被拦截的情况,有时甚至可能影响与网络安全无关的任务。

“在发布初期,用户应该预期会出现这种情况。”她表示。

模型更强,但也更难监控

OpenAI 将 Astra 称为其“最对齐”的模型。

在一项内部测试中,当模型面对本身无法完成的任务时,Astra 擅自超出授权目标范围的比例为 0%,而 GPT-5.6 Sol 为 48.2%。

不过,OpenAI 同时说明,对比中的旧模型是在“没有生产环境安全防护”的情况下运行,因此两组数字不能直接比较。

与此同时,OpenAI 还披露,Astra 的书面推理过程比 Sol 更难监控。

在专门设计用于诱导模型规避监控的评估中,Astra 的可监控性有所下降。OpenAI认为,这可能部分因为 Astra 在简单任务中对是否写出完整推理拥有更大的控制权,同时完成任务所需要显式写出的推理步骤也更少。

OpenAI 首席科学家 Jakub Pachocki 表示:“智能水平的提升,并不保证对齐能力也会同步提升。”

他还表示,如果 OpenAI 无法重新获得足够的信心,确保未来模型仍然能够被有效监控,将暂停继续扩大模型规模。

首批向 Daybreak 企业客户开放

Astra 发布后不会立即向所有用户开放。

首批使用者是已经通过 OpenAI Daybreak 项目获得访问权限的企业客户。

OpenAI 表示,未来数日内,Astra 将陆续向 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,同时进入 OpenAI API 和 AWS。


其中,Pro、Business 和 Enterprise 用户还将获得 GPT-6 Astra Pro 的访问权限。符合条件的 API 客户则可以在 Zero Data Retention 模式下使用 Astra。

与 GPT-5.6 一次推出 Luna、Terra 和 Sol 多档型号不同,OpenAI 目前没有公布 GPT-6 的其他版本,现阶段产品线只有 Astra 和 Astra Pro。

云头条声明:如以上内容有误或侵犯到你公司、机构、单位或个人权益,请联系我们说明理由,我们会配合,无条件删除处理。



特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
人社局通报!星宇股份道歉才1天,又被重创,上市15年恐也得凉

人社局通报!星宇股份道歉才1天,又被重创,上市15年恐也得凉

知法而形
2026-09-04 07:49:35
曝知名女高音歌唱家龚爽去世,年仅37岁,老师是阎维文,知情人透露去世细节

曝知名女高音歌唱家龚爽去世,年仅37岁,老师是阎维文,知情人透露去世细节

裕丰娱间说
2026-09-04 12:51:47
景甜被除名,震惊全网!

景甜被除名,震惊全网!

财经三分钟pro
2026-09-03 16:39:54
难以置信!86页PDF举报材料里,年薪百万的教授每月只给两个女儿5000元抚养费,还是女儿在领导开会时去哭闹才给的

难以置信!86页PDF举报材料里,年薪百万的教授每月只给两个女儿5000元抚养费,还是女儿在领导开会时去哭闹才给的

火山詩话
2026-09-04 12:47:10
越南高铁结局已定,又一个国家进来搅局,中国冷眼旁观看戏就好

越南高铁结局已定,又一个国家进来搅局,中国冷眼旁观看戏就好

闻识
2026-09-04 05:18:59
上海女子400万兰博基尼停地库,被偷成空壳,维修费要300多万

上海女子400万兰博基尼停地库,被偷成空壳,维修费要300多万

听心堂
2026-09-04 09:50:16
开学第一天,56个学生请假41个:山东官方通报,已连夜将六年级学生迁走

开学第一天,56个学生请假41个:山东官方通报,已连夜将六年级学生迁走

听心堂
2026-09-04 08:54:37
涉嫌严重违纪违法,李瑛被查

涉嫌严重违纪违法,李瑛被查

中国基金报
2026-09-04 10:15:00
玉渊谭天丨中国为什么对G20这场会未发表公报表示遗憾

玉渊谭天丨中国为什么对G20这场会未发表公报表示遗憾

环球网资讯
2026-09-03 23:06:06
男子自驾撞上羊群致53只羊死伤,赔偿8.48万元后羊却归羊主人所有,律师解读:赔了钱,羊为什么不能带走?

男子自驾撞上羊群致53只羊死伤,赔偿8.48万元后羊却归羊主人所有,律师解读:赔了钱,羊为什么不能带走?

大风新闻
2026-09-04 10:55:08
开学第一周,妈妈深夜一封信火了:孩子你记住,自逼为王,人逼为将,不逼为卒

开学第一周,妈妈深夜一封信火了:孩子你记住,自逼为王,人逼为将,不逼为卒

男孩派
2026-09-04 09:47:52
震惊!网传上海女房东二手房交易进行到一半,突然当场飙泪,中介坐在旁边手足无措

震惊!网传上海女房东二手房交易进行到一半,突然当场飙泪,中介坐在旁边手足无措

火山詩话
2026-09-03 07:28:46
全面按下暂停键!日媒爆料:中国多所顶尖大学,叫停赴日交换生

全面按下暂停键!日媒爆料:中国多所顶尖大学,叫停赴日交换生

共工之锚
2026-09-04 00:23:43
曝西贝拖欠离职补偿金!贾国龙:要到2028年才能给

曝西贝拖欠离职补偿金!贾国龙:要到2028年才能给

鞭牛士
2026-09-04 10:12:08
7分钟100公里6000多条命!尼泊尔的未来被锁死了

7分钟100公里6000多条命!尼泊尔的未来被锁死了

鲁八两
2026-09-03 17:43:56
整容失败?33岁周冬雨近照脸垮僵硬像40岁大妈,撞脸郑秀文认不出

整容失败?33岁周冬雨近照脸垮僵硬像40岁大妈,撞脸郑秀文认不出

瞎说娱乐
2026-09-03 14:23:06
男子肚子疼被诊断为胃癌,医院瞒着当事人和家属切除整个胃,化验结果却显示没有癌细胞……法院判了

男子肚子疼被诊断为胃癌,医院瞒着当事人和家属切除整个胃,化验结果却显示没有癌细胞……法院判了

深圳晚报
2026-09-04 08:37:38
44岁范冰冰喜当妈!新男友二婚带个娃,偷税漏税风波后被李晨痛甩

44岁范冰冰喜当妈!新男友二婚带个娃,偷税漏税风波后被李晨痛甩

扒星人
2026-09-04 11:22:54
被要求补缴社保,老板在店门口滚屏抱怨,“选择员工需谨慎”

被要求补缴社保,老板在店门口滚屏抱怨,“选择员工需谨慎”

中国新闻周刊
2026-09-04 09:47:35
武大女教授被实名举报,男方系安徽大学副校长?安徽大学回应

武大女教授被实名举报,男方系安徽大学副校长?安徽大学回应

大风新闻
2026-09-04 13:22:03
2026-09-04 15:16:49
云头条 incentive-icons
云头条
引领科技变革,连接技术与商业。
21483文章数 27361关注度
往期回顾 全部

科技要闻

OpenAI深夜王炸!GPT-6 Astra来了

头条要闻

媒体:美国G20相关会议声明单独"点名"中国 十分罕见

头条要闻

媒体:美国G20相关会议声明单独"点名"中国 十分罕见

体育要闻

小卡来去10首轮,快船7年彩礼一场空

娱乐要闻

王宝强冯清八年未领证!真相令人泪目

财经要闻

GPT-6 Astra上线,AGI时代真到来了吗?

汽车要闻

限时权益价28.99万起 FREELANDER神行者8正式上市

态度原创

时尚
亲子
健康
手机
艺术

美拉德+黑白蓝,太好看了!

亲子要闻

哥哥问妹妹:爸妈离婚你要跟谁?4岁妹妹的回答看哭无数人

脑梗能否取栓,关键看这几点!

手机要闻

荣耀Play11手机规格曝光:骁龙4 Gen4处理器、8300mAh电池

艺术要闻

中国最美的殡仪馆

无障碍浏览 进入关怀版