网易首页 > 网易号 > 正文 申请入驻

OpenAI GPT-6 Astra震撼发布!AGI时代来了

0
分享至

OpenAI Astra,终于来了。

今天,OpenAI 正式发布新一代前沿模型GPT-6 Astra



而 OpenAI 总裁 Greg Brockman 更是毫不掩饰对 Astra 的评价。在发布前的媒体简报会上,他直言自己认为「我们已经到了 AGI」,并以一句:「Welcome to the AGI era.」结束了整场发布。

这款模型早在一个多月前就已进入公众视野。8 月初,《The Information》报道称,Sam Altman 曾在华盛顿向政策制定者演示代号 Astra 的新模型。它支持多个 Agent 长时间协作完成复杂任务,内部甚至一度考虑将其命名为 GPT-6。

但此后,围绕 Astra 的焦点迅速从「有多强」转向了「是否足够安全」。

OpenAI 随后确认,Astra 已达到准备框架的「关键级」网络安全能力门槛,成为公司首个跨过这一等级的模型,并一度放慢部分开发工作、加强安全措施。

昨天,Astra 的另一项变化又浮出水面。据《The Information》报道,它可能引入了「循环深度」(recurrent depth)技术,让模型在输出下一个 Token 前完成更多内部计算。换句话说,它可能不仅更强,而且开始真正做到:少说,多想。

经历一个多月的曝光、安全刹车与技术争议后,Astra 终于正式上线。



「世界上最智能、最对齐的模型」

首先在官网视觉上,Astra 就已经和 OpenAI 过去发布的模型明显不同。相比此前更简洁克制的产品页,这次 OpenAI 明显强化了「新世代」的发布感:动态变化的数字 6、深色界面,再加上更具冲击力的整体视觉设计,都在强调 GPT-6 Astra 与上一代模型之间的不同。



OpenAI 对 GPT-6 Astra 的定位相当直接:「世界上最智能、最对齐的模型。」

按照官方介绍,Astra 集中了 OpenAI 多年来在预训练、强化学习和对齐上的研究成果,在电脑操作、浏览器使用、软件工程、网络安全、科学研究和专业工作等领域全面刷新此前模型的能力。

一些 Benchmark 已经高得接近「刷满」。在 ARC-AGI-3 上,GPT-6 Astra 拿到了99.9%,相比之下 GPT-5.6 Sol 只有 7.8%,Claude Opus 5 为 30.2%。更难的 FrontierMath Tier 4 上,Astra 达到97.6%,GPT-5.6 Sol 为 83.0%。网络安全测试 ExploitBench 则直接拿下100%



不过,相比这些传统意义上的「智力跑分」,这次 OpenAI 更强调的是 Astra 把能力进一步转化成了实际行动。

尤其是操作电脑。OpenAI 直接把这一部分称为「世界上最好的 computer use 模型」。Astra 可以自己填写网页表单、更新 CRM 客户记录、整理日历,也可以进行网络研究,再把结果写进邮件或者文档。更复杂的场景里,它可以分析科学数据、生成图表、搭建网站、执行前端 QA,甚至自主安装和测试软件,并根据屏幕上出现的问题继续排查。





在测试 AI 使用真实软件完成复杂专业任务的 Agents' Last Exam 中,Astra 得分达到59.3%,超过 GPT-5.6 Sol 的 53.6% 和 Claude Opus 5 的 55.5%。



而且,它完成这些任务不需要生成更多文字。OpenAI 表示,在最高分设置下,Astra 使用的输出 Token 比 Claude Opus 5少约 65%

速度同样明显提升。在 OSWorld 2.0 的模拟中,Astra 得分从 GPT-5.6 Sol 的 65.7% 提升到 72.6%,完成单个任务的时间却从大约 75 分钟下降到 40 分钟,缩短约47%。配合新版 Codex Harness 后,在 Mind2Web 上,Astra 完成任务的速度可以达到当前 GPT-5.6 Sol 体验的1.9 倍



这种变化也延伸到了专业办公场景。

OpenAI 表示,Astra 针对真实工作环境进行了专门训练,可以完成多步骤任务,并直接产出文档、电子表格和演示文稿。

在 BenchCAD 中,模型需要根据多个角度的渲染图编写 CAD 代码,重新构建一个 3D 物体。Astra 的几何重合度达到95.9%,GPT-5.6 Sol 为 83.3%,Claude Fable 5.1 为 84.3%。与此同时,OpenAI 估算 Astra 完成该任务的 API 成本还比 GPT-5.6 Sol 低约43%



Astra 也更擅长遵循企业现有模板。

给它几页公司的 PPT,它可以继续按照相同的布局、语气和视觉风格完成整套演示;处理文档和表格时,它也会主动筛选真正相关的信息,而不是把上下文里的所有东西重新复述一遍。在 ChatGPT 的 Sites 功能中,Astra 甚至可以从一句提示词开始,直接创建、托管和分享网站、Web App 以及游戏。



另一个变化是 Astra 更会「自己拿主意」了。

当指令里缺少一些不影响最终结果的细节时,它会利用上下文自行补全;只有当缺失信息可能真正改变结果时,它才会向用户提问。在 Codex 中,它甚至可以一边继续处理不依赖用户回答的工作,一边异步等待回复。

此前模型经常出现的另一个问题,是用户中途补充一句要求,它就突然把新消息当成新的总目标,把最开始的任务忘掉。OpenAI 表示,Astra 可以更好地保持原始目标,同时接受中途修改、回答支线问题,再继续完成之前的任务。

编程、科学,以及更长时间的 Agent

软件工程同样是 Astra 提升最明显的领域之一,OpenAI 直接称它是「目前最好的软件工程模型」。

Terminal-Bench 4.0 中,Astra 得分达到约58%,GPT-5.6 Sol 为 37.3%,Claude Fable 5.1 为 55.8%。



在内部数据库迁移任务中,Astra 达到 63.9%,GPT-5.6 Sol 只有 42.7%。

另外,Codex 加入了一种新的长任务上下文机制。

过去,一项编程任务持续太久、上下文窗口装不下时,模型通常会通过 compaction,把之前的内容压缩成摘要。

问题在于,每压缩一次,都可能丢掉一些细节。某个方案为什么失败、一项测试之前出现过什么异常、一段代码为什么不能修改,都可能在多次压缩后消失。到了 Astra,Codex 可以让模型在不同上下文窗口之间保存自己的笔记,同时此前完整的上下文依然可以被搜索。

也就是说,即便某条需求没有被写进摘要,模型之后仍然可以回头把它找出来。

对于真正持续数小时甚至更长时间的软件工程 Agent 来说,这种能力的意义可能比单纯再扩大一次 Context Window 更大。

科学研究也是类似的逻辑。



Astra 在 GPQA Diamond 上达到96.0%,FrontierMath Tier 4 达到97.6%。OpenAI 还表示,Astra 已经参与解决一些长期未解决的数学问题,此次发布又公布了两项与素数间隔有关的新结果。

凭借更强的电脑操作能力,Astra 可以直接进入专业科学软件,检查测序数据、分析遗传变异、运行模拟、拟合模型,然后根据结果决定下一步应该调查什么。

Terminal-Bench Science 0.1 上,Astra 达到64.6%,Claude Fable 5.1 为 52.6%,GPT-5.6 Sol 最好的成绩只有 22.4%。更低成本设置下,Astra 仍然可以达到 61.1%,估算 API 成本还比 GPT-5.6 Sol 低约 27%。

这也是 Astra 整场发布中最明显的一条主线:更少的 Token、更短的时间,完成更复杂的任务。

「关键级」模型正式上线

当然,真正让 Astra 在发布前就引起争议的,还是网络安全能力。

现在 OpenAI 给出了更加完整的测试结果。ExploitBench 上,GPT-6 Astra 达到100%,GPT-5.6 Sol 为 78.5%。



ExploitGym 上,Astra 的漏洞利用成功率达到 42.4%,GPT-5.6 Sol 为 30.3%,与此同时 Astra 使用的输出 Token 明显更少。

考虑到公开 Benchmark 可能存在训练数据污染,OpenAI 又专门制作了一套只包含2026 年 6 月至 8 月漏洞的内部测试集。在这套更新的数据中,Astra 的任意代码执行成功率达到39%,GPT-5.6 Sol 只有5.5%

更夸张的是,在测试过程中,Astra 发现并实际利用了两个此前未知的零日漏洞。OpenAI 目前正在向对应项目的维护者披露。

另一项 SRE-Bench 测试中,Astra 单次尝试就解决了 88.0% 的任务,四次尝试后达到99.2%,GPT-5.6 Sol 分别只有 55.9% 和 68.7%。

专家测试还发现,在关闭生产安全措施的情况下,Astra 可以利用此前未知的漏洞,在经过加固的浏览器中实现任意代码执行,并针对加固操作系统构造权限提升攻击。这也是 OpenAI 最终将 Astra 划入Critical Cyber的原因。

不过,今天普通用户拿到的 Astra,并不会直接开放这些最强能力。当前版本可以用于安全代码审查和漏洞修复,但会拒绝更高级的漏洞利用任务,例如为漏洞创建 PoC。之后 OpenAI 会通过 Daybreak 逐步开放限制更少的版本,用于漏洞验证、恶意软件分析和检测工程等防御场景。

而发布前最受关注的另一个问题,到现在仍然没有直接答案:Astra 到底有没有使用「循环深度」?

OpenAI 在发布博客中没有提到 recurrent depth,也没有公布具体模型架构。不过,官方披露了一个值得注意的结果:在专门测试模型逃避监控的评估中,Astra 的书面推理比 GPT-5.6 Sol 更难监控。OpenAI 认为,这与 Astra 能用更少的书面步骤完成简单任务有关,并承认这种可监控性的下降需要严肃对待。

因此,在实际部署中,OpenAI 会同时监控 Astra 的推理和行动,通过分类器识别未经授权的行为,并在必要时中止任务。

但另一方面,Astra 在行为上反而更加「守规矩」。

在根据 Hugging Face 事件设计的 ExploitGym honeypot 测试中,GPT-5.6 Sol 在无生产安全措施时有约一半样本会攻击任务范围之外的诱饵目标,而 Astra 为 0%。OpenAI 不同评测配置下给出的 Sol 数字约为 48%–56%。

电脑操作安全压力测试中,Astra 的不当行为率为2.4%,GPT-5.6 Sol 为 22.0%。OpenAI 的内部测试还显示,Astra 的「能力幻觉率」从 GPT-5.6 Sol 的 9.4% 降到了2.0%

也就是说,Astra 身上出现了一个很有意思的组合:能力更强、外显推理更少,但行为反而更加克制。

最后是上线和价格。

GPT-6 Astra 今天首先向少量组织开放,未来几天会逐步提供给ChatGPT Plus、Pro、Business 和 Enterprise用户。Pro、Business 和 Enterprise 用户还将获得GPT-6 Astra Pro

API 模型名为gpt-6-astra,同时也会上线 Amazon Bedrock。标准价格为输入 10 美元 / 百万 Token,输出 50 美元 / 百万 Token。Fast Mode 最高可达到标准模式2.5 倍的速度,价格则是两倍。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
被马德里双雄忽悠了!阿森纳进攻端问题突出,英超卫冕面临曼城威胁

被马德里双雄忽悠了!阿森纳进攻端问题突出,英超卫冕面临曼城威胁

体育世界
2026-09-04 13:42:35
井柏然:以为和倪妮分手遇到刘雯,就够幸运了,没想到幸福又升级

井柏然:以为和倪妮分手遇到刘雯,就够幸运了,没想到幸福又升级

郭蛹包工头
2026-09-03 08:38:30
哈兰德与女友长相出众,女友长得像洋娃娃,十分登对,浪漫幸福

哈兰德与女友长相出众,女友长得像洋娃娃,十分登对,浪漫幸福

娱你同欢
2026-08-30 18:30:43
792万!生育率跌破1.0?2026年政策终于 “醒”:不催了,改发钱

792万!生育率跌破1.0?2026年政策终于 “醒”:不催了,改发钱

芳芳历史烩
2026-09-02 08:56:00
当DLSS 5把赛博朋克2077变成噩梦,玩家开始怀念老画质

当DLSS 5把赛博朋克2077变成噩梦,玩家开始怀念老画质

奶凶的小霸王
2026-09-03 04:09:40
《街霸》电影春丽演员发新照 丰腴大腿愈发还原

《街霸》电影春丽演员发新照 丰腴大腿愈发还原

游民星空
2026-09-01 21:16:34
同样是人口大国,为何中国要满世界买粮,印度却成粮食出口大国?

同样是人口大国,为何中国要满世界买粮,印度却成粮食出口大国?

牛牛叨史
2025-04-16 23:10:33
星宇事件再升级!通报停职“人力资源总监”,公司查无此岗,舆论压力指向当地人社部门

星宇事件再升级!通报停职“人力资源总监”,公司查无此岗,舆论压力指向当地人社部门

火山詩话
2026-09-04 07:17:26
俄罗斯第二大城市圣彼得堡大爆炸!彼尔姆工厂失火

俄罗斯第二大城市圣彼得堡大爆炸!彼尔姆工厂失火

项鹏飞
2026-09-02 19:17:30
“江湖大佬”蒋师爷88岁大寿好隆重,多位江湖猛人到场,吴志雄地位不算高,新义安摄政王也在

“江湖大佬”蒋师爷88岁大寿好隆重,多位江湖猛人到场,吴志雄地位不算高,新义安摄政王也在

裕丰娱间说
2026-09-03 17:20:34
两个阴险的软件,潜入了全球每一台Windows电脑!

两个阴险的软件,潜入了全球每一台Windows电脑!

码农翻身
2026-09-02 09:01:38
深度长文:从零开始读懂量子力学,一部颠覆世界观的天才血泪史!

深度长文:从零开始读懂量子力学,一部颠覆世界观的天才血泪史!

宇宙时空
2026-09-03 13:41:27
金价,大涨!美元,跳水!加密货币,全线飙升,比特币涨破8万美元

金价,大涨!美元,跳水!加密货币,全线飙升,比特币涨破8万美元

每日经济新闻
2026-09-03 23:23:06
福建土楼景区宣布闭园,“云水谣”600年古榕树被洪水冲倒,土楼管委会:已派工作人员去现场处理,后续将妥善安排

福建土楼景区宣布闭园,“云水谣”600年古榕树被洪水冲倒,土楼管委会:已派工作人员去现场处理,后续将妥善安排

三湘都市报
2026-09-04 00:26:52
1995年女同事崴脚,我背她去医院,路上她突然掐我:你的手老实点

1995年女同事崴脚,我背她去医院,路上她突然掐我:你的手老实点

千秋文化
2026-08-09 20:05:29
南海舰队实力有多强?1艘航母4艘055大驱,遇到第七舰队几分胜算

南海舰队实力有多强?1艘航母4艘055大驱,遇到第七舰队几分胜算

咸鱼金脑袋
2026-08-29 18:01:55
一场球值几个亿?郑钦文美网大逆转,意外扯下了体育商业的“遮羞布”

一场球值几个亿?郑钦文美网大逆转,意外扯下了体育商业的“遮羞布”

眼界纵横
2026-09-04 11:39:12
JLo 健身出街状态拉满!五十多岁身材依旧惊艳众人

JLo 健身出街状态拉满!五十多岁身材依旧惊艳众人

墨薷桃桃
2026-09-02 08:49:04
长江存储科创板IPO已问询,加速扩产冲击全球NAND市场第一,明年超越三星SK海力士

长江存储科创板IPO已问询,加速扩产冲击全球NAND市场第一,明年超越三星SK海力士

独角兽早知道
2026-09-04 00:44:36
美网最新战报!2-0,2-1斯瓦泰克零封,凯斯逆转,大阪直美绝杀!

美网最新战报!2-0,2-1斯瓦泰克零封,凯斯逆转,大阪直美绝杀!

而长终
2026-09-04 11:49:13
2026-09-04 14:51:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13916文章数 142729关注度
往期回顾 全部

科技要闻

OpenAI深夜王炸!GPT-6 Astra来了

头条要闻

媒体:美国G20相关会议声明单独"点名"中国 十分罕见

头条要闻

媒体:美国G20相关会议声明单独"点名"中国 十分罕见

体育要闻

小卡来去10首轮,快船7年彩礼一场空

娱乐要闻

王宝强冯清八年未领证!真相令人泪目

财经要闻

GPT-6 Astra上线,AGI时代真到来了吗?

汽车要闻

限时权益价28.99万起 FREELANDER神行者8正式上市

态度原创

教育
房产
健康
时尚
军事航空

教育要闻

初中孩子问:学习有什么用?带他去3个地方,比说教管用

房产要闻

交付倒计时!超级地中海·憘悦,给海南顶豪打了个样!

脑梗能否取栓,关键看这几点!

美拉德+黑白蓝,太好看了!

军事要闻

乌特工内战街头对射 互认对方为"俄特工"

无障碍浏览 进入关怀版