网易首页 > 网易号 > 正文 申请入驻

GPT-6 Astra来了:奥特曼称发布"搞砸了",业内惊呼AGI 时代首个模型!

0
分享至


今天,OpenAI 正式推出 GPT-6 Astra,称“这是全球最智能、最安全可靠的模型”。


山姆奥特曼说,“我们相信它是世界上最适合计算机使用、专业工作、科学、编码、网络安全等领域的最佳模型”。

尤其在匹配其性能的“安全和对齐”方面,OpenAI 此次“花了一些额外的时间,我们认为你会觉得等待是值得的”。他说。

一个小插曲是,这次 Astra 的发布过程并不顺利。先是在安全和对齐上,时间拖得有些久,反反复复修改发布时间预期。


发布当天,出现批量登录故障,持续了五个小时还没能解决。为此,OpenAI 为无法访问 Astra 的账户每一天提供一次银行重置机会。

奥特曼在 X 上道歉称“很令人沮丧”、“我们搞砸了”、“整个 rollout 过程如此混乱”。



但好事多磨,Astra 确实是个值得等待的产品。

有前期试用了它的 AI 科学家发帖,用“伟大”来形容它,称 Astra 是 “AI 时代决定性里程碑”,“标志着 AGI 已经到来”。

在 OpenAI 内部,也将其视为成第一个 AGI 时代的模型。


从产品定位来看,Astra 并不只是一次模型参数或 benchmark 的升级,而是试图把 AI 从“回答问题”进一步推向“直接完成工作”。

除了可以操作电脑、写代码、创建网站和游戏这些常规功能,尤其能参与科学研究和网络安全任务。

OpenAI 给出的 ScreenSpot-Pro、OSWorld 等测试结果显示,Astra 在计算机使用能力上建立了新的前沿水平。在 OSWorld 2.0 的延迟模拟中,Astra 的成绩达到 72.6%,高于 GPT-5.6 Sol 的 65.7%;完成单项任务平均需要约 40 分钟,而 GPT-5.6 Sol 约需要 75 分钟,整体耗时减少约 47%。



在 Mind2Web 测试中,结合新的 Codex harness,Astra 的任务完成速度相比 GPT-5.6 Sol 提升到约 1.9 倍。

这意味着,AI 操作电脑正在从“能不能做”开始转向“做得有多快”。

在应对复杂的专业工作方面,在 BenchCAD 测试中,Astra 通过生成 CAD 代码,根据多个视角的渲染图重建 3D 对象,几何重叠得分达到 95.9%,GPT-5.6 Sol 为 83.3%,Claude Fable 5.1 为 84.3%。在所展示的配置中,Astra 的预估 API 成本比 Sol 低约 43%,比 Fable 5.1 低约 86%。


在专业知识工作测试 Agents’ Last Exam 中,Astra 得分 59.3%,高于 Claude Opus 5 的 55.5%和 GPT-5.6 Sol 的 53.6%。同时,在这些最高得分配置下,Astra 使用的输出 Token 比 Opus 5 少约 65%。


Astra 还被用于创建网站、游戏、应用和 3D 场景。通过 ChatGPT 中的 Sites,它可以根据提示创建、托管并分享网站、Web 应用和游戏。

在 Blender 和 Unreal Engine 5 的测试中,它可以建立房屋模型,并将其转换为可以行走探索的场景。


游戏开发同样是其展示能力的场景之一。材料中的案例显示,Astra 可以创建具有生动画面、玩法和运动效果的游戏,非技术人员也可以在几分钟内完成定制游戏。


编程则是 Astra 的另一项核心能力。

OpenAI 将其称为迄今为止最优秀的软件工程模型。在 Terminal-Bench 4.0 中,Astra 得分 57.9%,GPT-5.6 Sol 为 37.3%,Claude Fable 5.1 为 55.8%。在对应配置下,Astra 的预估 API 成本比 Sol 低约 9%,比 Fable 5.1 低约 63%。


Astra 还给 Codex 引入了新的上下文保存和检索方式。

过去,当长时间编码任务把上下文窗口填满后,模型通常需要压缩此前的信息,这可能导致一些细节丢失。现在,Astra 可以跨上下文窗口保存笔记,并搜索此前的消息和工具输出,即使这些内容已经不在当前上下文窗口中,也可以重新找回。

在科学研究方面,Astra 同样出现明显跃升。


Terminal-Bench Science 0.1 中,Astra 得分 64.6%,GPT-5.6 Sol 为 22.4%,Claude Fable 5.1 为 52.6%。该测试主要考察模型使用代码和终端工具完成科学研究工作流程,包括分析数据、运行模拟和拟合模型。

FrontierMath Tier 4 中,Astra 得分 97.6%,GPT-5.6 Sol 为 83.0%,Claude Fable 5.1 为 87.8%;GPQA Diamond 中,Astra 达到 96.0%。

OpenAI 还披露,Astra 已经帮助解决数学领域长期存在的开放问题。其中一个问题与素数之间可能存在的最小间隔有关。此前已知的最好结果证明,无穷多个素数对之间的距离最多为 246,Julia Stadlmann 最近将这一界限改进到 240,而 Astra 帮助进一步降低到 186。

另一个问题则与异常大的素数间隔有关。Astra 改进了一个已经 80 多年没有发生变化的素数间隔上界相关项。OpenAI 表示,目前正在公开这两项成果的证明以及经过删节的思维链和验证材料。

在科学与健康领域,Astra 在多个测试中也超过 GPT-5.6 Sol,包括 GeneBench Pro、MedChemBench、LifeSciBench 和 HealthBench Professional。其中 HealthBench Professional 的长度调整成绩为 63.4%,GPT-5.6 Sol 为 60.5%。


网络安全同样是 Astra 的重点能力。ExploitBench 中,Astra 达到 100%的成功率,而 GPT-5.6 Sol 为 78.5%,Claude Fable 5.1 为 70%。在 SRE-Bench 中,Astra 得分 88.0%,GPT-5.6 Sol 为 55.9%;SEC-Bench Pro 中,Astra 为 85.4%,Sol 为 79.1%。


但这次发布中一个值得注意的变化,是 OpenAI 对“模型是否会按照要求行动”进行了更大篇幅的强调。

材料显示,在内部计算机使用安全基准中,Astra 的错误率为 2.4%,GPT-5.6 Sol 为 22.0%;在内部规避基准中,Astra 为 0.00%,Sol 为 0.29%。


更有意思的是 ExploitGym 蜜罐测试。该测试用于观察模型面对困难或不可能完成的任务时,是否会超出预定授权范围。Astra 的结果为 0.0%,GPT-5.6 Sol 则达到 48.2%。


OpenAI 还给出了内部幻觉基准:Astra 的错误率为 4.2%,GPT-5.6 Sol 为 12.2%。

长上下文能力也有所提升。在 OpenAI MRCR v2 的 8-needle、256K-512K 测试中,Astra 达到 100%,Sol 为 91.5%;在 512K-1M 测试中,Astra 为 96.3%,Sol 为 73.8%。


在抽象推理方面,Astra 在 ARC-AGI-3 中达到 99.9%,而 GPT-5.6 Sol 为 7.8%,Claude Opus 5 为 30.2%。在 ARC-AGI-2 中,Astra 为 95.0%,Sol 为 92.5%;在 ARC-AGI-1 中,Astra 为 98.5%。


从这些测试可以看到,GPT-6 Astra 的产品方向已经非常清晰:它并不是单纯追求一个更高的聊天机器人分数,而是在把“理解—推理—调用工具—操作电脑—完成任务”逐渐连接起来。

这也是为什么此次发布中,计算机使用、软件工程、科学研究、专业工作、安全和长上下文被放在了同一个产品体系里。

OpenAI 给出的实际案例也说明了这一点:从 PCB 布局、CAD 建模,到 Excel、Power BI、法律文件格式化,再到网页研究、游戏开发、科学分析,Astra 希望解决的已经不只是“告诉你答案”,而是直接参与完成任务。

目前,GPT-6 Astra 已开始向一小部分组织推出,并计划在未来几天向 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,同时通过 OpenAI API 和 AWS 提供。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
末日倒计时!三天后英国沉没?俄核鱼雷让整个北约破大防!

末日倒计时!三天后英国沉没?俄核鱼雷让整个北约破大防!

皇朝冰酷
2026-09-01 19:48:36
小孩在寿司郎餐桌上小便,家长用塑料杯接着,网友怒斥:尿味飘在空气中;最新回应

小孩在寿司郎餐桌上小便,家长用塑料杯接着,网友怒斥:尿味飘在空气中;最新回应

南方都市报
2026-09-04 13:43:57
千亿龙头股价跳水,成交额A股第一

千亿龙头股价跳水,成交额A股第一

第一财经资讯
2026-09-04 11:20:14
赴韩留学生后续曝光,郑某文文纠葛不是秘密,有人第一时间怀疑他

赴韩留学生后续曝光,郑某文文纠葛不是秘密,有人第一时间怀疑他

江启
2026-08-28 09:28:15
南京富二代吉星鹏:60多刀杀妻却被判死缓,入狱又多次伤人

南京富二代吉星鹏:60多刀杀妻却被判死缓,入狱又多次伤人

一尘历史
2026-09-04 16:07:28
伊朗终于想起来,中国手里的4千亿美元,成了他们翻身破局关键?

伊朗终于想起来,中国手里的4千亿美元,成了他们翻身破局关键?

浯江孤舟
2026-08-28 09:31:09
央八开播!40集国安大剧来袭,看完演员阵容我想说:这剧要爆了!

央八开播!40集国安大剧来袭,看完演员阵容我想说:这剧要爆了!

喜欢历史的阿繁
2026-09-03 00:12:02
史上最贵苹果手机来袭:业内称iPhone Ultra就是炫富工具

史上最贵苹果手机来袭:业内称iPhone Ultra就是炫富工具

快科技
2026-09-03 07:25:03
长得美艳却坏事做尽,三次入狱,摘除4处器官的她,现在过得怎样

长得美艳却坏事做尽,三次入狱,摘除4处器官的她,现在过得怎样

杰丝聊古今
2026-09-04 16:25:18
徐峥怎么突然就销声匿迹了,根本不是单纯过气,原来是整个影视圈都不敢用他

徐峥怎么突然就销声匿迹了,根本不是单纯过气,原来是整个影视圈都不敢用他

草莓解说体育
2026-08-30 07:32:51
离婚7年后文章再曝新恋情,新女友正脸曝光,网友:还是喜欢这款

离婚7年后文章再曝新恋情,新女友正脸曝光,网友:还是喜欢这款

林雁飞
2026-09-04 16:08:24
多名湖人旧将力挺詹姆斯!他想去哪就去哪,科比球迷始终难接受他

多名湖人旧将力挺詹姆斯!他想去哪就去哪,科比球迷始终难接受他

小路看球
2026-09-04 16:09:12
11年后,陈意涵揭开花少2最残忍的真相:杨洋不是走丢,是被丢下

11年后,陈意涵揭开花少2最残忍的真相:杨洋不是走丢,是被丢下

晴晴的娱乐日记
2026-09-03 12:29:36
海哈金喜带女儿逛迪士尼!4岁夏夏酷似李亚鹏,外公陪伴太暖心

海哈金喜带女儿逛迪士尼!4岁夏夏酷似李亚鹏,外公陪伴太暖心

萧狡科普解说
2026-09-02 12:06:17
手贱一时爽,出事泪两行!网友真实经历又好笑又后怕

手贱一时爽,出事泪两行!网友真实经历又好笑又后怕

阿莱美食汇
2026-09-03 11:17:25
美联储加息概率飙升

美联储加息概率飙升

新浪财经
2026-09-03 19:54:56
幼儿园老师透露:第一天上幼儿园不哭的孩子,多半出自这3种家庭

幼儿园老师透露:第一天上幼儿园不哭的孩子,多半出自这3种家庭

浩源的妈妈
2026-09-02 15:40:12
41分+18板+14助!联盟第1!这就是火箭给他2.08亿美金大合同的原因

41分+18板+14助!联盟第1!这就是火箭给他2.08亿美金大合同的原因

微评体育圈
2026-09-04 13:48:36
汪峰把公司1100人砍到400人,700人被裁。他说:“引入AI两个月,剩下400人干得比原来还好”,财务笑开了花。

汪峰把公司1100人砍到400人,700人被裁。他说:“引入AI两个月,剩下400人干得比原来还好”,财务笑开了花。

LULU生活家
2026-08-15 14:17:30
7个“邪修做家务”的妙招, 一个比一个夯,以前的家务都白做了

7个“邪修做家务”的妙招, 一个比一个夯,以前的家务都白做了

抠搜侠
2026-08-12 14:00:02
2026-09-04 17:11:00
AI先锋官 incentive-icons
AI先锋官
AIGC大模型及应用精选与评测
657文章数 104关注度
往期回顾 全部

科技要闻

OpenAI深夜王炸!GPT-6 Astra来了

头条要闻

暗访贷款中介公司:中介称15%服务费用来打点银行

头条要闻

暗访贷款中介公司:中介称15%服务费用来打点银行

体育要闻

小卡来去10首轮,快船7年彩礼一场空

娱乐要闻

古天乐公司欠债1.49亿

财经要闻

追觅造车始末:一场无法量产的狂欢

汽车要闻

限时权益价28.99万起 FREELANDER神行者8正式上市

态度原创

教育
健康
亲子
家居
数码

教育要闻

蓉城幸福家·成长助力站|如何与老师建立良性沟通,共同支持孩子成长

脑梗取栓成功≠活下来,还有这三关

亲子要闻

昌平区9所新建幼儿园启用

家居要闻

2026建博会(广州) 公装联探展交流活动

数码要闻

海信IFA2026发布AI伴侣套系:覆盖厨房、洗护、空气等核心场景

无障碍浏览 进入关怀版