「欢迎来到 AGI 时代」
— OpenAI 总裁 Greg Brockman
![]()
刚刚,随着 GPT-6 的发布,我们真正的来到了新的时代
今天凌晨,OpenAI 发布了 GPT-6 Astra,在ARC-AGI-3 打到 99.9%,ExploitBench 打到 100%,FrontierMath Tier 4 打到 97.6%
难以置信,不可思议的数字
![]()
通过这个模型,你可以制作更为不可思议的场景、网站
这是通过 GPT-6 Astra 制作的游戏,我进行的实况录制
GPT-6 Astra 这款模型,今天开始向一小部分组织开放;
未来几天,将陆续向所有 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,同时也会通过 OpenAI API 和 AWS 提供。
价格与 Fable 保持一致:输入 $10/M 输出 $50/M
跑分
这里我把所有的跑分都放出来了,感受一下吧....
![]()
跑分对比上篇:Computer Use、专业工作、编程
![]()
跑分对比下篇:科学、网安、对齐、长上下文、抽象推理
工作能力
这个模型的各种能力,都被极大程度的加强了。这里有一些展示,相信很能说明情况
比如通过 Astra 在 KiCad 里做 PCB 布局布线(把电子原理图变成可制造的 PCB,放置元件、布线铜连接)
你可以让他通过现有的资源,去创造游戏
它可以替你处理各种繁琐任务,例如填写在线表格、更新 CRM 中的客户记录,以及整理日历,甚至进行复杂的数据分析
当然,谁能拒绝来一个超炫酷的 Excel World Championship
甚至,还可以操作 FreeCAD 去完成这种零件/设备的渲染
![]()
这个是不是看起来更震撼了
以及配合 Codex 的更新,在 Mind2Web benchmark 上整体任务完成速度比当前 Sol 体验快了 1.9 倍
我们上线当天就把 GPT-6 Astra 接入了 Devin 的 harness,在内部测试 benchmark 上达到了 SOTA。computer use、写作、代码库理解开箱即用就有提升:视频明显更容易跟,报告更清晰简洁
Silas Alberti,Cognition SVP Research
专业工作
OpenAI 说 Astra 在模板遵循、幻灯片排版、叙事结构上是他们做得最好的模型,能产出直接能用的文档、表格和演示文稿。比如这个海报就排版的很好看
![]()
Astra 的训练特别针对了「只提取相关上下文进输出,不重复无关信息」这件事
![]()
当指令有模糊的地方,OpenAI 说 Astra 比前代更擅长自行判断。它用上下文填补常规空白,只在答案会实质性影响结果时才提问。在 Codex 里可以异步提问,同时继续不依赖回复的工作
Astra 在能力和效率上都给了我们显著优势。它能成功执行我们最复杂的创意工作流,同时 token 用量比其他测试模型少了最多 20%
Alex Mashrabov,Higgsfield AI CEO
写代码
从跑分上来看,GPT-6,也就是 Astra 是目前最好的模型了
![]()
同时,随着这次模型更新,Codex 里也新加了一个实验性功能:上下文窗口用完时 Astra 可以做笔记,之前的窗口内容可以回搜,不用每次都压缩进一份摘要
GPT-6 Astra 在我们内部 coding benchmark 和交易直觉 eval 上都比 Sol 有明显提升。agentic coding 时沟通方式更容易跟,代码到生产质量所需的迭代更少
John Crepezzi,Jane Street AI Assistants
Astra 在复杂法律任务上比 Sol 有显著质量提升,能像讲究的律师一样区分文件记录、发现未支持的假设、把缺口转化为具体的起草方向
Niko Grupen,Harvey Applied Research 负责人
做科研
数学方向,这款模型也是相当不俗
![]()
同时,Astra 帮助取得了两个关于素数间隔的新结果
第一个是 short prime gaps:此前十多年最好的结果是无穷多对素数间距不超过 246,Julia Stadlmann 最近改进到 240,Astra 帮助推到了 186,证明有无穷多对素数之间的距离不超过 186
第二个是 large prime gaps:改进了一个 80 多年没动过的项。证明和验证材料已公开
安全&对齐
Astra 在 Preparedness Framework 下触达了网安领域的 Critical threshold
OpenAI 还单独做了一个 ExploitBench(2026 年 6-8 月)eval,用最近三个月的 20 个高危 V8 漏洞测。Astra 39.0%,Sol 5.5%。测试过程中 Astra 发现并利用了两个此前未知的 0day 漏洞,OpenAI 正在向维护方披露
专家评估发现,不加安全措施的 Astra 能在加固浏览器上利用未知漏洞实现任意代码执行,能做加固操作系统的提权
同时,OpenAI 也表示说 Astra 是他们对齐做得最好的模型,在 care、task boundaries、transparent communication 三个方面有实质提升
另外 OpenAI 同时提到:Astra 的书面推理比 Sol 更难被监控。原因是 Astra 在简单任务上能用更少的推理步骤解决问题,推理更内隐。复杂任务上仍然难以隐藏推理过程,但 OpenAI 说他们认真对待这个退步,可监控性是研究重点
多少钱,在哪用
这款模型今天开始向一小部分组织开放; 未来几天,将陆续向所有 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,用量包含在现有订阅额度里,可以额外买 credits
Pro、Business、Enterprise 还能用 GPT-6 Astra Pro 版本
模型同时也会通过 OpenAI API 和 AWS 提供
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.