OpenAI周四正式发布GPT-6 Astra,将其称为“世界上最智能且最对齐的模型”。这一发布距离该公司宣布该模型在其“准备框架”下达到“严重”网络安全能力阈值,仅过去数天。
在官方公告中,OpenAI强调Astra在计算机使用、网页浏览、软件工程等多项能力上均处于行业领先水平。但真正引发安全社区关注的,是它在内部基准测试ExploitBench上的表现——满分100%。
![]()
满分背后的安全悖论
ExploitBench是用于评估AI模型发现和利用软件漏洞能力的测试平台。Astra在该测试中拿到满分,意味着它具备极强的攻防两端能力。然而,OpenAI同时采取了一项关键限制措施:拒绝处理生成概念验证(PoC)攻击代码的请求。
这一做法在安全圈内引发讨论。一方面,模型的能力展示证明了其在漏洞挖掘上的潜力,可用于防御性安全研究;另一方面,对PoC请求的封锁,则是在能力与风险之间划出的一条明确界线。
能力越强,约束越紧
从时间线看,OpenAI先是在“准备框架”下将Astra的网络安全能力评定为“严重”级别,随后正式发布。这种“先定级、再发布”的节奏,显示出对前沿模型安全风险的谨慎态度。
对开发者而言,Astra的满分成绩意味着更高效的代码审计和漏洞发现工具可能成为现实。但OpenAI对PoC的封锁也提示:能力边界与使用边界正在被同步收紧。如何在释放模型潜力的同时控制滥用风险,将是所有前沿AI实验室接下来必须回答的问题。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.