OpenAI宣布,将其正在开发的下一代主力AI模型“Astra”认定为公司准备框架下的首个“重大”(critical)网络安全风险等级模型。理由是内部评估显示,Astra的自主编码与网络攻击能力已经达到“重大网络安全阈值”,存在被滥用于发动高级网络攻击的可能性。这一消息由OpenAI官方于2026年8月7日通过公告及社交媒体同步发布。 据OpenAI公开的信息,Astra是该公司筹备中的次世代核心AI模型。2026年8月1日,OpenAI曾表示Astra的内部版本在10项数学及理论计算机科学课题中取得了新的突破。而在8月7日发布的最新内部评估中,Astra在代理编码(agent coding)和网络安全两大领域展现出显著进步,被认为已达到“重大网络安全阈值”。 根据OpenAI公司准备框架的定义,所谓“重大网络安全阈值”,指的是当模型能够在无需人类介入的情况下,识别并开发针对多个强化型现实世界关键系统的各种严重程度的实际零日攻击,或者仅凭高层级目标即可针对强化目标设计并执行端到端的新型攻击策略时,即视为达到该等级。OpenAI表示,目前针对Astra的基准测试和评估仍在持续进行,但其初步性能已经足以触发该判定。公司同时坦言:“现阶段无法排除致命性风险。” 也因此,OpenAI决定将Astra作为其准备框架下首个被评定为“critical”级别的网络安全模型。OpenAI称,这一情况属于事先规划过的场景,公司已针对Astra的进一步开发部署了额外的管理控制措施,以确保后续研发工作能够在安全且可控的前提下推进。 OpenAI在公告中详细列出了针对Astra的新增安全管理措施,包括:对Astra功能的部署加强安全防护测试;采用隔离的测试环境和网络环境;限制对特定网络和工具的访问权限;强化模型权重保护与加密措施;增强额外的监控与检测能力;实施沙盒执行机制。同时,OpenAI已暂停所有尚未满足上述强化安全管理要求的Astra相关内部活动。 此外,OpenAI还宣布已在Astra的全部代理应用中引入一套全面监控系统,覆盖训练和评估环节。该系统旨在监测模型的危险行为及不一致性,评估模型思维过程中的潜在风险,必要时自动触发安全响应,并对高风险活动进行审查和中断。OpenAI同时表示,将与其合作的相关政府机构及指定的AI安全机构共同对Astra性能进行验证,并为第三方测试合作伙伴提供推荐的安全防护措施。 OpenAI在公告中表示:“我们相信,先进的网络防御模型应当帮助防御方先于攻击者发现并应对漏洞。我们将与政府、安全保障机构和公民社会合作,致力于让Astra这类模型以及未来模型的先进能力,以负责任的方式为全人类利益而广泛部署。”OpenAI CEO萨姆·阿尔特曼也就此发表评论称:“Astra是一款非常强大的模型,我们正努力让它能够被大众所使用。将强大的模型限制在少数选定的群体手中,并不是一个好的策略。但考虑到其所具备的网络安全能力,为了安全地实现这一目标,还需要采取更多必要的防护措施。”
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.