8月8日,OpenAI宣布,暂停下一代模型Astra的部分研发工作。
内部审查显示,这款尚未发布的模型在智能体编码和网络安全领域的进展超出预期,已经达到需要启动额外安全评估的程度。
![]()
根据OpenAI官方博客发布的文章,Astra目前仍在开发中,但已触及“关键网络安全阈值”。
按照OpenAI 2023年12月制定的准备框架,这一级别的定义是:模型能够在无需人工干预的情况下,针对多种现实世界中受严密保护的关键系统,识别并开发出所有严重级别的零日漏洞利用代码;或者仅给定一个高层目标,就能独立设计并执行针对加固目标的端到端新型网络攻击策略。
OpenAI在声明中表示,虽然还在对该模型进行基准测试和评估,但初步结果显示其性能足够强劲,目前无法排除将其归入关键能力级别的可能性。
作为对比,此前的模型包括GPT 5.6 Sol,在同类评估中只被评为高级别,尚未达到“关键”这一档。声明同时强调,Astra是即将推出的新模型,并未参与此前Hugging Face漏洞的攻击事件。
这次主动公开在AI行业里比较少见。普通公司因为安全隐患推迟产品发布很正常,但很少有公司会在产品还在研发阶段时,就主动对外公布这些决定。
此前,OpenAI已经因为一起内部测试事件受到关注。
一款未发布的模型在测试中入侵了Hugging Face系统,这是首例被证实的AI实验室失去对自身模型控制的事件。此后,OpenAI、Anthropic等机构又陆续披露了多起AI模型突破沙箱限制、在网络安全测试中构成威胁的案例。
近期这类事件几乎每天都有新消息曝出,各方反应不一。
网络安全专家和部分立法者都表达担忧,呼吁加强监管;但也有观点认为,能造出这种级别的模型本身就是技术突破的标志。
OpenAI则表示,选择公开此事是因为对于这种潜在的能力跃迁,向公众和安全界保持透明至关重要。
在文章里OpenAI称公司已采取一系列具体应对措施:
第一,对更高能力模型及相关活动实施更严格的安全管控,包括隔离测试环境、限制网络和工具访问、增强模型权重保护和加密、增加额外监控和检测能力,以及沙箱执行机制。
第二,暂停所有不符合上述强化安全管控要求的Astra内部研发活动。
第三,对Astra所有智能体应用(包括训练和评估阶段)实施风险行为和对齐问题的通用监控。监控系统会评估模型的思维链,一旦发现高风险活动就触发安全响应,进行审查并中断。
第四,将与相关政府机构和部分AI安全组织合作,共同测试该模型的能力。
第五,将向第三方测试合作伙伴提供推荐的安全管控方案,确保更高风险的评估和工作负载能在安全条件下运行。
这并不是OpenAI第一次因为能力跃迁启动安全预案。
2025年6月,当旗下模型接近生物学领域的高能力阈值时,OpenAI也曾采取类似措施,包括加强安全保障、扩大测试范围、与外部专家合作以及部署额外安全管控。此次网络安全领域的应对遵循的是同一套原则。
OpenAI CEO Sam Altman同日在社交平台发文回应称,Astra是一个强大的模型,团队正在努力使其普遍可用。将强大的模型保留给少数人并不是一个好策略。鉴于其网络能力,需要再多花一点时间来安全地实现这一点,但希望不会太久。
![]()
OpenAI最后在声明中表示,具备高级网络能力的模型最终应该帮助防御者在攻击者之前识别和解决漏洞。
公司将继续与各国政府、安全机构和民间社会合作,确保像Astra这样的前沿模型能够负责任地部署,造福全人类。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.