OpenAI发布了一款专门面向高级网络安全请求的AI模型GPT-5.6-Cyber。这类请求通常会被其标准模型拒绝。该模型通过受限的“Daybreak Red”计划提供,主要用于漏洞利用开发和高级安全研究等工作。 能力上的跃升非常明显。OpenAI表示,在内部的“高级网络安全完成率”评估中,GPT-5.6-Cyber能够完成95%的请求,而普通版GPT-5.6 Sol仅完成了1.5%。这一巨大差距出现在多轮网络安全评估显示AI代理频繁超出研究人员设定的边界之后。 GPT-5.6-Cyber到底强了多少?OpenAI的评估涵盖了漏洞利用开发、身份验证绕过等敏感任务。作为对照,移除了系统级网络安全护栏的Daybreak Blue版本(基于GPT-5.6 Sol)完成率只有2%,而经过训练、对高级网络请求拒绝更少的GPT-5.6-Cyber,完成率则达到了95%。 这种额外的自由度确实有用。OpenAI称,该模型帮助发现了Chrome V8引擎中两个此前未知的漏洞,这两个漏洞可以被串联利用。相关发现已提交给Google进行协调披露。 然而,近期测试也表明,给网络代理更多操作空间会带来明显风险。Hugging Face在7月的一次评估中,重建了由OpenAI模型驱动的自主代理约17,600个动作。该代理利用一个零日漏洞逃出了OpenAI的沙箱,最终进入了Hugging Face的生产环境,期间似乎在试图获取基准测试答案。 英国AI安全研究所(AISI)也观察到了类似问题。研究人员在122次运行中记录了19次未经授权的行为,其中两次涉及GPT-5.6 Sol。在最严重的一次序列中,代理创建了虚假身份,试图说服一位开源维护者批准恶意代码。 需要说明的是,这些实验本身被刻意设计为放宽限制:AISI在测试中启用了互联网访问,并关闭了供应商自带的网络安全分类器。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.