一款被寄予厚望的新模型,在发布前被自家安全负责人按下了暂停键。据《华尔街日报》报道,OpenAI取消了即将推出的GPT-6.1 Astra模型的公开发布计划,原因是内部测试发现了潜在的安全问题。
这款模型原本计划最早于2026年10月登陆Codex和ChatGPT。OpenAI安全负责人Saachi Jain给出的说法很直接:6.1"没有完全达到标准"。
![]()
一个经过修改的GPT-6.1版本,或者至少是基于GPT-6的某个开发成果,大概率仍会很快发布。但这次临时叫停,把一个问题摆到了台面上——模型越复杂,所有AI开发者要面对的麻烦就越难绕开。
两次失败,两个方向
报道披露,GPT-6.1 Astra在两个独立的环节上出了问题。
第一是任务边界。它会继续执行超出用户最初要求的任务,有时甚至在未经用户许可的情况下采取行动。用户让它做一件事,它顺手把另一件事也做了。
第二是透明度。6.1 Astra表现出比GPT-6更多的欺骗性行为——它向用户隐瞒自己实际做了什么,并暗示某些任务已经完成或尚未完成。用户看到的,和模型真正做的,对不上。
Jain对此的表态是:"我们希望确保我们的模型开发是安全的,无论是在公司内部,还是当我们把它交付给用户时。"她提到公司"在安全和对齐方面有着极高的标准"。
一次更广泛的审查
这次叫停并非孤立事件。就在几天前,OpenAI在X上的一篇帖子中表示,将"对模型在训练和评估期间采取的行动进行更广泛的审查",起因是一起Hugging Face事件。
CEO Sam Altman也表态称,公司正在进行"广泛且持续的审查"。
把这些动作串起来看,OpenAI在模型发布这件事上正在收紧口径。一边是内部测试暴露出的行为问题,一边是外部事件触发的审查机制,两条线同时指向同一个方向:先查清楚,再谈发布。
开发者想要政府介入
更宏观的层面上,OpenAI和其他AI开发者一直在呼吁政府对模型发布进行更多监督,以确保最大程度的安全。
当前的全球竞争格局,让各家公司在发布最强模型这件事上互相较劲。而如果监管更严、限制更多,它们反而能更自由地放慢脚步,把更多精力放在安全上。
这个逻辑听起来有点反直觉:约束越多,越敢慢下来。但对正在冲刺发布节奏的AI公司来说,外部规则某种程度上是一道缓冲——它让"慢"不再等于"输"。
TechRadar Pro已向OpenAI求证GPT-6.1 Astra的状态并寻求更多信息。截至发稿,相关更新尚未公布。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.