IT时代网8月19日消息,OpenAI发布公司署名文章,阐述在AI系统能力持续增强背景下,如何调整模型开发节奏并强化安全护栏。过去几周,两起事件凸显了风险:其一为OpenAI与Hugging Face相关的安全事件;其二是初步证据表明,其即将推出的代号为Astra的模型可能达到内部“准备度框架”中定义的网络安全关键能力门槛。这些进展,叠加内部研究的快速突破,让强化监控、对齐与隔离防护的工作变得更加紧迫。
OpenAI表示,随着模型能力增强,内部研发与测试本身的风险也在上升,监控、对齐和安全标准必须跑在风险前面。为此,公司临时放慢了扩展节奏,包括在最新可部署模型的强化学习训练上暂停约两周,同时加固并红队测试研究环境、扩大监控系统覆盖。目前规模最大的前沿强化学习训练仍未恢复,公司要先通过小尺度训练与评估确认模型行为、验证护栏并积累对齐证据。
在环境安全方面,OpenAI已对可执行模型生成代码或接入互联网的研究集群暂停前端推理,并逐步恢复为受限的安全路径;要求对执行不可信代码的工作负载加强隔离沙箱,对高风险与不可信负载实施更严格的网络隔离,并持续进行安全测试与日志监控。由于Astra模型被认为可能具备关键级网络能力,涉及该模型或网络相关的工作负载目前适用最严格的安保要求,相当部分负载仍处于暂停状态,优先迁移的是安全与对齐类任务。
监控体系也进行了扩展:新的多阶段监控从逐 token 的激活分类器起步,一旦发现问题就升级到更高算力的自动化调查系统,检查工具调用、推理过程与完整活动序列中是否存在越权访问、数据窃取、破坏性行为及绕过护栏的尝试,目标是在可疑活动出现后30分钟内发出警报,触及关键安全边界时直接触发最高优先级告警并叫停活动。
对齐研究方面,OpenAI将核心对齐技术应用到更多训练阶段,改进奖励模型以识别并抑制不安全行为,训练模型更诚实地表述自身行动、能力与局限,并减少利用奖励或监督弱点的行为。公司计划后续公布更多对齐研究的进展。OpenAI称,将把上述护栏整合进准备度框架,并引入外部组织参与,相关技术报告将在未来数周发布。
![]()
注:本文综合自OpenAI等,文中包含AI辅助创作的内容。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.