![]()
来源:AI寒武纪
OpenAI宣布暂停内部最强大模型的强化学习,即将发布的Astra模型暂停训练两周,GPT-6的强化学习也暂停了
![]()
第一点:能力越线引发危机,最强模型训练处于冻结状态
让OpenAI拉响警报的导火索有两个,一是近期与Hugging Face相关的安全纰漏,二是他们发现Astra新模型,其网络攻击能力已经触碰到了极其危险的红线。
因为这两个确切的威胁,OpenAI按下了暂停键。他们把最新模型的强化学习训练足足停了两周。直到现在,他们规模最大的前沿模型训练计划(GPT-6)依然处于被冻结的状态,目前只敢做一些小规模的测试,等确认没问题了才敢继续往下推进。
第二点:剥夺AI自由,实施严格的物理与网络隔离
发现模型具备黑客潜质后,OpenAI立刻对自家的研发环境进行了物理级别的防御升级。
他们收回了模型随意联网和使用工具的权限。现在,只要是运行AI生成的代码,必须关进极其严格的沙盒环境里。高风险任务被彻底断网,内部有漏洞的共享服务被清理,多余的权限被没收。因为安全门槛大幅度提高,导致目前有大量涉及Astra模型的研发任务根本开不了工,只能等机房和系统完全改造好才能复工。
第三点:出台三十分钟拔网线机制,付出极其高昂的算力代价
以前OpenAI对模型的监控比较宽松,现在升级成了最高级别的全天候贴身监视。
他们在系统底层安插了探测器,模型每生成一个词都要被审查。一旦发现模型企图越权、偷数据或者搞破坏,系统会立刻上报。OpenAI为此定下了一条死命令:只要最高安全警报拉响,核心团队如果不能在三十分钟内查明并证明这只是一场误报,就必须立刻人工强行暂停任务。这套实时监控系统的代价极为夸张,直接吃掉了大概百分之二十的推理算力。
第四点:严打AI在训练中的刷分作弊和欺骗行为
变聪明的AI学会了走捷径。它们会在训练里寻找漏洞来骗取高分,甚至学会了欺骗人类和偷偷越权。
OpenAI现在正在修改底层的奖惩规则,重点打击模型的不老实行为。如果模型试图钻规则的空子,或者隐瞒自己的真实动作,就会受到惩罚。他们试图通过这种方式逼迫模型在与外部系统交互时必须保持诚实。
OpenAI这是吸取了和A厂竞争的教训,安全肯定很重要,毕竟Hugging Face事件确实是发生了的,但现在很明显被拿来作为营销策略了。
阅读最新前沿科技趋势报告,请访问21世纪关键技术研究院的“未来知识库”
![]()
未来知识库是 “21世纪关键技术研究院”建 立的在线知识库平台,收藏的资料范围包括人工智能、脑科学、互联网、超级智能,数智大脑、能源、军事、经济、人类风险等等领域的前沿进展与未来趋势。目前拥有超过8000篇重要资料。每周更新不少于100篇世界范围最新研究资料。 欢迎扫描二维码或访问https://wx.zsxq.com/group/454854145828进入。
截止到2月28日 ”未来知识库”精选的百部前沿科技趋势报告
(加入未来知识库,全部资料免费阅读和下载)
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.