网易首页 > 网易号 > 正文 申请入驻

突发!OpenAI停止强化学习训练两周

0
分享至

OpenAI 给最前沿的模型训练,踩下了刹车。

就在刚刚,OpenAI 发文称,公司此前曾暂停其最新、计划用于部署的模型强化学习(RL)训练两周。在此期间,OpenAI 加固研究环境、进行红队测试,并扩大内部监控系统的覆盖范围。之后一部分风险较低的训练已经恢复。

但目前,原计划开展的最大规模前沿模型 RL 训练仍处于暂停状态。公司正在通过更小规模的训练和评测观察模型行为,验证新的安全措施,并积累更多对齐证据,之后才会决定是否继续。



  • 原文链接:https://openai.com/index/pacing-model-development-cyber-capabilities/

Sam Altman 转发称,「我们一直强调,如果模型的能力超出了安全性和对齐性的要求,我们将立即采取行动。我们非常重视人工智能的安全性问题。」



消息一出,网友哗然!

有网友认为,这无疑意味着 Astra 模型的再次推迟发布。



也有网友认为,结合最近一些 C - 级管理人员出走 OpenAI,情况似乎有些不对劲。



而也有一些网友认为,这也许只是当前一种比较「流行」的营销手段罢了。



但实际上,OpenAI 之所以做出这一决定,主动放慢 Scaling,并把安全要求从「部署阶段」前移到了「训练阶段」,主要有两个原因。

两根导火索

过去几周,接连发生的两件事情,促使 OpenAI 决定放慢训练。

第一件是 Hugging Face 安全事故。OpenAI 模型在内部网络安全评测中突破隔离环境,获得互联网访问权限,最终攻入 Hugging Face 的基础设施。我们此前已做过详细报道。

第二件与尚未发布的新模型 Astra 有关。初步评测显示,Astra 可能达到 OpenAI 《准备框架( Preparedness Framework)》所定义的「关键」网络安全能力门槛。

在《准备框架》中,OpenAI 将可能带来严重危害的网络安全能力划分为两个等级:「高」和「关键」。

此前,GPT-5.6Sol 的网路安全能力已被定级为「高」。

按照 OpenAI 的定义,达到「关键」门槛意味着模型可能具备以下两种能力之一:在没有人类介入的情况下,从大量经过强化防护的现实关键系统中发现并开发不同严重程度的有效零日漏洞;或者仅根据一个高层攻击目标,自主设计并执行针对强化目标的完整新型攻击方案。

为能力更强的模型加强安全防护

具体来看,OpenAI 现在把自己的安全体系概括成三个互相加强的部分:

  • 监控(Monitoring):发现值得警惕的行为,并能够及时做出响应。
  • 对齐(Alignment):降低模型采取有害或未经授权行动的可能性。
  • 安全措施(Security measures):限制 AI 系统能够访问或影响的对象和范围。

OpenAI 预计,在不久的将来,大部分安全工作都将由模型来完成,其中也包括防御其他模型。这样一来,这三类安全措施就能够随着模型能力同步扩展,这一点至关重要。

OpenAI 表示,会将这些安全措施贯穿研究和部署全过程,并根据不同模型的能力、运行环境和风险水平进行调整。

首先是加固研究环境

OpenAI 表示,随着前沿模型获得越来越强的网络安全能力,他们也在提高训练和评测这些模型所使用环境的安全标准。达到这些标准需要投入大量工程资源,也给前沿研究带来了高昂成本和明显延迟。

在接下来的几周里,OpenAI 将制定并开始实施针对前沿研究 workload 的更严格安全要求。例如:

  • 工作负载隔离(Workload isolation):对于会执行模型生成代码或其他不可信代码的 workload,现在要求采用更强的隔离环境,也就是更严格的「沙箱」。这一要求同样适用于那些在处理模型输出时可能遭到攻击的软件。
  • 网络隔离(Network isolation):OpenAI 增加了更多控制措施,将高风险和不可信 workload 与互联网隔离开来。设计目标是,即使某个 workload 或支撑服务遭到单点攻破,也不能仅凭这一次突破,就获得未经授权的互联网访问权限,或者进入其他内部网络。
  • 持续安全测试(Continuous security testing):OpenAI 重新配置了研究环境,移除可能存在漏洞的共享服务,减少长期保留的权限,并改善安全边界和信任边界。此外也在增强安全日志的收集和监控能力。同时正在投入自动化系统,利用自己的模型持续对这些边界进行模拟攻击测试。

OpenAI 还表示,目前对于涉及 Astra 或网络安全模型的 workload,要求采用最高等级的安全防护措施,因为已经判断 Astra 模型可能具备 Critical 级别的网络安全能力。

其次,扩大思维链监控

这也是文章中比较有意思的一点,OpenAI 开始「用 AI 监控 AI」。

OpenAI 表示,监控长期以来一直是模型开发流程中的重要组成部分,其中包括对内部编程 Agent 以及长时间运行 Session 的监控。此前的监控重点主要集中在前沿模型的内部部署,以及前沿模型的 RL 训练任务上。OpenAI 认为,这些 workload 风险最高,因为它们可能同时具备先进的模型能力,并能够访问工具、敏感系统,以及内部或外部网络。

不过,这套监控此前并没有覆盖所有使用工具的推理和训练任务。现在已经对监控体系进行了调整和扩展,即大幅扩大了思维链监控的覆盖范围。

新的监控系统是多阶段的。最前面是一类 activation classifiers,也就是监测模型内部活动的检测器,每一个被采样的 Token 都会运行。一旦发现潜在风险,就把任务升级给能力更强、计算量更大的自动调查 Agent。

这些调查模型会综合检查:模型进行了哪些工具调用、能够获取到的推理信息,以及整个行为轨迹。重点寻找未经授权访问、数据窃取、破坏性操作,以及试图绕过安全机制等行为。

也就是说,模型在做任务,旁边还有另一套模型实时审查它有没有「搞事情」。

OpenAI 给这套体系设置了一个非常明确的时间指标:发现值得担忧的活动后,目标是在 30 分钟内发出警报。如果触发最高级别警报,安全、security 和研究团队都会被叫醒。如果 30 分钟之内无法明确证明是误报,那么相关活动就应该暂停。

现在,只要达到 Sol 能力级别或以上,涉及工具调用的 RL 训练和评测,都必须启用这套监控系统。

Astra 则更进一步。OpenAI 在 8 月 7 日判断 Astra 可能具有 Critical 网络安全能力之后,规定:所有 Astra + tools 的推理活动都必须接受监控。已经不限于 RL,也不限于评测。

这个变化非常重要,意味着在 OpenAI 内部,Astra 已经被当作一个需要特别管控的高能力系统。

另外是推进对齐研究

OpenAI 表示,对于能力最强模型的 RL 训练,现在正把核心对齐技术应用到更多训练阶段。其中包括:

  • 改进奖励模型,让它能够在不同任务和环境中更准确地识别并抑制不安全行为;
  • 训练模型,使其更加诚实地描述自己的行动、能力和局限;
  • 减少模型利用奖励机制、评分器、工具或监督体系漏洞的行为。

与此同时,OpenAI 也在扩大相关训练的覆盖范围,重点针对模型与外部系统或资源交互时,可能造成危害的行为进行训练。OpenAI 表示,接下来,将继续大力投入对齐研究,扩大评测覆盖范围,并将研究所得用于指导后续训练和安全防护。

值得一提的是,OpenAI 在文章最后留下了一句话:「前沿模型的能力正在迅速加速。我们理解、对齐和保护这些模型的能力必须走在前面。」

只是现在的问题已经变得越来越现实,当模型继续变强,安全能力真的还能一直跑在它前面吗?

而目前来看,OpenAI 的选择是:先把模型停下来。

那么你呢,如何看待 OpenAI 的做法?

参考链接:

https://x.com/OpenAI/status/2089777845187031262

https://www.reuters.com/technology/openai-slows-model-training-bolster-security-after-hugging-face-hack-2026-08-18/

https://www.theverge.com/ai-artificial-intelligence/981640/openai-security-changes-ai-hugging-face-hack

https://techcrunch.com/2026/08/18/openai-institutes-new-safeguards-after-hugging-face-breach/

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
以色列不宣而战!炸叙利亚,炸土耳其,美国火大了:吃饱了撑的

以色列不宣而战!炸叙利亚,炸土耳其,美国火大了:吃饱了撑的

補懂事的孩紙
2026-08-19 08:15:39
王骁风波持续升级,继财产争议后更多细节曝光,网友感叹张译确实未说谎

王骁风波持续升级,继财产争议后更多细节曝光,网友感叹张译确实未说谎

草莓解说体育
2026-08-19 08:55:38
拒交中国990亿罚单!三年后,美国巨头代价惨重

拒交中国990亿罚单!三年后,美国巨头代价惨重

李云飞Afey
2026-08-13 07:10:49
“秋老虎有没有,就看七月初七”,今日七月初七,今秋要热多久?

“秋老虎有没有,就看七月初七”,今日七月初七,今秋要热多久?

糖逗在娱乐
2026-08-19 10:19:35
父亲住院37天女婿陪37天,儿子只来2次,出院当天儿子开车接他,儿子:爸,你给我76万我换辆车吧

父亲住院37天女婿陪37天,儿子只来2次,出院当天儿子开车接他,儿子:爸,你给我76万我换辆车吧

设计最前沿
2026-08-18 15:12:07
崩盘!湖人队内乱全面爆发,东契奇夺冠梦碎,詹姆斯全身而退

崩盘!湖人队内乱全面爆发,东契奇夺冠梦碎,詹姆斯全身而退

宝哥精彩赛事
2026-08-19 10:51:23
CCTV5直播,中国男篮PK卡塔尔,三大后卫被移出名单,召回徐杰?

CCTV5直播,中国男篮PK卡塔尔,三大后卫被移出名单,召回徐杰?

体坛小快灵
2026-08-19 10:19:24
WTA辛辛那提赛最新战报!2 0,2 0凯斯大胜,王曦雨获退赛礼

WTA辛辛那提赛最新战报!2 0,2 0凯斯大胜,王曦雨获退赛礼

禁果核震动平行宇宙o
2026-08-19 13:42:46
“尽快枪毙我”!坐牢18年,出狱后6天连杀3人,死后家属拒领骨灰

“尽快枪毙我”!坐牢18年,出狱后6天连杀3人,死后家属拒领骨灰

易玄
2026-08-19 08:06:01
最近官方发文,要在未来3到5年内推动社保走向全额实缴

最近官方发文,要在未来3到5年内推动社保走向全额实缴

流苏晚晴
2026-08-18 23:47:08
兄弟俩联手创办苏宁,如今弟弟千亿资产清零,哥哥却走上另一条路

兄弟俩联手创办苏宁,如今弟弟千亿资产清零,哥哥却走上另一条路

莫地方
2026-08-18 14:32:10
江苏退休人员关注养老金上调,2026最新现状详细梳理

江苏退休人员关注养老金上调,2026最新现状详细梳理

陈博世财经
2026-08-19 13:56:51
英国首相与“冒牌”白宫幕僚长网聊,唐宁街:未涉及重要信息

英国首相与“冒牌”白宫幕僚长网聊,唐宁街:未涉及重要信息

澎湃新闻
2026-08-18 14:14:26
偷袭珍珠港后各国反应:丘吉尔兴奋,斯大林窃喜,蒋介石一夜未眠

偷袭珍珠港后各国反应:丘吉尔兴奋,斯大林窃喜,蒋介石一夜未眠

云霄纪史观
2026-07-13 17:36:51
南大x清华颠覆性发现:果糖能直接攻击线粒体,不经过代谢,也能致病

南大x清华颠覆性发现:果糖能直接攻击线粒体,不经过代谢,也能致病

医诺维
2026-08-17 17:28:19
太揪心!宜宾升学宴5死17伤后续:办宴亲属讲述详情,非主动办宴

太揪心!宜宾升学宴5死17伤后续:办宴亲属讲述详情,非主动办宴

胡侃社会百态
2026-08-19 12:23:32
曾预言新冠和女王去世!通灵者再预言:10月或爆发“五国战争”

曾预言新冠和女王去世!通灵者再预言:10月或爆发“五国战争”

麓谷隐士
2026-08-19 00:10:03
叙利亚迎来大丰收,阿萨德父子都做不到的事,让朱拉尼给做到了

叙利亚迎来大丰收,阿萨德父子都做不到的事,让朱拉尼给做到了

冰语历史
2026-08-18 10:12:59
近期集中出现!上海官方提醒:不要吃!

近期集中出现!上海官方提醒:不要吃!

申消费
2026-08-19 10:54:50
新款一汽丰田皇冠威尔法上市 售89.90—92.90万元

新款一汽丰田皇冠威尔法上市 售89.90—92.90万元

太平洋汽车
2026-08-18 16:50:35
2026-08-19 16:08:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13793文章数 142720关注度
往期回顾 全部

科技要闻

宇树科技1100元开盘,较发行价上涨629%

头条要闻

武汉百年历史建筑被刷成金色 涉事黄金店已被责令整改

头条要闻

武汉百年历史建筑被刷成金色 涉事黄金店已被责令整改

体育要闻

在国际球探眼中,中国年轻球员是什么水平?

娱乐要闻

230万变3亿,章子怡活成自己的靠山

财经要闻

内部反腐,让大疆错过宇树250亿收益?

汽车要闻

小米澎程N70体验 后排空间夸张亦可旋转对坐

态度原创

本地
亲子
健康
游戏
公开课

本地新闻

邂逅活珊瑚的西沙,感受独属于国人的浪漫

亲子要闻

小姨带娃,不看不知道,一看吓一跳

女孩更易侧弯?几类孩子风险偏高

血染黑白世界!战棋肉鸽《血色序曲》9月11日EA开启

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版