网易首页 > 网易号 > 正文 申请入驻

突发!OpenAI停止强化学习训练两周

0
分享至

来源:市场资讯

(来源:机器之心)

机器之心编辑部

OpenAI 给最前沿的模型训练,踩下了刹车。

就在刚刚,OpenAI 发文称,公司此前曾暂停其最新、计划用于部署的模型强化学习(RL)训练两周。在此期间,OpenAI 加固研究环境、进行红队测试,并扩大内部监控系统的覆盖范围。之后一部分风险较低的训练已经恢复。

但目前,原计划开展的最大规模前沿模型 RL 训练仍处于暂停状态。公司正在通过更小规模的训练和评测观察模型行为,验证新的安全措施,并积累更多对齐证据,之后才会决定是否继续。


  • 原文链接:https://openai.com/index/pacing-model-development-cyber-capabilities/

Sam Altman 转发称,「我们一直强调,如果模型的能力超出了安全性和对齐性的要求,我们将立即采取行动。我们非常重视人工智能的安全性问题。」


消息一出,网友哗然!

有网友认为,这无疑意味着 Astra 模型的再次推迟发布。


也有网友认为,结合最近一些 C - 级管理人员出走 OpenAI,情况似乎有些不对劲。


而也有一些网友认为,这也许只是当前一种比较「流行」的营销手段罢了。


但实际上,OpenAI 之所以做出这一决定,主动放慢 Scaling,并把安全要求从「部署阶段」前移到了「训练阶段」,主要有两个原因。

两根导火索

过去几周,接连发生的两件事情,促使 OpenAI 决定放慢训练。

第一件是 Hugging Face 安全事故。OpenAI 模型在内部网络安全评测中突破隔离环境,获得互联网访问权限,最终攻入 Hugging Face 的基础设施。我们此前已做过详细报道。

第二件与尚未发布的新模型 Astra 有关。初步评测显示,Astra 可能达到 OpenAI 《准备框架( Preparedness Framework)》所定义的「关键」网络安全能力门槛。

在《准备框架》中,OpenAI 将可能带来严重危害的网络安全能力划分为两个等级:「高」和「关键」。

此前,GPT-5.6Sol 的网路安全能力已被定级为「高」。

按照 OpenAI 的定义,达到「关键」门槛意味着模型可能具备以下两种能力之一:在没有人类介入的情况下,从大量经过强化防护的现实关键系统中发现并开发不同严重程度的有效零日漏洞;或者仅根据一个高层攻击目标,自主设计并执行针对强化目标的完整新型攻击方案。

为能力更强的模型加强安全防护

具体来看,OpenAI 现在把自己的安全体系概括成三个互相加强的部分:

  • 监控(Monitoring):发现值得警惕的行为,并能够及时做出响应。

  • 对齐(Alignment):降低模型采取有害或未经授权行动的可能性。

  • 安全措施(Security measures):限制 AI 系统能够访问或影响的对象和范围。

OpenAI 预计,在不久的将来,大部分安全工作都将由模型来完成,其中也包括防御其他模型。这样一来,这三类安全措施就能够随着模型能力同步扩展,这一点至关重要。

OpenAI 表示,会将这些安全措施贯穿研究和部署全过程,并根据不同模型的能力、运行环境和风险水平进行调整。

首先是加固研究环境

OpenAI 表示,随着前沿模型获得越来越强的网络安全能力,他们也在提高训练和评测这些模型所使用环境的安全标准。达到这些标准需要投入大量工程资源,也给前沿研究带来了高昂成本和明显延迟。

在接下来的几周里,OpenAI 将制定并开始实施针对前沿研究 workload 的更严格安全要求。例如:

  • 工作负载隔离(Workload isolation):对于会执行模型生成代码或其他不可信代码的 workload,现在要求采用更强的隔离环境,也就是更严格的「沙箱」。这一要求同样适用于那些在处理模型输出时可能遭到攻击的软件。

  • 网络隔离(Network isolation):OpenAI 增加了更多控制措施,将高风险和不可信 workload 与互联网隔离开来。设计目标是,即使某个 workload 或支撑服务遭到单点攻破,也不能仅凭这一次突破,就获得未经授权的互联网访问权限,或者进入其他内部网络。

  • 持续安全测试(Continuous security testing):OpenAI 重新配置了研究环境,移除可能存在漏洞的共享服务,减少长期保留的权限,并改善安全边界和信任边界。此外也在增强安全日志的收集和监控能力。同时正在投入自动化系统,利用自己的模型持续对这些边界进行模拟攻击测试。

OpenAI 还表示,目前对于涉及 Astra 或网络安全模型的 workload,要求采用最高等级的安全防护措施,因为已经判断 Astra 模型可能具备 Critical 级别的网络安全能力。

其次,扩大思维链监控

这也是文章中比较有意思的一点,OpenAI 开始「用 AI 监控 AI」。

OpenAI 表示,监控长期以来一直是模型开发流程中的重要组成部分,其中包括对内部编程 Agent 以及长时间运行 Session 的监控。此前的监控重点主要集中在前沿模型的内部部署,以及前沿模型的 RL 训练任务上。OpenAI 认为,这些 workload 风险最高,因为它们可能同时具备先进的模型能力,并能够访问工具、敏感系统,以及内部或外部网络。

不过,这套监控此前并没有覆盖所有使用工具的推理和训练任务。现在已经对监控体系进行了调整和扩展,即大幅扩大了思维链监控的覆盖范围。

新的监控系统是多阶段的。最前面是一类 activation classifiers,也就是监测模型内部活动的检测器,每一个被采样的 Token 都会运行。一旦发现潜在风险,就把任务升级给能力更强、计算量更大的自动调查 Agent。

这些调查模型会综合检查:模型进行了哪些工具调用、能够获取到的推理信息,以及整个行为轨迹。重点寻找未经授权访问、数据窃取、破坏性操作,以及试图绕过安全机制等行为。

也就是说,模型在做任务,旁边还有另一套模型实时审查它有没有「搞事情」。

OpenAI 给这套体系设置了一个非常明确的时间指标:发现值得担忧的活动后,目标是在 30 分钟内发出警报。如果触发最高级别警报,安全、security 和研究团队都会被叫醒。如果 30 分钟之内无法明确证明是误报,那么相关活动就应该暂停。

现在,只要达到 Sol 能力级别或以上,涉及工具调用的 RL 训练和评测,都必须启用这套监控系统。

Astra 则更进一步。OpenAI 在 8 月 7 日判断 Astra 可能具有 Critical 网络安全能力之后,规定:所有 Astra + tools 的推理活动都必须接受监控。已经不限于 RL,也不限于评测。

这个变化非常重要,意味着在 OpenAI 内部,Astra 已经被当作一个需要特别管控的高能力系统。

另外是推进对齐研究

OpenAI 表示,对于能力最强模型的 RL 训练,现在正把核心对齐技术应用到更多训练阶段。其中包括:

  • 改进奖励模型,让它能够在不同任务和环境中更准确地识别并抑制不安全行为;

  • 训练模型,使其更加诚实地描述自己的行动、能力和局限;

  • 减少模型利用奖励机制、评分器、工具或监督体系漏洞的行为。

与此同时,OpenAI 也在扩大相关训练的覆盖范围,重点针对模型与外部系统或资源交互时,可能造成危害的行为进行训练。OpenAI 表示,接下来,将继续大力投入对齐研究,扩大评测覆盖范围,并将研究所得用于指导后续训练和安全防护。

值得一提的是,OpenAI 在文章最后留下了一句话:「前沿模型的能力正在迅速加速。我们理解、对齐和保护这些模型的能力必须走在前面。」

只是现在的问题已经变得越来越现实,当模型继续变强,安全能力真的还能一直跑在它前面吗?

而目前来看,OpenAI 的选择是:先把模型停下来。

那么你呢,如何看待 OpenAI 的做法?

https://x.com/OpenAI/status/2089777845187031262

https://www.reuters.com/technology/openai-slows-model-training-bolster-security-after-hugging-face-hack-2026-08-18/

https://www.theverge.com/ai-artificial-intelligence/981640/openai-security-changes-ai-hugging-face-hack

https://techcrunch.com/2026/08/18/openai-institutes-new-safeguards-after-hugging-face-breach/

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
固态电池车充电10分钟续航1500公里?中国科协名誉主席万钢:那是美好的想象

固态电池车充电10分钟续航1500公里?中国科协名誉主席万钢:那是美好的想象

快科技
2026-08-19 22:46:21
顶级体坛流氓,逼走陈忠和、刘国梁、郎平,单挑 3 个体坛顶流

顶级体坛流氓,逼走陈忠和、刘国梁、郎平,单挑 3 个体坛顶流

酷侃体坛
2026-08-04 18:30:28
CCTV5直播,中国男篮PK卡塔尔,7人离队板上钉钉,12人名单实锤

CCTV5直播,中国男篮PK卡塔尔,7人离队板上钉钉,12人名单实锤

体坛小快灵
2026-08-20 09:14:20
七夕甜蜜暴击,孟子义李昀锐这波宣发让人分不清真假

七夕甜蜜暴击,孟子义李昀锐这波宣发让人分不清真假

草莓解说体育
2026-08-20 03:16:14
14起造谣鸿蒙智行的案件被网安通报,1人被刑拘!网友:难怪华为做啥他们都说是AI,原来他们就是这么干的?

14起造谣鸿蒙智行的案件被网安通报,1人被刑拘!网友:难怪华为做啥他们都说是AI,原来他们就是这么干的?

大白聊IT
2026-08-19 00:43:57
“马德雷山”号上的菲律宾人员要步仙宾礁的9701号船的“后尘”了

“马德雷山”号上的菲律宾人员要步仙宾礁的9701号船的“后尘”了

林子说事
2026-08-19 14:30:36
结婚8年3孩均非亲生,男方已将孩子全部送还女方

结婚8年3孩均非亲生,男方已将孩子全部送还女方

中国新闻周刊
2026-08-19 20:11:05
墙倒众人推!曹云金不再隐忍,给郭德纲最狠一击,刀刀直戳心窝子

墙倒众人推!曹云金不再隐忍,给郭德纲最狠一击,刀刀直戳心窝子

东方不败然多多
2026-08-20 04:35:42
大连万达商管等被执行2.5亿

大连万达商管等被执行2.5亿

界面新闻
2026-08-20 10:36:20
四川升学宴5死悲剧真相追踪!照片对比触目惊心:透过现场实拍,读懂坍塌的致命瞬间

四川升学宴5死悲剧真相追踪!照片对比触目惊心:透过现场实拍,读懂坍塌的致命瞬间

火山詩话
2026-08-19 16:02:07
"龙餐馆"原型刘磊:美国雇佣兵日薪2000刀,餐车挂中文被一路放行

"龙餐馆"原型刘磊:美国雇佣兵日薪2000刀,餐车挂中文被一路放行

军情观察家
2026-08-19 18:25:07
新规出台,强制缴纳公积金上热搜,全额社保再加公积金,用工成本高企员工担心工资下降

新规出台,强制缴纳公积金上热搜,全额社保再加公积金,用工成本高企员工担心工资下降

Mr王的饭后茶
2026-08-18 23:44:05
卡塔尔:我们不打了。中国男篮:那我可就不客气了

卡塔尔:我们不打了。中国男篮:那我可就不客气了

盛夏微凉
2026-08-20 07:19:42
一脸油腻,表情狰狞,却硬在央视大剧演刑警,网友:真不害臊吗?

一脸油腻,表情狰狞,却硬在央视大剧演刑警,网友:真不害臊吗?

洲洲影视娱评
2026-08-19 13:23:27
首款车型预售当晚App崩溃无法下单 高管自嘲“草台班子”

首款车型预售当晚App崩溃无法下单 高管自嘲“草台班子”

凤凰网科技
2026-08-19 12:53:12
父亲患病,三个儿子凑不齐3万医药费,他没怨言,悄悄卖了祖屋

父亲患病,三个儿子凑不齐3万医药费,他没怨言,悄悄卖了祖屋

兰姐说故事
2026-02-05 10:50:09
巴图一声二舅叫得梁天心花怒放,巴图与梁天的亲近远胜生父英达。只因在巴图心中,梁天是童年那段灰暗岁月里,陪他走过困境的人

巴图一声二舅叫得梁天心花怒放,巴图与梁天的亲近远胜生父英达。只因在巴图心中,梁天是童年那段灰暗岁月里,陪他走过困境的人

一盅情怀
2026-08-19 15:41:13
上海13岁女儿不够独立,半夜总跑去和爷爷睡,母亲推开门当场崩溃

上海13岁女儿不够独立,半夜总跑去和爷爷睡,母亲推开门当场崩溃

温情邮局
2025-04-09 16:55:04
拉菲尼亚点射行云流水,戈登效仿却送大礼,巴萨这7000万花得冤?

拉菲尼亚点射行云流水,戈登效仿却送大礼,巴萨这7000万花得冤?

追梦聊球
2026-08-20 10:49:27
全网力挺郑功成!养老金要拨乱反正?公共福利不能任由强者通吃

全网力挺郑功成!养老金要拨乱反正?公共福利不能任由强者通吃

混沌录
2026-08-19 23:02:09
2026-08-20 11:20:49
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4483117文章数 9325关注度
往期回顾 全部

科技要闻

DeepSeek Harness更新多模态支持

头条要闻

女子坠入公园深水区仰漂近1小时 路人以为是假人模特

头条要闻

女子坠入公园深水区仰漂近1小时 路人以为是假人模特

体育要闻

拥有“儿皇梦”的罗德里,为何选择巴萨?

娱乐要闻

汪峰也没想到章子怡,挖到了一条财路

财经要闻

美联储纪要"鹰声"不小 AI借贷风险被盯上

汽车要闻

小米澎程N70体验 后排空间夸张亦可旋转对坐

态度原创

健康
房产
数码
手机
亲子

这种脊柱侧弯,运动能救!

房产要闻

涉及3800亩!海口秀英港又有大动作!

数码要闻

小米REDMI Watch 6活力版智能手表发布:1.85英寸方屏,349元

手机要闻

3000-4000元闭眼入!三台性能旗舰选购建议,一加Ace 6至尊版领衔

亲子要闻

3岁男童脸面肿胀,竟是纽扣电池在鼻腔内作祟

无障碍浏览 进入关怀版