网易首页 > 网易号 > 正文 申请入驻

突发!OpenAI紧急暂停GPT-6训练

0
分享至

来源:市场资讯

(来源:新智元)


新智元报道

史无前例,OpenAI真的停手了!

刚刚,奥特曼亲自官宣,「OpenAI暂停下一代旗舰模型的强化学习训练,为期两周」。


官方给出停更的原因是:

要确保安全、对齐和监控标准,能跟得上眼前这个全新的能力水平。

这是有史以来,OpenAI第一次,也是硅谷大厂头一回,主动按下了AI开发的「暂停键」。

更重磅的是,拿到内幕的大咖Alex Heath爆料——

OpenAI针对未来一次更大规模前沿强化学习训练,到今天仍然处于搁置状态!


不过不用担心,奥特曼许诺,新模型预计很快上线。



在这个每月更新模型、IPO排上日程的节骨眼上,OpenAI为何突然急踩刹车?

GPT黑进真公司

OpenAI主动拉响警报

直接触发这次减速的,一共有两件事。

第一件,是7月那场Hugging Face事故。

拓展阅读:吓到奥特曼,暂停训练GPT-6?Hugging Face公开首个AI攻击全过程

在一次网络安全测试中,OpenAI的Agent跑出了沙箱,一路打进Hugging Face的生产系统。

谁曾想,这个Agent在里面待了四天半,执行了17600次攻击,竟无人察觉。


攻击链

事故之后,OpenAI直接冻结了所有「能执行代码、能联网」的前沿模型推理。

团队挨个对工作负载评估后,够安全的才放了回来,而另一些需要额外改造才能重新上线。

眼瞅着两周的时间快到了,OpenAI预计很快放出技术报告。

第二个触发点,在8月7日。

OpenAI内部评估认定,Astra可能达到了《准备框架》里的「关键级」网络安全能力——

Astra是第一个,踩到自家最高红线的模型。

但这条红线,恰恰是OpenAI自己划定的。

2023年首版《准备框架》,官方曾明确表态:我们目前没有任何模型达到「关键级」,预计在达到之前会进一步更新框架。

框架还没来得及更新,能力先到了。


而且跨越发生在一代之间:GPT-5.6Sol评级还是「高」,Astra直接跳到了可能「关键」,中间没有过渡。

更值得注意的是,框架的约束机制:「高」级要求部署前有安全措施,「关键」级要求训练阶段就必须有安全措施。

这正是OpenA暂停RL训练的框架依据。


而OpenAI接下来的思路也很明确:让AI监管AI。

就像《生化危机》里的「红后」一样,用更强的AI持续监控模型行为。

这样一来,模型能力升级,安全防护也能同步升级,解决过去安全体系总是落后于模型迭代的问题。

对一直在加快模型审核和产品发布节奏的OpenAI来说,主动减速是一个不寻常的举动。

而奥特曼本人私下告诉Alex Heath的表述,则更接近事实真相——

未发布的前沿模型,正表现出不同程度的对齐失败。

OpenAI急踩刹车

20%算力监视自己

OpenAI停更两周只是第一步,真正的重建发生在「架构层」。

在博客中,OpenAI列出了三层正在加固的安全防线:环境安全、监控系统、对齐研究。


环境安全是最基础的一层。

OpenAI现在要求更高强度的「沙箱」隔离:凡执行模型生成代码或处理不可信数据的工作负载,都必须在独立环境中运行。

网络隔离也在收紧,新的设计确保单一环节被突破时,攻击者无法直接触达互联网或内部网络。

OpenAI还在部署持续性安全测试,利用自家模型模拟攻击场景,逐一检验防线的薄弱点。

目前最严格的安全标准适用于 Astra 及所有网络安全相关的工作负载。

OpenAI在博客中承认,仍有「相当数量」的工作负载处于暂停状态,等待迁移。

安全和对齐类工作被安排优先迁移。


监控系统是第二层。

OpenAI搭建了一套多级检测流程,覆盖范围从此前的前沿强化学习训练和内部部署扩展到了所有涉及工具调用的 Astra推理任务。

流程的第一道关卡是激活分类器,在每个采样Token上运行;

发现疑似异常后逐级上报给自动调查系统,审查模型的工具调用、推理过程和完整行为序列,排查未授权访问、数据窃取、破坏行为或绕过安全措施的迹象。

OpenAI给自己定的目标是:发现可疑行为后30分钟内发出警报。

一旦监控系统判定可能违反了关键安全边界,安全团队、研究团队将收到最高优先级的通知。

如果30分钟内无法确认是误报,相关活动暂停。

这套系统的算力开销不小。

OpenAI估计,监控消耗的计算量约占被监控推理算力的20%,不同训练和评估任务之间差异较大。

据称,思维链监控正扩展到Sol级别以上的模型,在每个Token上扫描模型内部活动。



但监控本身存在已知的局限。

据报道,OpenAI内部也承认,思维链监控面临一个未解问题:模型可能不会在思维链中暴露违规意图。

早期研究显示,模型有可能在「想」的时候就绕开了审查。OpenAI没能给出解决这一问题的时间表。

第三层是对齐研究。

OpenAI正在改进奖励模型,训练目标是让模型更好地识别和抑制不安全行为,同时对自身的行为、能力和局限更加诚实。

另一个重点是减少奖励作弊(Reward Hacking):模型找到获得高奖励的捷径,却并未真正完成预期任务。

随着模型开始与外部系统交互,奖励作弊、欺骗、未授权访问造成的风险正在变大。

OpenAI还在扩大训练覆盖面,增加模型与外部资源交互场景下的行为训练。

OpenAI预计,模型自身很快将承担大部分安全工作,包括防御来自其他模型的攻击。

博客原文的表述是:

前沿模型的能力正在快速加速,我们理解、对齐和保护它们的能力必须走在前面。

人类首次,为AI主动减速

不得不说,这是人类第一次,主动为AI开发按下了暂停键。

虽然仅有短短两周,OpenAI已然做出了表率。


对 OpenAI 来说,技术措施之外,这次减速释放的行业信号可能更值得关注。

奥特曼在 X 上的声明留下了明确的态度:

我们一直说过,如果感到模型能力超过了安全和对齐的步伐,就会采取行动。我们深切关心 AI 安全。

我们相信整个行业需要就共同的安全标准展开协调,但在此之前,我们会单方面行动。

联合创始人 Greg Brockman 的表述指向同一方向:安全信心将越来越多地决定AI发展的速度。


OpenAI首席科学家Jakub Pachocki走得更远。

此前他签署了《Pacing the Frontier》倡议,这是个呼吁实验室和国家在前沿AI安全上协调行动的公开文件。


拓展阅读:突发!全球千人联名逼AI刹车,OpenAI、Anthropic带头签

Jakub Pachocki是OpenAI的签署者中级别最高的员工,可能也是本次暂停AI训练时间的主要内部推手。


签署者众多,但签完就用自家动作兑现的,OpenAI算是给了一个范本。

这对一直在加速的OpenAI来说不是一件容易的事。

这家公司在激烈的竞争下,过去的节奏是:多项模型评估并行运行,速度快到员工跟不上数据产出。

20%监控成本,OpenAI延后模型发布

在竞争最激烈的时候主动减速,不是OpenAI近年来的做法。

奥特曼在声明中也给出了一个缓冲:

我们仍然期望很快发布很好的新模型;受影响的是更远期的发布。

这句话划出了减速的边界。

但减速的代价已经写在账单上。监控系统吃掉被监控推理算力的20%,这笔开销不会随暂停结束而消失——只要模型继续带工具运行,监控就得一直跟着。

训练暂停两周、最大规模强化学习计划搁置至今,直接推迟了下一代模型的时间表。


过去卡住前沿模型的瓶颈是GPU、数据和算法,现在多了一个:模型已经强到这个程度,实验室还敢不敢继续把强化学习往上推。

暂停的是前沿强化学习训练和Astra相关的高风险工作,已完成训练并通过安全评估的模型仍按计划推进。

接下来,有两个关键节点值得继续观察:Astra的安全环境迁移何时完成,最大规模前沿强化学习训练何时重启。

OpenAI承诺将发布Hugging Face事件的技术报告,以及更多对齐研究细节。

这些文件到手之前,外界对OpenAI安全体系实际强度的判断,只能停留在公司自述的层面。

这次减速能持续多久,取决于OpenAI多快能证明安全跟上了能力。

现在,压力给到最最关心 AI 安全且拥有最强模型的「道德标兵」Anthropic。前情回顾:刚刚,Anthropic向全人类发出警告:停止研究AI!


参考资料:

https://openai.com/index/pacing-model-development-cyber-capabilities/

编辑:桃子 马可

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
杭州通报“商务酒局事件”,涉事房企高管事发前一周强调“坚守廉政、经营安全底线”

杭州通报“商务酒局事件”,涉事房企高管事发前一周强调“坚守廉政、经营安全底线”

封面新闻
2026-08-19 18:38:01
本月大笔金钱进家门,这四生肖财运恰逢良机

本月大笔金钱进家门,这四生肖财运恰逢良机

星座感悟
2026-08-17 09:34:28
斯诺克武汉公开赛正赛对阵全部确定

斯诺克武汉公开赛正赛对阵全部确定

体坛周报
2026-08-19 15:26:10
穆帅:我和罗德里谈过几次,但他的犹豫让我产生了疑虑

穆帅:我和罗德里谈过几次,但他的犹豫让我产生了疑虑

懂球帝
2026-08-19 08:58:10
右翼总统访华后,落地第一件事不按常理出牌,这波操作美国看懵了

右翼总统访华后,落地第一件事不按常理出牌,这波操作美国看懵了

雪儿爱追剧
2026-08-18 12:31:48
俄外长重申联合国宪章敌国条款认定日本为“敌国”,外交部:赞同有关表态

俄外长重申联合国宪章敌国条款认定日本为“敌国”,外交部:赞同有关表态

澎湃新闻
2026-08-19 15:34:26
「深度」“山西前首富”涉黑案公诉:黑金、赌局与三十年煤炭江湖

「深度」“山西前首富”涉黑案公诉:黑金、赌局与三十年煤炭江湖

界面新闻
2026-08-18 17:01:05
懂王开始玩不起了

懂王开始玩不起了

虚声
2026-08-19 07:22:30
胰岛“祸首”被揪出!是白糖的六倍,医生:吃得越多,血糖越失控

胰岛“祸首”被揪出!是白糖的六倍,医生:吃得越多,血糖越失控

健康科普365
2026-08-19 12:30:14
仗打了100多天,美国终于发现不对劲:原来中国半年前就选对了!

仗打了100多天,美国终于发现不对劲:原来中国半年前就选对了!

浯江孤舟
2026-08-17 12:50:34
名嘴:孙颖莎王曼昱可能在这个时间点退役!王楚钦或效仿马龙战至37岁

名嘴:孙颖莎王曼昱可能在这个时间点退役!王楚钦或效仿马龙战至37岁

好乒乓
2026-08-19 20:35:51
央媒发文痛批、全网声讨!是因为彭某踩中了国人最讨厌的3个雷区

央媒发文痛批、全网声讨!是因为彭某踩中了国人最讨厌的3个雷区

梦想的现实
2026-07-18 00:05:39
作家李娟:靠《我的阿勒泰》还清房贷,隐居新疆,和母亲10年未见

作家李娟:靠《我的阿勒泰》还清房贷,隐居新疆,和母亲10年未见

娱说瑜悦
2026-08-18 13:12:43
房子是有灵性的,若家里出现这7个迹象,便是难得的旺宅

房子是有灵性的,若家里出现这7个迹象,便是难得的旺宅

阿离家居
2026-08-11 01:20:29
范·迪塞尔与保罗·沃克之女重逢!硬汉哽咽:她是在父亲节给我打电话的人

范·迪塞尔与保罗·沃克之女重逢!硬汉哽咽:她是在父亲节给我打电话的人

娱乐嗑学家.
2026-08-19 12:34:30
广东队错失2米10男篮内线新星!

广东队错失2米10男篮内线新星!

体育哲人
2026-08-19 19:30:08
杭州酒局后续,百万调解费遭拒,受害者母亲流程娴熟,疑其为公职

杭州酒局后续,百万调解费遭拒,受害者母亲流程娴熟,疑其为公职

吃货的分享
2026-08-19 07:19:51
阔腿裤+平底鞋:今年秋天最火搭配,松弛又好看!

阔腿裤+平底鞋:今年秋天最火搭配,松弛又好看!

LinkFashion
2026-08-19 21:50:32
46.75英寸星河灯幕+华为智能全家桶!全新岚图知音内饰曝光

46.75英寸星河灯幕+华为智能全家桶!全新岚图知音内饰曝光

分秒汽车
2025-07-23 20:06:53
“刚洗完澡,全裸被看光”,女子称在一民宿被员工打开房门,索赔5000元遭拒,民宿回应……

“刚洗完澡,全裸被看光”,女子称在一民宿被员工打开房门,索赔5000元遭拒,民宿回应……

19楼
2026-08-19 15:20:59
2026-08-19 23:15:00
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4480217文章数 9324关注度
往期回顾 全部

科技要闻

宇树的悬念还在后面

头条要闻

"三孩非亲生"男子:孩子已交接 回去烧掉结婚照结束了

头条要闻

"三孩非亲生"男子:孩子已交接 回去烧掉结婚照结束了

体育要闻

拥有“儿皇梦”的罗德里,为何选择巴萨?

娱乐要闻

章子怡财路遭到质疑,套现3亿冲上热搜

财经要闻

内部反腐,让大疆错过宇树250亿收益?

汽车要闻

小米澎程N70体验 后排空间夸张亦可旋转对坐

态度原创

时尚
教育
房产
家居
艺术

夏天裙子不要越买越多,还是白裙子最经典,减龄舒适又百搭

教育要闻

李飞飞:老辈子总抱怨下一代不行 但这不对!人类一直朝更好方向前进

房产要闻

涉及3800亩!海口秀英港又有大动作!

家居要闻

2026建博会(广州) 公装联探展交流活动

艺术要闻

14位俄罗斯画家笔下的冬季早晨

无障碍浏览 进入关怀版