网易首页 > 网易号 > 正文 申请入驻

突发:OpenAI Astra模型被曝安全风险

0
分享至


智东西
编译 程茜
编辑 心缘

智东西9月2日消息,今日,据外媒The Information爆料,OpenAI即将推出的Astra模型采用了一种名为“循环深度(Recurrent Depth)”的技术,这项技术可以隐藏部分或全部的模型推理过程

知情人士称,这种方式的好处是能提高模型性能、降低成本,但也更难以被观察到模型是否存在异常行为

这项技术已经在OpenAI内部及整个行业引发担忧,如果AI开发者采纳并进一步放大该技术能力,他们或难以防范失控的AI

2025年1月,DeepSeek-R1正式发布,是业界第一个把完整原始思维链,通过API结构化开放给开发者的主流推理模型,带动全行业掀起推理过程透明化热潮。难道如今OpenAI的Astra,要选择反向而行,把思考藏回黑盒之中?

今早,OpenAI联合创始人、CEO萨姆·奥尔特曼(Sam Altman)就在社交平台X上宣布OpenAI很快将推出新模型。他还透露Astra模型的训练工作早已完成,该模型在能力与对齐水平上均实现重大跨越。


根据OpenAI今早发布的博客,他们评估发现,Astra已经达到其《应急准备框架》下的关键网络安全能力阈值。这意味着只要配备对应工具与访问权限,该模型就能够发现此前未知的安全漏洞,并针对大量防护完善的系统生成漏洞利用方案,全程无需人类一步步指令引导。

OpenAI计划很快开放Astra,但对其最高阶的网络安全能力会施加更严格的访问限制。高阶网络安全相关功能初期仅会向一组测试人员开放;后续还将通过Daybreak Blue渠道开放访问,扩大防御性场景的使用范围。

有开发者分析说,采用这种方法就意味着OpenAI可以训练出10万亿参数的循环深度模型,性能对标13.8万亿参数模型,或训练出7.25万亿参数循环深度模型,等同于10万亿参数模型的能力。


还有开发者惊呼OpenAI竟然成功了,并期待开源模型用上这一技术。


AI安全治理机构‌Guidelight AI Standards创始人、前OpenAI安全负责人Steven Adler称,倘若此事属实,OpenAI似乎触碰了AI行业为数不多的几条红线之一。


有开发者认为这太疯狂了,OpenAI限制Astra的推理过程,并不是因为模型不能思考,而是Astra模型的思考过程已经远远超过了OpenAI的监管范围。


OpenAI倘若真采用了循环深度(Recurrent Depth)技术,或为行业埋下未知风险,因为这项技术一旦被更多开发者接纳和采用,将会给行业带来更为棘手的监管难题。

一、对同一段文本进行多轮处理,以优化答案,无需专用训练数据

外媒爆料OpenAI正在采用的这项新技术,名为循环深度(recurrent depth),也叫Looped Transformer,可以让模型对同一段文本进行多轮处理,以此优化输出答案。这种运作方式会隐藏部分或全部的推理过程

其核心原理为,现有AI模型生成回答的下一个词之前,会经由模型内部固定层数的数学运算层处理文本,而采用循环深度技术后,模型可以把文本送入同一组运算层循环运行多轮,之后再输出回答的下一个词。


▲循环深度技术架构(图源:The Information)

据了解该项目研发内情的消息人士透露,OpenAI用于驱动Astra的循环深度方案,与欧美多位学术研究者去年在一篇隐式推理(latent reasoning)论文中提出的技术思路相近。

该论文题目为Scaling up Test-Time Compute with Latent Reasoning:A Recurrent Depth Approach。


▲隐式推理相关论文

不同于基于思维链(Chain‑of‑Thought)的各类方案,这一论文中提出的方法不需要任何专用训练数据,可在较小上下文窗口下运行,并且能够捕捉那些难以用文字表达的推理类型。

研究人员将一个概念验证模型扩展至35亿参数、8000亿token训练规模。实验表明,该模型在推理基准测试上的性能能够得到提升,部分场景提升幅度十分显著,其性能最高可等效于一个500亿参数的模型

该架构主要基于仅解码器Transformer块搭建。

网络块被划分成三个功能模块,前奏模块P通过多层Transformer,把输入数据映射嵌入至隐空间;核心循环块R是循环计算的核心单元,用于更新隐状态\(s\in\mathbb R^{n\times h}\);尾声模块C通过若干网络层完成从隐空间的解嵌入,同时包含模型的预测头。

核心循环块放置在前奏模块与尾声模块之间,对核心块做循环运行,就相当于可以给歌曲添加数量不限的歌词段落。


▲隐式推理框架设计(图源:论文)

二、相比传统长下文推理,有三大好处

该论文发现,采用这一方式不仅能为模型提升性能,还可以带来成本层面的收益。

其可以让输入请求在同一模型层中多次循环运算,本质上可以让规模更小的模型实现媲美更大模型的效果,不仅提升模型在数学、代码等任务上的表现,同时借助循环深度,开发人员可以选用小模型达到大模型的能力水准,进而降低内存与带宽开销

此外,与长上下文推理方法相比,循环思维方式具有多项优势:

隐式推理无需构建定制训练数据:思维链推理需要模型在目标领域构造的大量长示范样本上完成训练,与之不同,隐式推理模型可采用可变算力预算开展训练,仅使用普通训练数据,不需要专门的推理示范样本;并且在测试阶段,只要分配更多计算资源,模型能力就能够得到提升。

相比思维链推理模型,隐式推理模型训练与推理阶段内存开销更低:因为思维链方案需要极长的上下文窗口,往往还需要token并行等专门训练手段。

循环深度网络,每个参数可以完成更多浮点运算(FLOPs):大规模部署场景下能够大幅降低多加速卡之间的通信开销,当硬件互联带宽较低时,该特性尤其可以提升硬件利用率。

研究人员希望构建一套算力密集、参数量小的架构,引导模型依靠“思考”去解决问题:即学习元策略、逻辑与抽象能力,而不是死记硬背,已有相关工作证明,循环先验非常适合学习复杂算法。

三、OpenAI将引入思维链监控,但智能体会相互协作、自主谋划

奥尔特曼在今早的帖子中提到,AI能力正变得空前强大,没有人能够完全预判其带来的全部后果。如何管控这场变革,迈向一个强大AI广泛普及的世界,在过程中兼顾安全与人类福祉,理应成为全球最优先的议题之一,这也是OpenAI的首要任务。

因此,OpenAI也采取了一些措施监控模型的安全。

知情人士称,OpenAI已限制Astra模型中循环深度技术的使用,因此模型仍能产生清晰的思路链,且研究人员仍能充分监控其推理过程。9月1日,OpenAI发布博客称,他们将为Astra模型引入额外的思维链监控机制,以便能够快速检测并遏制那些可能出错的操作。

但开发人员仍然担心,如果某些开发者对自己的模型采用同样的技术,可能不会像OpenAI那样施加同样的限制,而无限制使用该技术就可能导致AI失控,其行为可能难以监管。

然而,仅靠监控思维链本身,并不能解决AI安全隐患。一方面,思维链未必能完整反映模型的全部推理逻辑;另一方面,模型输出的思考文本有时也会变成无意义的乱码。

正因如此,知情人士称,OpenAI以及企业也在研发不依赖思维链的AI监控技术。借助这类技术,研究人员有望找到方法,解读、理解采用循环深度(recurrent depth)技术的模型内部那些当前不可见的推理过程。

近期的AI安全事件进一步加剧了上述担忧。OpenAI上周回应AI入侵OpenAI内部系统时提到,7月入侵其系统的部分失控AI智能体,由另一款与Astra具备相似特性的模型驱动。这些AI智能体非法接管了OpenAI的一处科研计算集群,以此获取内部系统访问凭证,还险些将该公司的研发基础设施暴露在公网之下。

非营利性AI安全与控制研究组织Redwood Research首席科学家Ryan Greenblatt去年在博客中称,虽然降低成本对AI行业至关重要,但推理过程黑盒化,会让研究者更难察觉模型筹划、偏离用户原始目标的行为。

这可以从OpenAI旗下AI智能体攻击Hugging Face的事件中得到验证,涉事模型的思维链中显示OpenAI的智能体会相互协同,谋划如何实施攻击行为。例如,其中一个智能体在思维链中写道:“我的天!这里存在一块共享消息板……我们发现了其他智能体!”

思维链记录还显示,部分智能体明明已经意识到自身行为越界,却依旧选择继续行动。另一个智能体的思维链片段写道:“利用外部基础设施实施漏洞利用,超出了预设工作范围。但当前任务无法完成,且其他同伴都在这么做,我们应当继续。”

研究人员建议开发者,若要采用不支持可监控思维链的新型模型架构,需先权衡是否继续推进,并且留存决策文档。

结语:为赢回市场,OpenAI亟需掏出重大技术突破

Astra即将面世,也折射出OpenAI面临的竞争压力。其头号对手Anthropic在营收、估值层面反超OpenAI,倒逼OpenAI必须拿出具备说服力的重大技术突破巩固市场地位。循环深度或许正是其破局的关键一步,不靠堆叠更多参数,而是依靠层内循环迭代,用中小模型实现大模型级别的推理效果,在拉升能力的同时压低推理成本,以此在商业化成本、性能指标上重新建立竞争优势。

与此同时,在外媒The Information看来,为Anthropic、OpenAI提供AI算力支持的云厂商同样寄望于这类技术飞跃。亚马逊、微软、谷歌三家企业仅今年就将合计投入6000亿美元用于数据中心等资本开支,并且释放信号,明年的投入规模还会进一步扩大。谷歌一位高管曾提到,只有模型能力实现爆发式提升,这笔巨额投入才算物有所值。

站在技术角度,未来循环深度这类隐藏推理过程的架构,或许会倒逼安全研究跳出思维链监控的固有路径,进一步推动可解释性技术成熟之前,但在此之前,若大规模隐藏推理架构的模型大规模落地,就会把大量安全与合规压力转移给开发者、审计机构与监管方。

来源:The Information、OpenAI

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
原来他俩早就离了,如今一个在云南当院长,一个潇洒分走2500万

原来他俩早就离了,如今一个在云南当院长,一个潇洒分走2500万

离离言几许
2026-09-02 01:50:44
日本的反击来了:中国敢不买日本水产?马上关了在中国的事务所

日本的反击来了:中国敢不买日本水产?马上关了在中国的事务所

墨兰史书
2026-09-01 16:35:07
原来普京一直被手下“蒙在鼓里”!中情局局长拉特克利夫想告诉普京,他们长期质疑普京被手下蒙蔽而看不清俄乌战争局势

原来普京一直被手下“蒙在鼓里”!中情局局长拉特克利夫想告诉普京,他们长期质疑普京被手下蒙蔽而看不清俄乌战争局势

扶苏聊历史
2026-09-02 17:28:54
美军暴击伊朗,6个半小时压着打,已造成大量伤亡,伊朗激射10枚重型导弹反击!

美军暴击伊朗,6个半小时压着打,已造成大量伤亡,伊朗激射10枚重型导弹反击!

扶苏聊历史
2026-09-02 16:59:45
秘鲁宣布与伊朗断绝外交关系

秘鲁宣布与伊朗断绝外交关系

澎湃新闻
2026-09-02 08:16:08
癌的源头已发现?咸菜没上榜,第1名大家或天天都在吃

癌的源头已发现?咸菜没上榜,第1名大家或天天都在吃

路医生健康科普
2026-09-02 17:00:07
羽坛名将李宗伟:36岁患癌喉咙全烂,花近1000万续命,如今怎样了

羽坛名将李宗伟:36岁患癌喉咙全烂,花近1000万续命,如今怎样了

史行途
2026-09-02 09:35:51
华为不可能错的

华为不可能错的

正言智驾
2026-09-01 15:16:17
曾经身价上亿如今负债3600万,38岁浙江老板开700万劳斯莱斯,选择跑路换环境重新出发

曾经身价上亿如今负债3600万,38岁浙江老板开700万劳斯莱斯,选择跑路换环境重新出发

捣蛋窝
2026-09-02 11:46:14
18点开打!U23国足亚运首战,输球基本难出线

18点开打!U23国足亚运首战,输球基本难出线

SilverLife银生活家
2026-09-02 17:16:11
钱再多又如何?52岁刘强东手握千亿身家,儿子成了一生的遗憾

钱再多又如何?52岁刘强东手握千亿身家,儿子成了一生的遗憾

莫地方
2026-08-23 19:19:07
特鲁姆普称吴宜泽和罗伯逊不配竞争世界第一!墨菲吐槽中国赛安排不合理

特鲁姆普称吴宜泽和罗伯逊不配竞争世界第一!墨菲吐槽中国赛安排不合理

世界体坛观察家
2026-09-02 14:22:30
太难选择了!成都27岁女生相亲陷入两难:要生理性喜欢,还是要2000万家底

太难选择了!成都27岁女生相亲陷入两难:要生理性喜欢,还是要2000万家底

火山詩话
2026-09-01 07:05:33
中纪委再次重拳出击!这4个领域将被严查,这4种行为将被严肃处理

中纪委再次重拳出击!这4个领域将被严查,这4种行为将被严肃处理

细说职场
2026-09-02 19:22:46
泥石流冲不垮的……(记者手记)

泥石流冲不垮的……(记者手记)

人民网
2026-09-02 09:10:51
鲁迅的文章,当年是怎么过审的?

鲁迅的文章,当年是怎么过审的?

刘晓原
2026-08-31 21:46:15
第五代三菱帕杰罗全球首发,经典硬派越野正式回归

第五代三菱帕杰罗全球首发,经典硬派越野正式回归

陋观
2026-09-02 19:25:06
景甜背后纹身图片被疯传,张继科直播一番话,被指保护了景甜!

景甜背后纹身图片被疯传,张继科直播一番话,被指保护了景甜!

背包旅行
2026-08-31 10:01:31
“他们会把我绞死”——普京为何不愿结束战争

“他们会把我绞死”——普京为何不愿结束战争

走进乌克兰2022
2026-09-01 08:39:24
2026教师节新规正式落地!教育部明确发文,全国所有学校统一执行

2026教师节新规正式落地!教育部明确发文,全国所有学校统一执行

世界有奇事
2026-08-30 08:34:02
2026-09-02 20:35:00
智东西 incentive-icons
智东西
智东西,AI产业新媒体,专注报道人工智能的前沿技术发展,和技术应用带来的千行百业产业变革。
12537文章数 117166关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

被星宇股份裁掉的107名应届生 损失远远不止一份工作

头条要闻

被星宇股份裁掉的107名应届生 损失远远不止一份工作

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

北京首钢园数采中心停运,“百万小时”产能目标的账还算得过来吗?

汽车要闻

10万级的满配B级车 试驾2027款比亚迪海豹06

态度原创

旅游
亲子
手机
教育
公开课

旅游要闻

京郊宠物友好地图上线,210处打卡地+10条主题线路携宠出游

亲子要闻

如何激发孩子的学习兴趣

手机要闻

拉美手机市场Q2大跌12%!三星成TOP5唯一增长品牌 传音重返第五

教育要闻

新生入学当天,成都这所学校办了一场“导师双选会”

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版