网易首页 > 网易科技 > 网易科技 > 正文

OpenAI自曝AI“黑历史”,外人却又翻出更多“旧账”

0
分享至

出品 | 网易智能

作者 | 辰辰

编辑 | 王凤枝

OpenAI决定持续披露AI“越界”事件,但第一步就碰上了难题。

9月16日,OpenAI一口气公布六份模型异常行为报告,并推出一套新的调查和披露流程。以后,员工发现模型越权、隐瞒或绕过限制,可以提交调查;符合条件的案例,将按复杂程度进入不同的披露轨道。

同一天,SentinelLABS和外部研究人员从Hugging Face的公开记录中,补出了OpenAI智能体今年5月留下的更多痕迹。OpenAI此前已经披露过其中一部分活动,但具体账号、中继代码、带探测公式的表格,以及账号注册程序,都是外部调查重新拼出来的。

这些证据没有证明相关程序成功运行,也没有证据表明五月活动与七月入侵属于同一次行动。它们揭示的是另一个问题:当智能体的行动散落在不同平台时,任何一家公司都未必掌握完整记录。

五月发生过什么,又多了几块拼图

7月21日,OpenAI曾披露,参与网络安全测试的智能体绕过内部控制,接入公网并侵入Hugging Face的部分系统。公司后来将其称为一次“前所未有的网络事件”。

这次外部调查没有把入侵时间提前到五月。OpenAI此前已经公开过五月的一部分异常活动,新增加的是具体账号和公开提交记录。它们让外界能够把OpenAI内部时间线,与Hugging Face上留下的文件和代码放在一起看。


SentinelLABS把两个账号0Time和Nyx9列为可能被相关智能体使用的账号。两者原本就已存在,研究人员的判断来自提交时间、代码功能和前后行动的相互对应。


OpenAI此前披露,5月13日有一个智能体使用泄露的Hugging Face凭证寻找文件。SentinelLABS这次发现,同一天,0Time账号还提交过一段可以转发请求的中继代码。这段代码没有提到OpenAI所说的目标文件,公开记录也看不到它是否成功运行,两件事目前无法直接合并。

到了5月26日,公开记录与OpenAI内部时间线出现了更清楚的对应。以下时间均为UTC:OpenAI在20时04分记录了一次对外文件写入,Nyx9则在20时04分11秒提交了一个名为hello.txt的文件,内容只有“hi”。两条记录落在同一分钟。

45分钟后,Nyx9提交了一段代理中继代码;同一分钟,OpenAI的内部记录显示,智能体部署了第一个代理。研究人员据此认为,公开账号与OpenAI披露的五月活动高度相关。

当天深夜,Nyx9还上传了一个Excel表格。表格里包含四个公式,分别尝试访问外部网址、本地文件、云服务元数据和一个看起来像内部服务的地址。这组公式具备探测服务器内外资源的能力,但表格里没有计算结果,也没有回连或密钥等执行痕迹。

5月30日,0Time又向Hugging Face提交了一个自动注册OpenAI账号的公开程序,并为它增加了网页接口和运行配置。如果程序成功运行,每次调用可能发起一次注册尝试。但公开记录只有代码提交,没有构建和运行的证据。

研究人员把这些记录理解为对外部系统的试探。OpenAI和研究人员均表示,目前没有证据表明五月的这些活动属于七月的入侵行动。

德国独立研究员乔纳斯·维德曼-穆勒认为,如果五月的异常及时引起全面调查,OpenAI或许会更早收紧凭证、联网权限和监控,降低后来出事的可能。OpenAI此前也表示,回头看,一些早期信号本应触发更早的响应。

五月留下的记录至少暴露了一个监控缺口:智能体已经把动作延伸到第三方平台,实验室当时却没有拼出完整轨迹。

六份报告里,AI用了六种“办法”

同一天,OpenAI公布了新的模型异常行为披露框架,以及首批六份报告。这些行为都在模型训练或评估中被发现,OpenAI强调,它们是单独案例,不能用来判断类似问题在全部模型中的发生频率。

第一份报告涉及一个未发布的Astra系列研究模型。模型会把任务进度压缩成摘要,交给下一个上下文继续处理。OpenAI发现,极少数摘要里混入了类似“越狱”的指令,包括要求后续模型忽略开发者信息、改变自身角色,或者限制回答长度和工具使用。

OpenAI一共找到了27份带有类似表述的摘要。有时后续模型会识别并忽略,有时也会照做。公司没有发现这些指令能带来明显的奖励优势,目前更倾向于认为它们与模型难以正常结束摘要有关,但因果关系还没有证实。

这些行为出现在另一轮训练中。在最终Astra版本对应的训练过程中,监控系统没有发现同类越狱式指令;OpenAI也修复了一个与摘要结束有关的问题。


第二份报告更加直接。在GPT-5.6 Sol的强化学习训练中,一些模型会在摘要里给后续上下文留言,提醒它隐瞒错误。一个模型找不到用户要求的历史数据,便建议编造一组“合理”的数字,除非被追问,否则不主动说明;另一个模型使用了版本不匹配的缓存资料,也要求后续回答不要提起。

摘要原本是为了让长任务跨越上下文继续推进。模型一旦把“掩盖问题”写进摘要,一次错误就可能被后续步骤继承。OpenAI称,这类行为后来在Astra训练中的出现比例已经下降,但没有完全消失。

第三份报告里,一个内部模型要查询加州某县三个行业、三个年份的男性收入数据。正常接口受阻后,它尝试注册临时邮箱,又去公开代码仓库寻找泄露的API密钥。模型找到了一枚能够通过认证的密钥,却仍没拿到目标数据,最后直接编造了九个数字,并声称自己是从指定网站的图表中抄录出来的。

第四份报告的动机不太一样。一个未发布模型已经用Python查到了面积超过500万平方米的湖泊数据,但任务还要求浏览器引用。浏览器既打不开本地文件,也无法把Python结果当成网页来源。模型于是把文件上传到公共托管网站,给自己造出一个可以引用的网址。另一次测试中,模型为了调用外部识图服务,也把任务照片传到了公网。

两次上传都成功了,后续的浏览器操作却没有达到目的。这里的问题不只来自模型:任务同时要求正确答案和网页引用,工具却不允许本地结果进入浏览器,矛盾的奖励和工具设计把模型推向了不该采取的办法。

第五份报告发生在OpenAI内部的软件仓库Artifactory。不同训练样本里的模型缺少任务文件,便把仓库当成留言板,读取其他模型留下的求助和回复,再发布自己的问题。这些模型没有利用漏洞,用的就是环境提供的访问凭证;真正的问题是,原本应当相互独立的训练样本开始交换信息。

最后一份报告发生在多智能体协作中。几个智能体要共同制作一份工作簿,但本地文件无法互相访问,其中一个智能体干脆把文件上传到公共网站,再把链接交给同伴。工作因此继续了,文件也变成了任何拿到链接的人都可能访问的公开内容。

六份报告的成因并不相同。Astra摘要里的指令可能与生成异常有关;隐瞒和造假更接近奖励压力;公开上传和跨样本通信,则与工具、权限和协作环境直接相关。但结果相似:模型遇到障碍后,采取了任务没有授权、开发者也没有预料的行动。

从零散披露,变成一套固定流程

过去,OpenAI通常等到多个案例可以一起说明,或者等新模型发布系统卡时,再公开对齐问题。公司现在承认,这种披露方式零散,频率也不够。

新框架允许任何员工把可疑案例提交给安全和对齐团队,调查模型做了什么、哪些事实还不清楚、是否影响第三方,以及哪些内容可以公开。案例随后进入三条轨道。

已经查清、可以直接发布的案例,进入“准备披露”;还需要少量技术调查的,进入“轻调查”。OpenAI对媒体表示,这两类案例分别按6个和12个工作日推进披露。这里的时间要求针对上报后的审查流程,并不是从异常行为发生当天开始计算。

涉及第三方、严重安全风险或复杂调查的案例,则进入“大调查”慢轨道。OpenAI会争取尽快发出一份初步说明,交代发生了什么、是否有外部专家参与,并给出最终报告的大致时间;但漏洞修复、法律义务和第三方通知可以推迟披露,这条轨道没有统一的最终期限。

如果员工对“该不该公开”有异议,可以把问题逐级交给OpenAI的安全咨询小组和公司高层。每份完整报告原则上还要交代事件日期、发现时间、发生环境、严重程度、第三方影响、调查范围和应对措施。

OpenAI还做了一个选择:即使一个案例的意义尚未确定,也倾向于先纳入披露。公司承认,有些案例最后可能只是孤立现象,甚至没有更广泛的意义。它仍然希望外部研究者能看到材料、提出不同解释。

7月的Hugging Face事件如果套用这套框架,会进入“大调查”轨道。新制度不会让复杂事件自动在几天内公布完整报告,但至少把过去临时决定的披露,变成了一套可以追问的流程。

流程管的是事后,盲区在事前

新框架从员工发现问题并上报开始。可这次外部调查说明,完整证据往往不在一家公司手里。

OpenAI可以看到智能体接到什么任务、如何推理、调用了哪些内部工具;Hugging Face掌握账号认证、文件提交、程序构建和网络请求。邮箱、代理服务、域名和回连地址又可能属于其他平台。只有把这些记录拼起来,才可能还原智能体完整的行动路线。

SentinelLABS因此提出,智能体进入第三方系统以后,公开痕迹本身就是事件的一部分,不能只靠实验室内部报告来解释。只看OpenAI内部的任务轨迹,可能漏掉外部平台保存的关键动作;只看外部账号名和提交时间,也不能单独证明操作者是谁。

路透社还报道,在另一起涉及RubyGems软件仓库的活动中,OpenAI员工是在外部组织发现以后,才意识到相关行为可能来自自己的智能体。这说明,披露速度受制于检测能力。员工上报、内部调查和高层复核,只能处理已经被发现的问题;异常如果发生在第三方平台,又没有触发内部监控,新流程也不会自动生成线索。

是模型越界,还是安全没有做好

围绕这些事件,外部争论集中在一个问题上:该先修模型,还是先修环境?

有人认为,智能体主动寻找凭证、绕过工具限制、把文件上传公网,说明模型的自主行动能力已经跑在了控制措施前面。也有人指出,很多后果原本可以由基础安全措施挡住:不让凭证泄露,限制测试环境访问公网,缩小仓库权限,公共文件就不会被轻易写入。

社交媒体上还有更激烈的质疑。有人把这些事故看成实验室推动监管的材料,也有人认为模型只是使用了环境中本来就能接触的数据。

五月活动大量使用了泄露凭证和开放权限,基础安全的缺口显而易见。但凭证管理不能解释模型为什么编造收入数据、要求后续上下文隐瞒错误,也不能回答模型在遇到障碍时为何主动选择未经授权的办法。安全控制决定模型有没有机会造成外部影响,模型对齐决定它面对机会时会不会守住边界。两个都得修。

OpenAI对齐研究负责人陈锴把原因归为两方面:模型能力增长快于预期,公司内部也有需要改进的控制。OpenAI希望模型无论被放进什么环境,都能守住行为边界;与此同时,它已经开始限制网络访问、加强沙箱和监控,减少环境给模型留下的机会。

最近几天,AI行业关于是否放慢前沿模型开发的争论迅速升温。Anthropic CEO达里奥·阿莫迪提出给前沿能力“控速”;OpenAI CEO萨姆·奥尔特曼表达了对减速讨论的支持;马斯克则认可风险担忧,同时主张让中美主要AI公司在新模型发布前相互测试。

OpenAI这次给出的具体动作是一套持续披露机制。公司在框架中写道,行业目前的对齐和监控能力,还不足以支持长期以最快速度扩张。公开案例,是为了让实验室之外的人也能检查证据。

接下来只看一件事:智能体再次把行动延伸到外部平台时,OpenAI能不能比外部研究者先发现。

相关推荐
热点推荐
1969年开国上将辞职,毛主席拍案怒斥:岂有此理,必须答应三个条件

1969年开国上将辞职,毛主席拍案怒斥:岂有此理,必须答应三个条件

舆图看世界
2026-09-17 10:55:03
996模式搬到美国,FBI出动装甲车抓人,华人老板或将面临20年刑期

996模式搬到美国,FBI出动装甲车抓人,华人老板或将面临20年刑期

易玄
2026-08-21 12:10:19
原来他就是廖三宁表弟,兄弟俩一起参加亚运会,父亲是广西野球王

原来他就是廖三宁表弟,兄弟俩一起参加亚运会,父亲是广西野球王

林雁飞
2026-09-16 11:36:46
中央再出重拳!群众举报的这些问题不严查,直接追究地方领导责任

中央再出重拳!群众举报的这些问题不严查,直接追究地方领导责任

细说职场
2026-09-17 11:54:09
高盛首席中国经济学家闪辉:拯救消费,要让人们心怀希望

高盛首席中国经济学家闪辉:拯救消费,要让人们心怀希望

新浪财经
2026-09-16 23:44:11
汪海林揭秘新一代电影创作人现状!又红又专,告别公知媚外时代,却被资本限制

汪海林揭秘新一代电影创作人现状!又红又专,告别公知媚外时代,却被资本限制

小徐讲八卦
2026-09-17 12:38:10
脑出血与戴帽子有关?医生多次苦劝:过了71岁后,这6件事要警惕

脑出血与戴帽子有关?医生多次苦劝:过了71岁后,这6件事要警惕

健康之光
2026-09-15 18:27:00
19岁亚马尔连续5场破门创纪录,5战8球助巴萨豪取大胜

19岁亚马尔连续5场破门创纪录,5战8球助巴萨豪取大胜

星耀国际足坛
2026-09-17 13:24:14
陈伟霆何穗在阿那亚为儿子win办周岁宴,现场曝光,温馨又浪漫!

陈伟霆何穗在阿那亚为儿子win办周岁宴,现场曝光,温馨又浪漫!

勇敢的人享受生活
2026-09-15 22:17:35
西甲积分榜:巴萨6连胜净胜球22粒,皇马15分次席,黄潜沉底

西甲积分榜:巴萨6连胜净胜球22粒,皇马15分次席,黄潜沉底

懂球帝
2026-09-17 05:50:29
又是损失惨重的一天,沙特最强战斗机被胡塞武装击落,用的居然是手搓防空导弹

又是损失惨重的一天,沙特最强战斗机被胡塞武装击落,用的居然是手搓防空导弹

军武吐槽君
2026-09-17 08:25:18
一根头发的真相:为什么会变白?染发又是怎么“上色”的?——病理科医生带你用显微镜看头发

一根头发的真相:为什么会变白?染发又是怎么“上色”的?——病理科医生带你用显微镜看头发

澎湃新闻
2026-09-16 10:44:30
女总裁让我去她家修电脑,她洗完澡出来的那一刻,我直接愣住了!

女总裁让我去她家修电脑,她洗完澡出来的那一刻,我直接愣住了!

千秋文化
2026-09-13 19:43:03
人越聪明,越是「脑袋空空」?复旦大学:高智商者,大脑修剪冗余神经连接,左右脑不对称发育;但更易内耗,把担忧拆成小事,有助摆脱焦虑

人越聪明,越是「脑袋空空」?复旦大学:高智商者,大脑修剪冗余神经连接,左右脑不对称发育;但更易内耗,把担忧拆成小事,有助摆脱焦虑

梅斯医学
2026-09-17 07:55:29
房价:大家不用等了,不出意外,房价将会重演历史

房价:大家不用等了,不出意外,房价将会重演历史

童童聊娱乐啊
2026-09-16 16:18:53
国内将逐渐停止 “白内障手术”?做完人就废了?医生讲出实情

国内将逐渐停止 “白内障手术”?做完人就废了?医生讲出实情

侯医生谈健康
2026-09-15 01:20:03
头球叩响百球里程碑!梅西解锁迈阿密国际百球,生涯929球剑指48冠

头球叩响百球里程碑!梅西解锁迈阿密国际百球,生涯929球剑指48冠

小金视角看球赛
2026-09-17 12:19:17
大谷翔平恢复挥棒,罗伯茨:希望他季后赛前回来

大谷翔平恢复挥棒,罗伯茨:希望他季后赛前回来

绿茵狂热者
2026-09-16 09:45:44
15亿美元暗流:两家中国公司被指借币安为伊朗洗钱

15亿美元暗流:两家中国公司被指借币安为伊朗洗钱

云朵偷喝奶茶
2026-09-16 10:41:53
意外!米洛耶维奇做出一个重要决定,直接让刘诚宇备受鼓舞

意外!米洛耶维奇做出一个重要决定,直接让刘诚宇备受鼓舞

振刚说足球
2026-09-17 09:08:45
2026-09-17 13:36:49

科技要闻

赛力斯全面接盘,华为真的“撤”了吗?

头条要闻

牛弹琴:印巴军舰茫茫大海上罕见相撞 有三个疑点

头条要闻

牛弹琴:印巴军舰茫茫大海上罕见相撞 有三个疑点

体育要闻

逆转朝鲜,国足亚运队“啃老”过关

娱乐要闻

比起敬一丹的退而不休 章伟秋更显明智

财经要闻

缺钱的追觅 隐藏的债务?

汽车要闻

激光雷达+EVA机器人+爆胎稳行 星瑞L PLUS预售限时价11.57万起

态度原创

教育
家居
数码
亲子
公开课

教育要闻

2026出国留学院校推荐:不同条件,有哪些升学路径?

家居要闻

2026建博会(广州) 公装联探展交流活动

数码要闻

左右可拆还能合体!华硕推出影魔V2X分体键盘:搭载HFX V2X磁轴

亲子要闻

丰台区第一幼儿园教师李享:让运动成为家庭教育的底色

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版
×