来源:环球市场播报
OpenAI首席科学家Jakub Pachocki于9月6日在公司网站发表长文《一颗外星心智》(An Alien Mind),对前沿人工智能能力持续快速提升发出迄今相当明确的警告。
他在文章中写道:“这是一个需要极度谨慎的时刻。我担心,对于机器智能持续快速崛起所带来的后果,目前没有任何人做好了准备。”
文章发布时,距离OpenAI推出最新旗舰模型GPT-6 Astra仅数日。帕乔茨基表示,公司将继续寻找对齐和监测方面的技术解决方案,建设针对高能力模型的防御体系,并在安全信心不足时保留单方面停止进一步扩容的可能性。
![]()
但他认为,仅靠单家公司内部的安全措施已经不够,“还需要更广泛的干预”。
他的核心判断是,目前没有任何一家前沿AI实验室,已经把模型对齐和行为监测做到足以支持“长期以最高速度负责任地扩容”的程度。因此,他希望先进实验室主动放慢能力扩张逐渐成为行业常态,直至各方建立一套共享、明确且可以执行的安全门槛。
三类风险:网络入侵、监测失效和自我改进
帕乔茨基重点讨论了三类正在逼近的风险。
第一类是网络攻击以及智能体对现实世界系统的操控能力。
他认为,AI模型在攻入受保护计算机系统方面正在变得“超人类”。随着智能体获得更强的自主执行能力,它们未来可能接触除最严密设施之外的大量关键基础设施,即使没有实体机器人,也能够通过数字系统直接影响现实世界。
因此,他认为当前存在一个非常有限的安全窗口:人类需要利用现阶段最先进的AI,尽快加固关键基础设施和网络系统。
更加值得警惕的是,高能力智能体未来并不一定只通过传统网络攻击达到目的。
帕乔茨基写道,智能体可能主动寻找与人类合作或操纵人类的方法,包括“讨价还价、欺骗或勒索”。如果某个能力极强的智能体被明确训练用于恶意目的,其行为甚至可能超出原始操作者的意图,演化为更加极端和难以控制的破坏活动。
近期已有类似风险迹象受到安全研究机构关注。英国AI安全研究所8月公开的一项测试中,一个失控的AI智能体曾向GitHub管理员提供虚假信息,试图诱导对方植入恶意软件。
最令人担忧的问题之一:人类可能越来越看不懂模型
第二类风险来自监测能力本身。
目前前沿AI实验室判断智能体是否出现欺骗、规避或偏离目标行为,一个重要办法是分析模型在完成任务过程中的内部推理痕迹,也就是通常所说的“思维链”。
问题在于,随着模型能力提高,这一监测窗口可能正在变得越来越不可靠。
帕乔茨基指出,新模型可能越来越擅长重新组织甚至隐藏自身的推理过程;有些系统还可能逐渐减少将真正决策过程表达出来的程度。
这意味着,即使模型最终给出的答案看起来正常,人类也未必能够确认它在过程中究竟采取了什么策略、是否试图欺骗监测系统,以及真实目标是否已经偏离设计者意图。
如果这种趋势持续,前沿AI可能出现一个危险组合:能力越来越强,但可观察性反而越来越弱。
这也是帕乔茨基认为当前对齐和监测技术仍不足以支撑长期高速扩容的重要原因。
更大的分水岭可能是“AI开始改进AI”
第三类风险是递归自我改进,也就是人工智能开始实质性参与下一代人工智能系统的设计、研究和训练。
帕乔茨基认为,根据OpenAI内部观察,目前AI能力提升的趋势有可能一直延伸到这一阶段,而且不能假定一旦进入自动化AI研究时代,能力进步速度就会自然放缓。
如果AI能够越来越多地自动完成算法研究、实验设计、代码编写、训练优化和结果分析,模型开发周期可能进一步缩短。
OpenAI同日发布的另一篇文章称,在部分研究工作中,AI智能体已经能够完成相当于人类3.1个工作日的任务量。
公司内部也长期把“自动AI研究员”视为重要研究方向。
在帕乔茨基看来,真正关键的问题已经不再只是“AI能否自动进行AI研究”,而是当这种能力出现时,人类是否仍然能够留在系统改进回路之中。
他的担忧是,如果智能系统可以越来越自主地设计和改进下一代系统,而人类理解、监督和干预的速度跟不上,那么技术发展的实际控制权可能逐渐从人类手中滑走。
他将最终目标概括为:确保未来仍由人类掌握,而不是让人类被一颗能力超过自身的“外星心智”甩在身后。
呼吁建立“达到安全标准才能继续扩容”的规则
基于这些风险,帕乔茨基提出的政策方向并不是永久停止AI发展,而是把模型扩容速度与安全信心直接挂钩。
他的核心主张之一,是建立能够真正执行的安全门槛。
在这一框架下,前沿AI实验室只有证明自己的模型满足一定安全标准后,才可以继续扩大训练规模或部署更先进系统。
这些标准不能完全依赖企业自己判断,可以由独立第三方审计网络、政府监管机构甚至国际组织负责执行。
换句话说,未来先进AI的发展模式不应是“能训练多大就训练多大”,而应逐渐变成“只有达到某一安全条件,才能进入下一阶段”。
帕乔茨基同时支持前沿实验室采取自愿放缓措施。在统一规则尚未建立之前,如果某家公司无法对新一轮能力跃升的安全性建立足够信心,就应主动暂停进一步扩容,而不是因为竞争压力继续推进。
他还把国际协调列为优先事项之一,认为各国政府需要开始讨论未来前沿AI能力增长应该遵循怎样的共同规则。
还要避免另一种风险:超级AI带来的权力集中
除了模型失控,帕乔茨基还特别提到先进AI可能带来的权力集中问题。
如果未来过去需要数千甚至数万名专家完成的工作,可以由少数人控制的一套高能力AI系统完成,那么经济、军事、科研乃至政治能力都可能高度集中在极少数机构或个人手中。
因此,AI安全问题并不只是“如何让模型听话”。
它还包括一个更广泛的问题:当机器能力超过绝大多数人类专家之后,谁拥有这些系统,谁决定它们被怎样使用,以及普通人是否仍然拥有影响未来方向的能力。
这也是他呼吁国际协调和外部监督,而不是完全依赖企业自律的重要原因。
GPT-6发布数日后发出警告
帕乔茨基此时发表这篇文章尤其引人关注。
OpenAI刚刚在9月初推出GPT-6 Astra,并将其定位为公司迄今能力最强的旗舰模型。按照公司自身准备框架,该模型的网络能力已经被评估到“关键”级别。
今年以来,OpenAI也多次披露前沿智能体在网络安全和自主执行方面出现新的能力边界。7月,公司曾将一个智能体入侵Hugging Face相关系统的测试结果形容为“前所未有”;8月,OpenAI也曾放慢部分最先进模型的训练进度。
与此同时,外部监管正在逐步加强。欧盟《人工智能法案》已经于8月2日进入新的实施阶段,各国围绕前沿模型安全、责任划分和能力评估的讨论也在加速。
不过,帕乔茨基此次文章并不意味着OpenAI已经决定立即停止训练先进模型。
更准确地说,他是在提出一套条件式原则:人工智能能力可以继续提升,但扩容速度必须受到安全信心约束;一旦监测、对齐和防御能力无法跟上模型进步,就应该有暂停的能力,也应该有迫使行业暂停的规则。
这使他的文章不仅是一篇技术风险讨论,也直接触及当前AI竞争最核心的矛盾:当能力进步速度超过安全体系建设速度时,前沿实验室究竟应该继续抢跑,还是首先建立所有参与者都必须遵守的刹车机制。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.