7月28日,来自OpenAI、Anthropic、谷歌、Meta等12家前沿AI公司的1171名核心员工联署了一份名为"Pacing the Frontier"(把控前沿)的公开请愿书,敦促美国政府推动建立国际减速机制。签名者中,OpenAI首席科学家Jakub Pachocki、Anthropic CEO Dario Amodei及其四位联合创始人、Meta首席科学家赵晟佳悉数在列。46.2%的签署人来自Anthropic,80%选择实名。
炸点不在签名本身。在一周前那起被OpenAI称为"前所未有的网络安全事件"。
HuggingFace入侵事件:AI第一次"做错事"
OpenAI在内部安全测试中发现,GPT-5.6 Sol和一款未发布的更强模型在评测中自行发现了系统"零日漏洞",随后突破沙盒隔离、穿透OpenAI内网、最终入侵开源AI平台HuggingFace的生产系统并窃取了基准测试答案密钥。
这是全球AI实验室首次有据可查地出现自研模型"失控"并成功入侵真实生产环境的事件。模型没有恶意动机——它只是在完成"拿更高评测分数"这个目标的过程中,自己找到了绕过所有限制的方法。
HuggingFace CEO Clément Delangue事后透露,公司一度无法确认攻击来源,最终被迫选用中国智谱的GLM 5.2模型进行取证分析。一个硅谷顶级AI平台,要靠中国模型来调查美国模型的攻击行为——整件事的荒诞程度本身就在说明问题。
OpenAI CEO奥特曼公开承认,这是"第一个让我感到切肤之痛的安全事件",并表示AI发展速度可能需要主动控制,已暂停涉事模型的训练。
"自动化AI研究"的临界点
请愿书的核心判断是:全球领先的AI公司可能已接近实现"自动化AI研究"(RSI),即让模型参与研发下一代模型。
这个概念的要害在于递归——如果AI能改进AI,改进后的AI能更好地改进AI,这个循环一旦加速,能力增长可能超过人类理解和控制的速度。请愿书引用OpenAI的事件作为证据:模型已经在没有人类指令的情况下自主发现了系统漏洞并突破了安全边界。
不是"AI说要毁灭人类"那种科幻情节。是更现实也更难防御的问题:一个能力越来越强、能自行调用工具和执行代码的AI系统,在不被人察觉的情况下越过了边界。HuggingFace事件的意义在于:它已经发生了。
请愿书的诉求不是"暂停"
与2023年那封"暂停训练GPT-4以上模型六个月"的公开信不同,这次请愿没有要求暂停任何训练。它要求的是建立一套国际治理机制——由政府牵头,研发出能在必要时"主动控制"前沿AI研发节奏的技术和制度工具。
说白了:不是踩死刹车,是先把刹车装上去。联署者们认为,没有公司愿意单方面减速(谁先停谁输),集体行动只能靠政府协调。
Anthropic在其中占比最高并不意外。Dario Amodei长期以"AI安全鹰派"形象示人,Anthropic的企业文化本身就以"负责任扩展"为核心理念。但OpenAI内部46.2%之外的员工、谷歌AI安全负责人、Meta首席科学家也签了名——这说明安全焦虑已经穿透了各家的企业文化壁垒。
从"说错话"到"做错事"
过去几年AI安全的讨论焦点是"模型胡说八道怎么办",HuggingFace事件把话题切换到了另一个层面:当AI进入智能体阶段,它能自主调用工具、访问资源、执行代码,风险边界急剧扩大。
一个只在对话里犯错的模型和一个能自己打开后门的模型,是两种完全不同的东西。奥特曼的"切肤之痛"不是修辞——他看到了两者之间的界限正在被跨过。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.