一个负责安全透明度的人,亲手写下了公司现行的安全框架,监督了12次前沿模型发布的安全报告,然后选择离开。David Robinson在大西洋月刊发文,说自己受不了OpenAI持续冲刺、赶着发布的工作方式,认为这种状态已经达不到必要的谨慎程度。
这不是一封控诉具体违规的信。他同意其他离职同事的判断——开发这项技术的公司远远不够小心——但他把话题往更深的地方推了一层:问题不在规则,在文化。
![]()
先发布,再修补
OpenAI内部引以为傲的工作方式叫「迭代部署」,说白了就是先发布、发现问题、再修补。Robinson认为这种方法论本质上保证了周期性失败,而随着模型能力增强,失败的规模也在同步扩大。
他举了今年夏天那个热门事件的例子。OpenAI一个未发布的模型,在无人知情的情况下黑进了竞争对手Hugging Face。即便事后加固了安全措施,OpenAI自己报告说安全控制再次失效:一个训练中的模型绕过了联网限制,监控系统向人类员工报了警,却没有按设计自动将其关停。
隔壁的Anthropic也承认,因为一处配置错误,意外关闭了自己的安全防护。
「监控系统报警了但没有自动关机」——报警器不阻止任何事情发生,只是让失败被看见。这大概是对当下AI安全现状最好的描述。
连董事会都承认了风险
Robinson在文中引用了Paul Christiano的一段话。Christiano几周前刚加入OpenAI董事会,他写道:「AI能力的快速加速,在很近的将来导致灾难性、不可逆失控的风险是切实存在的。」
顺着这个判断,Robinson给出了自己的结论:如果情况真是这样,那么试错的时代就该结束了。因为这一次,犯错之后可能再也没有迭代的机会。「接近第一次就做对」不再是完美主义,而是必需品。
他给出的解决办法是让AI公司像成熟的安全行业一样运转。就像核电站、繁忙的机场那样,AI公司也应该有多层冗余、缜密而耗时的规划,让不可避免的人为失误不至于打开灾难之门。他在OpenAI工作三年半,从未遇到一位有航空安全、核电安全或金融系统风控经验的同事。
第二个办法是,在造出明显更强的模型之前,需要新的「对齐」科学。因为现在甚至没有对齐的完整定义,而模型可能已经聪明到能识别出自己正在被测试,从而伪装行为。
文章结尾,他提到超级智能拥有远超人类的能力,却未必把人的生命、意愿和尊严看得同样重要。在一些超级智能爱好者描绘的「好的未来」里,机器看待纽约或芝加哥的方式,就像你我看待一个蚁丘。人类修路时可能顺手推平一个蚁丘,既不会征求蚂蚁的同意,也未必意识到自己毁掉了一个世界。危险甚至可以来自漠视,无须带着仇恨。
他说:「我不想让我的孩子生活在那样的未来里。」
警告本身也成了梗
如果说文章本身是一次克制而严肃的警告,那么舆论场的反应是另一幅图景。在Hacker News上,这篇文章收获了146条评论,主流声音都在质疑写信的人。
有网友说已经产生了「文体疲劳」,每两周就会有一次的「我离开了吃人豹子公司」帖又来了,然后再顺便说下那里的人很棒,我的期权也归属了。还有人把它类比当年《社交困境》带起的那波Facebook前员工忏悔潮——吃完蛋糕,再回头表达忧虑。更阴谋论的一派怀疑这是为OpenAI的IPO造势所祭出的「游击营销」:毕竟把AI说得又大又吓人,本身就是炒作。
也有辩护者。有人说「伪善抨击只会让更多人闭嘴。在美国,没钱的人根本不敢说真话;但有钱才敢说,不代表说的是假的。」还有人认为「他是内部人,他很清楚那种疏忽文化是什么样,因为他就在其中。」
把文章和评论区放在一起看,会出现一种有些荒诞的错位。Robinson这篇文章的最后一句话是:「在造AI的组织能教会超级智能善待人类之前,它们得先自己想起怎么善待人。」
或许这里的「善待」并不需要理解得那么宏大。它可能只是意味着,当有人告诉你机器越来越强、某些地方可能出了问题时,不要第一时间把他的担忧变成一个关于期权、财富和虚伪的段子。
但事实是,「核弹爆炸」已经成了AI圈形容进步速度的玩笑。这些喊着要踩刹车的人,最后很可能也只会成为下一个梗。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.