网易首页 > 网易号 > 正文 申请入驻

三大巨头接连翻车,大模型的安全防线怎么总绷不住?

0
分享至



先是Anthropic,再是OpenAI,现在连谷歌的Gemini也出现安全问题了,大模型又双叒叕一次突破防火墙了。

不过,这些事故看多了,反倒会让人意识到一件更根本的事,整个行业都在拼命地堆算力、喂数据,甚至开始押注让模型自己改进自己的“递归自我改进”(RSI)。

可真正决定这些模型能走多远的,或许并不是性能,而是安全对齐。

当“能不能更强”被默认只是时间问题,“能不能被信任”就成了那道绕不过去的坎。

麻烦的是,这道坎在不少公司眼里,反倒成了拖慢发布的最大阻碍。

为了实现安全对齐,各大AI公司都做了很多尝试,光是2026年,团队就进行了大换血。但结果就是,毫无进展。

那么这个安全对齐到底是什么,到底为何又让巨头们如此“痛不欲生”呢?

01

安全对齐团队人事动荡

Gemini的事,其实并不孤单。过去这几个月,OpenAI、Anthropic、Meta都先后曝出过模型在评测中“越界”的问题。要么逃出沙箱,要么连上公网、碰到了真实系统。

这类事如今已算不上新话题,毕竟情节本身大同小异,多半是环境隔离出了纰漏,未必是模型“主动越狱”。

或许正是因为安全问题如此频发,几家公司的安全团队,正在经历一轮罕见的大换血。

2026年7月,安全系统团队负责人约翰内斯·海德克(Johannes Heidecke)离职。

这已是两年内第六位离开OpenAI的高级安全负责人。

此前包括扬·莱克(Jan Leike),曾联合领导超级对齐团队。2024年出走Anthropic;迈尔斯·布伦戴奇(Miles Brundage) 与 史蒂文·阿德勒(Steven Adler),原政策(Policy)团队,先后离开去做 AI 安全方向的非营利机构;安德烈亚·瓦洛内(Andrea Vallone),在OpenAI待了三年、创办“模型政策”(Model Policy)研究团队、参与GPT-4与GPT-5,最后同样也去了Anthropic对齐团队。



所谓超级对齐团队,指的是OpenAI在2023年7月成立的专项团队,为“比人更聪明的AI”(超级智能)研究对齐方案。

然而OpenAI在这事上“反复横跳”。超级对齐团队于2024年5月解散,莱克称,OpenAI这些年来都不重视安全和对齐,将算力和资源全都给了产品团队。

与约翰内斯同期离职的还有约书亚·阿基阿姆(Joshua Achiam),他在OpenAI做了九年安全研究。他领导的“使命对齐”(Mission Alignment)小组,本是超级对齐团队解散后的接棒者,2024年9月成立,结果2026年2月又被解散,六名成员被打散进研究与产品团队。

在此之后,首席研究官马克·陈(Mark Chen)宣布,安全团队今后统一向原对齐负责人米娅·格蕾丝(Mia Glaese)汇报,后者升任“研究与安全”副总裁。

马克表示,这么做是为了让安全“更早、更直接地介入关键模型、产品与发布决策”。

换句话说,OpenAI把安全并进了前沿模型开发这条线。

同时马克也表示,安全面临的要求持续上升,整个安全对齐团队的压力非常大。

“我们训练模型的速度快得多,发布周期也大幅缩短。结果是,今天围绕安全的协调问题,比以往任何时候都更大。”马克写到。

Anthropic也在面对相似的情况。

莱克加入Anthropic后,牵头组建并领导“对齐科学”(Alignment Science)团队,方向正是他在OpenAI组建超级对齐团队所做的那些事,比如可扩展监督、弱到强泛化、越狱鲁棒性,以及自动化对齐研究。

2026年1月,前文提到的安德烈亚也加入了Anthropic的对齐科学团队,直接向莱克汇报,负责“对齐与微调、塑造Claude在新情境下的行为”。

2026年5月,OpenAI联合创始人、前特斯拉Autopilot负责人卡帕西加入Anthropic预训练团队,组建“用Claude加速预训练研究”的小组。

6月,谷歌DeepMind做机制可解释性、代表作《真实场景中的可解释性》(Interpretability in the Wild)的亚瑟·康米(Arthur Conmy)也宣布加入,说要“在模型训练的过程中就把它们对齐”。

不止是OpenAI和Anthropic,其实谷歌这边也在安全对齐上做文章。

谷歌成立了AGI安全与对齐团队(ASAT),负责人是罗欣·沙阿(Rohin Shah)。他是UC伯克利CHAI(人类兼容人工智能中心)的博士,早年靠一份《对齐通讯》(Alignment Newsletter)在圈内出名。

团队的定位是不做面向当下产品的“打补丁”,专攻更先进 AI 带来的更严重危害,目标是降低AI的存在性风险。

ASAT隶属于DeepMind的“AI安全与对齐”部门,这个部门还包含专管当前Gemini模型安全训练的Gemini Safety等团队。

7月,ASAT公开招募多岗位,目标是降低AI的存在性风险。

但有意思的地方是,ASAT让应聘者另填一张“特殊表格”,以绕过谷歌自家的AI简历筛选。理由是,罗欣不信任自家的AI筛选器。

02

这个行业在解决什么

既然所有头部AI厂都在调整自己的安全对齐团队,那到底什么才是安全与对齐呢?

对齐(Alignment),是让AI的目标和人类真正想要的东西保持一致。

10年前有个笑话,“小明,下午大扫除你去不去?”“我去!我不去!”很显然,小明并不想参加扫除。

对齐,就是让AI如何理解“小明其实不想去”这件事。

它不能只“听得懂指令”,还应该符合人类的预期,比如不能撒谎,不能表面上按规矩,背地里使坏。

安全(Safety),指的是如何让AI别造成伤害。

既包括模型自己失控(也就是对齐失败),也包括被人恶意滥用,以及大规模铺开之后带来的系统性风险。

对齐是安全的底座,但安全不止于对齐。一个模型可以“对齐良好”却仍不安全,比如它可以被人拿去作恶,也可以“能力很强”却因对齐失败而闯祸。

所以行业里才常常把两者连起来叫“安全对齐”。

这个行业最重要解决的问题只有一个:模型的能力可以靠数据和算力堆出来,但是当AI有一天比人更聪明,人类凭什么相信它?

OpenAI组建超级对齐团队时就说到,“目前没有任何方案去控制可能失控的超级智能”。

不过很可惜,目前安全对齐不像模型性能一样,有个许多基准测试集,看一眼跑分就知道模型强弱了。今天的安全与对齐,主要围绕四根支柱展开。

第一根,RLHF(人类反馈强化学习)。

它是现在大模型的地基:真人标注员判断“两个回答里哪个更好”,用这些偏好数据训练出一个奖励模型,再用强化学习去优化大模型,让它越来越贴近奖励模型的口味,即近端策略优化(PPO)。

但是PPO很容易导致奖励黑客(reward hacking),模型发现了一个能拿高分、却没真正完成任务的取巧办法。

于是后来RLHF更多的是采用直接偏好优化(DPO)。

可这又产生了两个问题。

一个是“虚假讨好”,模型会学会迎合人,而不是讲真话。

另一个是“对齐税”,为了让模型输出更安全更符合人类预期的答案,就必须使用更合规的训练素材,模型性能被迫降低。

强化对齐奖励会让某些问答基准掉十几分,而对推理模型做安全对齐,平均推理准确率也可能下滑约30%。安全不是免费的午餐,它是拿一部分性能换来的。



第二根,可解释性。

就好像核磁共振查看大脑内部活动一样,可解释性就是通过各种办法,观测模型内部到底如何思考。

Anthropic用的是“字典学习”的办法,从Claude里提取出数百万个可解释特征,比如金门大桥、性别偏见、保密话题,各自对应一组可被点名的神经活动,并且证明操纵这些特征能因果地改变模型行为。

这样一来,未来的模型进行思考时,只需要观察它激活了哪些参数,再对照着这本字典,就知道模型是如何思考的了。

然而问题就在于,这种查字典的方法太累了,每一句话都要在查找上消耗大量算力,一旦上下文稍微长一点,算力成本水涨船高。

第三根,红队测试。

RLHF和可解释性主要是从模型内部找问题,红队测试则是从外部找。它的实现方法很好理解,雇佣一些专业人士,拼命从外部攻击模型,看哪儿能打穿。

2023年7月Anthropic官方披露,在6个月内投入超过150小时,邀请顶级生物安全专家,绕过常规安全监控,通过专用安全接口与模型对话、越狱、评估其输出有害生物信息的能力。

第四根,可扩展监督与超级对齐。

前面三个方面都存在一个共同的前提,那就是人类比AI聪明。可这并不能解决OpenAI提出的那个问题,即如果模型比监督它的人还聪明,人类就没有办法监督它。

既然如此,学生比老师聪明了,老师应该怎么给学生打分呢?

于是就有了可扩展监督和超级对齐。

Anthropic和OpenAI共同的判断是“让AI监督自己,并且辅助人类监督。”

OpenAI的一个答案是“弱到强泛化”。用GPT-2级别的弱模型去监督GPT-4,再配一个“增强自信”的辅助损失,效果能恢复到接近GPT-3.5的水平。

但OpenAI同时也表示,靠人类打分的RLHF,“可能无法训练出超级模型”。

2023年7月,OpenAI前首席科学家伊利亚和莱克牵头,启动了超级对齐计划。承诺投入20%算力,计划4年内取得突破。

其终极目标是,造出一个人类水平的自动对齐研究器,然后用海量算力让它迭代对齐超级智能。

之后的故事前面也讲过了,伊利亚和莱克均离开了OpenAI,超级对齐团队也解散。

03

行业的争议又有哪些?

但是问题来了,为什么安全团队的人一批批走,安全对齐的问题却还是频繁出现,甚至变本加厉?

答案不在技术,在结构。

安全是成本,产品是利润。这个商业逻辑不改变,安全团队永远是“被咨询的”,不是“拍板的”。

产品直接带来收入和增长,安全却只会花钱、拖慢进度。于是在“先到者通吃”的赛道上,理性的公司几乎总把资源优先喂给产品。

更关键的是,这种“安全让位于产品”的逻辑并不是说AI公司不够道德,相反,已经有研究证实,这是一种能被建模的结构性规律。

芝加哥大学Becker Friedman研究所在2026年发表了一篇标题为《AGI竞赛与存在性风险》的论文,其中提到这样一件事。

把一家公司的资源拆成“速度”与“安全”两块。往速度上多投一分,抢先抵达AGI的概率就高一分,但留给安全的就少一分;往安全上多投一分,灾难概率被压低,可抵达的时点又要往后推。

论文的结论是,竞赛的激烈程度本身就在制造风险。



当行业的总资源固定时,参与者越多、越分散,这块蛋糕就越会被挤向“速度”,全行业跑得更快、灾难概率也更高。

论文还给出了一个“临界市场规模”。一旦越过,即便达成AGI的期望值是负的,理性的公司仍会拼命去抢,因为先到者通吃。

所以他们的落点不是“技术不够好”,而是AGI 风险不只取决于技术,还取决于市场结构、资源约束,以及决定“速度与安全如何分配”的制度。也就是说,如果想让安全对齐和产品获得相似的地位,那就必须得更改整个行业的规则。

发布周期压缩后,安全审查时间也被压缩。 马克自己都说了,“训练速度快得多,发布周期大幅缩短,协调问题比以往更大”。

模型的参数水涨船高,因此安全对齐团队的工作量在翻倍,可是模型发布的周期越来越快,留给安全对齐团队的时间又在缩减。

然而不只是工作量增加的问题,“安全审查通过”这件事本身也未必算数。2024年的论文《安全清洗》中研究团队就发现,许多安全基准的分数其实主要由模型的通用能力决定,于是“能力变强”很容易被包装成“安全进步”。

当审查既没时间、又没算力、连标尺都可能掺水,模型必然会出事。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
9月21日,中秋节前,2026年养老金调整通知会公布吗?今年不寻常

9月21日,中秋节前,2026年养老金调整通知会公布吗?今年不寻常

社保小达人
2026-09-21 10:46:11
直到男篮亚运惨败,我才终于看懂,杜锋当年为何宁愿被骂也要辞职

直到男篮亚运惨败,我才终于看懂,杜锋当年为何宁愿被骂也要辞职

李遝手工制作
2026-09-21 12:16:06
有个经济大省,因为节俭,食物中毒数全国第一……

有个经济大省,因为节俭,食物中毒数全国第一……

家传编辑部
2026-09-18 20:18:06
随着朝鲜0-0、泰国5-1、中国0-0,亚运男足最新积分榜出炉

随着朝鲜0-0、泰国5-1、中国0-0,亚运男足最新积分榜出炉

侧身凌空斩
2026-09-20 19:57:45
金·卡戴珊与汉密尔顿同场看展,穿同品牌却全程零合影

金·卡戴珊与汉密尔顿同场看展,穿同品牌却全程零合影

赴一场山海啊
2026-09-20 14:56:07
阿颖被开除公职(附简历)

阿颖被开除公职(附简历)

中国基金报
2026-09-21 08:01:33
深夜,歹徒闯入家中对她施暴近两个小时,她咬紧牙关一声不吭,只为保护楼上熟睡的女儿。当警察破门而入时,才发现这位母亲早已浑身是血

深夜,歹徒闯入家中对她施暴近两个小时,她咬紧牙关一声不吭,只为保护楼上熟睡的女儿。当警察破门而入时,才发现这位母亲早已浑身是血

人生录
2026-07-30 00:05:11
柬埔寨“8号电诈园区”内部曝光:墙上挂中文标语“请不要假装很努力,结果不会陪你演戏”,办公住宿餐饮俱全,道路装监控……

柬埔寨“8号电诈园区”内部曝光:墙上挂中文标语“请不要假装很努力,结果不会陪你演戏”,办公住宿餐饮俱全,道路装监控……

扬子晚报
2026-09-21 15:16:30
洗衣机烧成了残骸,发票找不到了,品牌方要求证明是他们的牌子,他想了个法子,找到了证据;品牌方做出回应

洗衣机烧成了残骸,发票找不到了,品牌方要求证明是他们的牌子,他想了个法子,找到了证据;品牌方做出回应

北青网-北京青年报
2026-09-19 13:27:14
刘銮雄豪宅被私教晒出,吐槽大小姐动作慢,教练饭碗恐怕不保

刘銮雄豪宅被私教晒出,吐槽大小姐动作慢,教练饭碗恐怕不保

橙星文娱
2026-09-21 12:00:28
“史上最大IPO”敲定上市地

“史上最大IPO”敲定上市地

PE星球
2026-09-21 08:35:49
39岁梅西获评8.2分:飙任意球世界波,现场视角,太丝滑了

39岁梅西获评8.2分:飙任意球世界波,现场视角,太丝滑了

侧身凌空斩
2026-09-21 09:16:58
Netflix新剧女主被指"整容脸"出戏,观众:像现代人穿越

Netflix新剧女主被指"整容脸"出戏,观众:像现代人穿越

娱圈观察员
2026-09-21 11:55:15
孙千肚子上的肉也太真实了!我盯了半天,普通女生谁还敢饿自己

孙千肚子上的肉也太真实了!我盯了半天,普通女生谁还敢饿自己

南万说娱26
2026-09-21 08:50:16
金主集体倒戈!美国前20大捐款人16个站队特朗普,民主党只剩1人

金主集体倒戈!美国前20大捐款人16个站队特朗普,民主党只剩1人

明天后天大后天
2026-09-21 10:52:46
《兰香如故》韩梁至死不知,被林锦岐抢婚,才是许兰香全家保命符

《兰香如故》韩梁至死不知,被林锦岐抢婚,才是许兰香全家保命符

楼兰娱姐
2026-09-21 13:09:39
20日晚间国乒新消息!传来1好2坏消息,林诗栋、王曼昱、王艺迪

20日晚间国乒新消息!传来1好2坏消息,林诗栋、王曼昱、王艺迪

林子说事
2026-09-21 09:32:12
画面不堪入目,地下人奶交易乱象,成年人躺进怀里吃奶的灰色黑产

画面不堪入目,地下人奶交易乱象,成年人躺进怀里吃奶的灰色黑产

易玄
2026-09-12 10:24:46
人的“寿命”其实只有35年

人的“寿命”其实只有35年

孝沛与世界
2026-09-20 01:00:00
亚运会奖牌榜排行:韩国16枚,日本22枚,中国代表团表现如何?

亚运会奖牌榜排行:韩国16枚,日本22枚,中国代表团表现如何?

纪中百大事
2026-09-21 16:17:51
2026-09-21 17:15:00
字母榜 incentive-icons
字母榜
让未来不止于大。
2790文章数 8092关注度
往期回顾 全部

科技要闻

吃AI红利的凡人,年薪10万美元,每天3万步

头条要闻

胡塞武装警告两个地区军事大国:敢介入就将遭严厉报复

头条要闻

胡塞武装警告两个地区军事大国:敢介入就将遭严厉报复

体育要闻

爵士建仓阶段已经完成?

娱乐要闻

张佳宁穿搭宽松小腹微凸 引发怀孕猜测

财经要闻

机器人IPO门槛收紧?能否商业闭环成考量

汽车要闻

家越07成精了:豆包上车 有事您言语一句就成

态度原创

亲子
本地
数码
时尚
公开课

亲子要闻

宝宝馋了再回应“酸奶被投诉圈口发霉”:已与消费者沟通一致

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

数码要闻

蚂蚁电竞发布ANT272TUE显示器:Tandem WOLED,UHD 240Hz双模

伊姐周日热推:电视剧《冬城猎凶》;电视剧《不是你的恋爱》......

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版