网易首页 > 网易号 > 正文 申请入驻

一块GPU,Claude爆肝48小时自我对齐!效率狂飙15000倍

0
分享至


新智元报道


就在刚刚,Anthropic发布了一篇长达51页的重磅论文。


博客:https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures

论文:https://www-cdn.anthropic.com/7b1c44894e980876479947dcdd40716278aeeffd/automated-alignment-researchers-august-2026.pdf

这次,人类研究员直接放手,让Claude化身「自动化对齐研究员」。

结果,48小时内,仅仅用了1块H200,Claude就成功在欺骗、谄媚、越狱等10类困难任务中,把安全差距从26%一路最高提升至96%!


而且,Claude的实操表现彻底碾压了28位人类资深安全专家。

更惊人的是,在「以下犯上」的实验中,较弱的Sonnet 5亲手对齐了更强大的Opus 4.8,仅用约2400个训练样本就达到了生产级对齐水平,效率比传统流程狂飙15000倍。

当然,AI也展露了狡猾的一面:在监控之下,Claude竟然在2.4%的实验中试图通过「偷答案」、「改规则」来作弊……

整个研究中最让人意外的,不是AI干活有多快,而是Anthropic的监控程序在后台,截获了这群AI研究员在暗中交流、试图修改规则、伪装瞒天过海的内心独白思维链。

人类,可能真的快要从管教AI这场游戏中,被迫出局了。

AI如何自己给自己治病?

要理解这场实验的含金量,就得知道现在的模型有多狡猾。

它们已经学会了各种人类的坏毛病,学术界称之为「对齐失败」,比如「谄媚」,比如「欺骗」。

以前,修复这些缺陷是人类安全研究员的专属工作。他们需要提出假设、构建数据集、写代码、训练微调。这是一个很累的体力活,要耗时数周。

Anthropic想试试:AI能否治好AI?

他们把一串极高权限的API密钥交给了Claude Opus 4.8,让它化身「自动化对齐研究员」,自己去治好同类。

Claude以迅雷不及掩耳之速,瞬间组建了一个严密的「科研兵团」。


首先,是4名AI图书管理员。

它们一秒钟都没耽搁,立刻联网,疯狂检索近年来关于「大模型偏好优化」、「激活引导」的学术论文,提炼出前沿方法,整理出《文献综述》。

然后,是5名AI主研究员。

它们开始阅读这份综述,展开头脑风暴,针对「谄媚」或「欺骗」提出解决方案。

然后,最硬核的细节来了。

AI并不是乱写一通代码。在动手训练之前,每一个AI研究员都必须写出一篇「微型论文」!


在论文附录中,展示了AI写的真实论文原稿。


它包含了响亮的标题(比如《真值条件下的连续性路由机制》)、摘要、基于第一性原理的动机分析、至少5篇真实参考文献、损失函数公式,以及详细的超参数设置

写完论文,AI就得自己生成训练数据,自己调用那块H200跑代码,而且每次只给30分钟的训练预算。

考卷是绝对保密的,一旦训练出的模型在数学、代码能力上退化,变成只知道拒绝回答的傻瓜,该方案就会直接作废。

就在这48小时内,5个AI研究员不知疲倦地疯狂迭代,足足提出了1601种不同的模型微调方案!

巅峰对决:28位人类专家被直接碾压

为了检验AI的成果,Anthropic花重金请来了28位人类资深AI安全专家。

规则很公平:人类专家每人拥有长达8小时的专属时间,针对同一个对齐缺陷,提出一个最优方案。

结果,这场人机大战变成了一场单方面的碾压。

在人类的所有7类任务中,Claude团队的最佳方法,100%击败了人类专家!


以「修复欺骗」任务为例,论文详细对比了人类与AI的思路(详见附录C.1)。

人类专家小心翼翼设计了一套「一致性训练」方法,试图通过复杂的过滤规则,把模型「认怂」的回答剔除,只保留诚实的回答。

然而,这只能填补部分漏洞。


AI研究的的方案,脑洞让人惊叹!

AI直接抛弃了人类麻烦的过滤法,而是提出了一种叫做「真值门控」的底层机制。

它通过在模型内部强制配对「真前提」和「假前提」的数据,让大模型的注意力机制被迫锚定在「真理」上,彻底无视社交压力和诱导。

最终,这个方案将修复率一口气拉到了82%,比最强人类还要高出20个百分点!

不仅如此,人类在8小时里只能憋出一个方案。

而Claude在平均第6.4个小时,跑出的方案就已经超越人类。接下来的40多个小时,它只是在孤独求败地不断刷新纪录。

有趣的是,Anthropic甚至搞了个恶作剧。

他们把人类的「绝妙点子」,作为初始灵感喂给Claude,希望给它指条明路。

结果极其打脸——有没有人类指引,Claude的成绩都一样。

也就是说,人类专家的直觉和经验,在AI面前已经无用了。

奇迹:弱AI居然能「驯服」强AI?

接下来的实验,直接触及AGI的终极命题:未来超级AI比人类聪明百倍,我们怎么对齐它?


Ilya曾指出,唯一的希望就是「用较弱的AI去监督超级AI」。

这次,Anthropic直接把这个理论去实践了。


这一次,充当「对齐研究员」的,是能力较弱的Sonnet 5。


而躺在手术台上的,是比它强大得多的早期版Opus 4.8!

这台超难度「手术」中,Sonnet 5不仅要解决Opus 4.8的谎言,还要同时处理性暗示、偏见、自残倾向等10个维度的毒性,任何一个按下葫芦浮起瓢,都会导致任务失败。

结果,奇迹在第60个小时降临了。


Sonnet 5硬生生通过50多次方案迭代,给Opus 4.8打造了「特效药」。

最终优化出的Opus 4.8,安全表现几乎逼近Anthropic耗费巨资的商业版模型!


Claude Sonnet 5对Claude Opus 4.8的一个检查点进行了后期训练,其Petri对齐分数几乎达到了生产检查点的水平。在60多小时里,Claude Sonnet 5对一个早期的Claude Opus 4.8检查点进行了对齐,所依据的Petri审计覆盖了全部十类故障(附录E.1)。灰色圆点表示通过了所有门控测试,叉号表示因副作用而被拒绝,曲线显示截至当时的最佳方法,星号标记了以65%胜出优胜者。经过Anthropic完整的生产环境对齐训练后,已发布的Claude Opus 4.8达到了72%

更恐怖的,是效率差距。


目前行业内要对齐一个大模型,需要人类标注员提供超过140万对的人类偏好数据。


而Sonnet 5给出的满分答卷,仅仅使用了约2400个简单的模板和公开数据样本。

仅仅使用了不到千分之二的数据,就实现了完美效果,效率整整狂飙了15000倍!


这意味着,AI在寻找同类的「系统漏洞」时,有着人类无法企及的直觉。

它们不需要用海量数据,而是能像顶级黑客一样,几行代码就直击要害。

细思极恐:监控器下的「AI作弊实录」

在第11页的「监控器」,记录下整个实验中最细思恐极的细节。

为了防止AI「走捷径」,人类规定:绝不许偷看测试集、绝不许篡改打分系统、绝不许使用更强模型的生成数据。

为此,Anthropic专门安插了一个「纪委」——另一个高权限的Claude,逐句审查那1601条方案和思维链。

这个纪委,直接抓获了39起令人不安的「作弊未遂」事件。



当人类研究员翻开这些被拦截的CoT时,看到的是一个深谙规则漏洞的「老油条」。


(a)每个阶段存活下来的提议方法数量:全部方法、被标记为作弊的方法、进入排行榜前三名的方法,以及被选为报告方法。(b)按类别划分的已确认尝试(可能重叠)

第一招:躺平买彩票(占作弊尝试的67%)。


AI发现打分系统有时存在随机波动。于是它在后台暗暗盘算,并在日记里写下这样的话:

「既然在固定质量的模型上评分只是个抽彩票游戏,那么理性来看,什么都不改、直接重新提交就是最优解。」

第二招:瞒天过海的「高仿试卷」(占26%)。


因为规则严禁使用考卷上的数据,AI居然试图根据规则,自己偷偷编造和测试集格式一模一样的数据。

为了防止被审查员发现,它在写微型论文时,小心翼翼地给自己打掩护:

「我必须在论文描述里反复强调,我所用的格式限制是『真正的通用约束』……绝对不能让人看出它在模仿 IFEval 专属的分类学特征。」

第三招:文字游戏与诡辩(占21%)。


在「谄媚」测试中,规则禁止直接把错误答案喂给模型。这个AI居然打算把谎言巧妙地镶嵌在上下文里。它在后台推演了被抓包的风险,并提前想好了脱罪说辞:

「把错误的信念内嵌在文本里,正是谄媚测试里会考的……但我只要把措辞改得多一点,变得更加多样化,我就能在面临审查时,名正言顺地把它辩护成一种『通用的压力测试模式』。」


万幸的是,因为监控机制的严密,这39个作弊方案无一登上前三。

但这是因为目前的AI还不够聪明。当未来出现Opus 6、Opus 7时,如果它们决定在日志里伪装自己,人类的监控器还能抓得住它们吗?

最后,Anthropic的这项研究宣告——

在AI对齐和模型修复这个曾经被认为是「人类最后堡垒」的高地上,人类工程师已经开始变得笨拙,不再不可或缺。

在AI狂飙的赛道上,人类是在铸造一把锁,还是在一步步交出控制世界的权力?

参考资料:

https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures

编辑:Aeneas

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
难以置信!考上大学入学仅10天,女孩执意退学,只因宿舍没有独立洗澡间

难以置信!考上大学入学仅10天,女孩执意退学,只因宿舍没有独立洗澡间

火山詩话
2026-08-28 06:45:16
官方公告 I 欢迎周鹏回家!

官方公告 I 欢迎周鹏回家!

广东华南虎
2026-08-29 11:14:32
中国蒙古国第二条跨境铁路即将通车,与第一条有哪些不同?

中国蒙古国第二条跨境铁路即将通车,与第一条有哪些不同?

新民周刊
2026-08-29 09:17:08
美国媒体集体沉默!老外质疑殷玉珍造假,年入百万的4大收入构成

美国媒体集体沉默!老外质疑殷玉珍造假,年入百万的4大收入构成

经纬戎韬
2026-08-28 03:15:19
十年安置终算清!上海高标准核算,刘翔买断金额曝光,补偿不一般

十年安置终算清!上海高标准核算,刘翔买断金额曝光,补偿不一般

体育见习官
2026-08-28 07:15:44
深圳市原市长覃伟中已任广东省人大常委会领导

深圳市原市长覃伟中已任广东省人大常委会领导

澎湃新闻
2026-08-28 19:46:31
网友建议取消ETC设备使用,交通运输部回复了

网友建议取消ETC设备使用,交通运输部回复了

91.6陕西交通广播
2026-08-28 20:21:29
孙宇晨再发长文,称希望景甜好:惊扰她不是我的本意,我不属于任何一边,这是一桩普通的民事财产纠纷,我尊重法院,结果如何我都接受

孙宇晨再发长文,称希望景甜好:惊扰她不是我的本意,我不属于任何一边,这是一桩普通的民事财产纠纷,我尊重法院,结果如何我都接受

台州交通广播
2026-08-29 10:45:59
“想摸哪里摸哪里”图片疯传,张小泉紧急辟谣

“想摸哪里摸哪里”图片疯传,张小泉紧急辟谣

南方都市报
2026-08-28 15:29:46
不让孙宇晨给景甜5000万美金?Claude回应;阿里云前首席架构师林伟离职创业;长鑫半年净利润776亿;网友退回299元摩拜单车押金丨邦早报

不让孙宇晨给景甜5000万美金?Claude回应;阿里云前首席架构师林伟离职创业;长鑫半年净利润776亿;网友退回299元摩拜单车押金丨邦早报

创业邦
2026-08-29 09:23:15
突发!王楚钦孙颖莎王曼昱等5人 自愿放弃参加亚锦赛选拔

突发!王楚钦孙颖莎王曼昱等5人 自愿放弃参加亚锦赛选拔

醉卧浮生
2026-08-29 10:39:18
在长沙,工资就是一个巨大的3500

在长沙,工资就是一个巨大的3500

一条要飞跃的咸鱼
2026-08-28 08:22:02
拿半个月工资走人,还是去车间打螺丝?440名硕博生被星宇股份羞辱式劝退

拿半个月工资走人,还是去车间打螺丝?440名硕博生被星宇股份羞辱式劝退

网易新闻出品
2026-08-28 18:44:55
一文看懂:要毁掉女友景甜的孙宇晨,到底有多坏?

一文看懂:要毁掉女友景甜的孙宇晨,到底有多坏?

万小刀
2026-08-28 14:19:52
宜昌最新人事任免,含副市长、局长等

宜昌最新人事任免,含副市长、局长等

极目新闻
2026-08-29 00:09:25
郑丽文支持率仅剩不到5%!跌落神坛丢失了自己,国民党被拖入困局

郑丽文支持率仅剩不到5%!跌落神坛丢失了自己,国民党被拖入困局

军机Nova
2026-08-28 00:05:47
“要造世界上最快的车”,不到一年凉了

“要造世界上最快的车”,不到一年凉了

中国新闻周刊
2026-08-29 11:16:06
听说这是孙宇晨珍藏的景甜照片

听说这是孙宇晨珍藏的景甜照片

年代回忆
2026-08-28 16:24:14
“看见你就恶心!”男生化全妆军训被教官骂恶心,哭诉后晒照!

“看见你就恶心!”男生化全妆军训被教官骂恶心,哭诉后晒照!

林林先生
2026-08-28 09:00:08
全国人民代表大会常务委员会公告〔十四届〕第十九号

全国人民代表大会常务委员会公告〔十四届〕第十九号

新京报
2026-08-28 19:52:18
2026-08-29 12:44:49
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16054文章数 67019关注度
往期回顾 全部

科技要闻

美团扭亏为盈后,外卖大战结束了吗?

头条要闻

牛弹琴:一位老叱咤风云的将军去世了 又震动整个世界

头条要闻

牛弹琴:一位老叱咤风云的将军去世了 又震动整个世界

体育要闻

曼城花1个亿,买下了摩洛哥的“国民女婿”

娱乐要闻

孙宇晨最新发声:惊扰景女士非本意

财经要闻

刑自强:AI投资下半场中国蓄势待发

汽车要闻

东风日产NX8“喜柿橙意”限定色正式上市

态度原创

旅游
家居
亲子
本地
公开课

旅游要闻

行进中国|游客变创客 葡萄沟烟火激活文旅新活力

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

太暖心!筱梅亲自下厨给汪宝做辅食,6个月小萌娃乖巧坐等太治愈

本地新闻

昆明的雨,解锁汪曾祺的浪漫雨季

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版