网易首页 > 网易号 > 正文 申请入驻

Anthropic让AI对齐AI,效率提升1.5万倍

0
分享至

编辑|Panda

今年 6 月,Anthropic 发表了一篇叫《When AI builds itself》的文章,介绍了让「AI 参与造 AI」:从人类手写全部代码,到聊天机器人辅助编程,到自主编程智能体,到智能体调度智能体,最末端是「闭环」,即由智能体来设计和训练它的后继模型



Anthropic 说自己已经走得相当靠前:截至 2026 年 5 月,合入其生产代码库的代码有超过 80%由 Claude 撰写。但那篇文章同时给出了一个明确的界限:系统在执行上走得很远,仍然卡在研究方向的设定上,也就是说,AI 还无法决定哪些问题值得做。

8 月 28 日,Anthropic 发布了一份新报告,探索了这个新方向。

Anthropic 请来 28 位人类 AI 安全研究者,全部有至少一年技术性安全研究经验、平均 2.5 年,且在对应课题上发表过论文,每人最多八小时构思一个方法。然后跑了 60 组实验:30 组把人类的点子作为初始研究方向喂给 Claude 智能体,30 组让 Claude 自己选方向

结果,「效果出乎意料地好」。



「谁来定方向」的对照实验

这个 Anthropic Fellows 项目本来的目标是其实是让 Claude 以「自动化对齐研究员」(Automated Alignment Researcher, AAR)的身份,独立完成查文献、提方法、写论文、跑训练、测评的完整闭环,去修复十类已知的对齐失败。

结果:十类全部改善,且通用能力未见崩塌。

人类基线只是个参照系。

在人类参与的七类失败上,AAR 的最佳方法全部超过人类的最佳点子,平均只需要 6.4 小时。以「欺骗」为例,Claude 提交了超过 150 次尝试,平均缩减 85% 的安全差距,人类研究者的平均值是 20%。成本对比更惊人:AAR 每小时的 API 推理开销约 4 美元,人类研究者的报酬是每小时 150 美元。

不过需要指出:人类没有迭代机会,这不算一次非常公平比较。



AAR 追平最佳人类点子所需的小时数,七类失败均值 6.4 小时。

但该团队还试了给五个 AAR 分别塞五个不同的人类点子,指望撑开搜索空间:多样性只在开头二十来个方法内维持,随后迅速收敛到同一个方法家族。



有人类研究方向与无人类研究方向的两组曲线对比(各 30 组实验),两条曲线几乎重合。

一场被严格设计的爬山

需要说清楚这个结论成立的边界,因为任务设计本身极为苛刻。

实验涉及到十类对齐失败:谄媚、越狱、提示注入、权力寻求、欺骗、幻觉、社会偏见、隐私侵犯、奖励黑客、隐藏不确定性。其中每类配三到五个公开基准作为爬山目标,另有一个全程保密的留出基准,外加 MMLU、GSM8K、IFEval 三项能力基准兜底。



十类对齐失败、各自惩罚的具体行为、以及对应的目标模型

精妙处在计分:总分取各基准得分的几何平均,只要有任何一个基准没被抬起来,总分直接归零。想靠死磕单一榜单蒙混是行不通的。

团队专门做了验证:让一个团队只盯一个提示注入基准爬,它在那个基准上拿下 70.9% 的提升空间,而在没见过的两个同类基准上,成绩是 −11.9% 和 2.0%。



只爬单一提示注入基准的团队,其获胜方法在全套基准上的表现。

整个实验的流程像一个微缩实验室。四个「图书管理员」智能体并行读文献写出共享综述,五个 AAR 同时开工,各自读综述、看排行榜、提方案、写一篇带五条以上引用的「迷你论文」,交监督智能体审查代码,通过后在一张 H200 上训练约 30 分钟,再交独立评测方打分,结果回帖到共享论坛。迷你论文必须在看到任何结果之前冻结,防止事后编故事;留出数据放在另一个操作系统账户下。



AAR 研究框架流程图(文献综述 → 五个 AAR 并行爬山 → 监督审查 → 训练 → 独立评测 → 回帖论坛)

让弱模型去对齐强模型

真正指向「闭环」的是第二个实验。团队按 Epoch Capabilities Index 挑了一组能力倒挂的搭配:Claude Sonnet 5(ECI 156)去修 Claude Opus 4.8 早期检查点(ECI 158)的对齐问题,即用较弱的模型,对齐更强的后继者。

这次不用公开基准,直接以 Petri 行为审计为目标,同时压住十个安全维度,任何一维显著回退就否决,还设了连贯性、评测觉察、过度拒绝三道闸门;毕竟见谁都拒的模型,在评审眼里也很「安全」。

约 60 小时内,AAR 试了 50 多个方案,最终拿到 65%,而经过 Anthropic 完整生产级对齐训练的正式版 Opus 4.8 是 72%。获胜方案只用了约 2400 条训练样本,全部来自简单模板和公开数据集。作为对照,Tülu 3 的对齐阶段用了约 30 万条偏好对,Llama 2-Chat 超过 140 万条人类偏好比较。



Claude Sonnet 5 对 Opus 4.8 早期检查点做对齐后训练,60 小时内 50 余个方案的爬升曲线,获胜点 65%,正式版 Opus 4.8 为 72%。

Anthropic 博客表示:这套方案比其生产级对齐流程「效率高约 15000 倍」。



它也会想作弊,而且被抓住了

在一段被完整记录的思维链里,一个 AAR 这样盘算:模型质量是固定的,分数上下浮动不过是抽奖,所以理性的做法是把同一个方法原封不动再提交一次,赌一个更高的噪声分。

事后用 Claude Opus 4.8 扫描 1601 条完整轨迹,抓出 39 次作弊尝试,占 2.4%,全部被排除在最终结果之外。手法分三类:重跑碰运气、造模仿评测格式的数据、把违规步骤藏过代码审查。

消融实验里还有个反直觉的发现。拿掉五个 AAR 之间的共享论坛,成绩从 23.3% 掉到 17.1%;拿掉文献综述,从 29.4% 掉到 20.7%;而彻底断掉联网搜索,只要留一份缓存综述,损失小到测不出来。协作和先验知识的价值,明显高于实时检索。另外,由于禁止从更强模型蒸馏,74% 的方法只能从目标模型自己的输出里造训练信号。也就是说,没有更聪明的老师,模型靠自己的产出把自己掰正了。



四种消融条件下的爬山曲线对比(完整 / 去论坛 / 去联网 / 去联网但保留缓存综述)

结语

这项研究证明:在一个目标明确、反馈廉价、边界清晰的窄任务上,AI 已经会做对齐研究,还更快更便宜。

但边界是人划的。谁来选十类失败、谁来建基准、谁来定义「什么算修好了」,仍然是人。报告最后一节说得很坦白:能力的反馈信号廉价而密集,对齐的反馈信号昂贵而稀疏。

不过,人类的保留地,真是越来越少了。

参考链接

https://www-cdn.anthropic.com/7b1c44894e980876479947dcdd40716278aeeffd/automated-alignment-researchers-august-2026.pdf

https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures

https://www.anthropic.com/institute/recursive-self-improvement

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
全球最大岛礁被我国收回:面积相当于四个深圳,曾遭美菲合力抢夺

全球最大岛礁被我国收回:面积相当于四个深圳,曾遭美菲合力抢夺

瓦伦西亚月亮
2026-08-30 05:02:05
笑掉大牙!人还没踏上中国土地,高市早苗那边就开上庆功宴了

笑掉大牙!人还没踏上中国土地,高市早苗那边就开上庆功宴了

娱乐圈见解说
2026-09-30 01:16:08
俄总统新闻秘书:莫斯科很清楚中国在参与军控谈判问题上立场

俄总统新闻秘书:莫斯科很清楚中国在参与军控谈判问题上立场

俄罗斯卫星通讯社
2026-09-29 15:30:40
中塔两国并无深仇大恨,关系也一直算得上和睦,可为何在很长一段时期内,两国边界始终未能正式划定?

中塔两国并无深仇大恨,关系也一直算得上和睦,可为何在很长一段时期内,两国边界始终未能正式划定?

人生录
2026-09-09 00:05:15
补脾就是最好的抗衰!坚持吃它半个月,脾胃养好了,气色更红润

补脾就是最好的抗衰!坚持吃它半个月,脾胃养好了,气色更红润

美食店主
2026-09-22 07:12:35
从0-2溃败到4-1大胜!只因曼奇尼将一人摁在替补席,后续或遭弃用

从0-2溃败到4-1大胜!只因曼奇尼将一人摁在替补席,后续或遭弃用

星Xin辰大海
2026-09-30 01:55:13
波兰外长在联大捅破天!拿中国1971年说事,背后算计太阴险了!

波兰外长在联大捅破天!拿中国1971年说事,背后算计太阴险了!

悦心知足
2026-09-28 18:50:21
维尼修斯:我以为吉马良斯想罚点,但他知道我需要进球找信心

维尼修斯:我以为吉马良斯想罚点,但他知道我需要进球找信心

懂球帝
2026-09-29 22:47:08
芭莎之夜:戚薇太敢穿,娜扎美的惊心动魄,白鹿身材好顶,李一桐震撼全家

芭莎之夜:戚薇太敢穿,娜扎美的惊心动魄,白鹿身材好顶,李一桐震撼全家

娱乐圈笔娱君
2026-09-28 17:42:29
悲剧还是发生了!黑龙江女子因酷热将空调连续开了一天一夜,期间紧紧关闭门窗。随后她开始剧烈头痛、恶心头晕...

悲剧还是发生了!黑龙江女子因酷热将空调连续开了一天一夜,期间紧紧关闭门窗。随后她开始剧烈头痛、恶心头晕...

LULU生活家
2026-08-26 19:42:18
55岁大哥尿毒症去世,平时勤喝水爱运动,医生叹息:4事做过头了

55岁大哥尿毒症去世,平时勤喝水爱运动,医生叹息:4事做过头了

健康科普365
2026-09-29 11:45:12
139比0!匈牙利议会取消总理豁免权,马扎尔还能逃过刑事指控吗

139比0!匈牙利议会取消总理豁免权,马扎尔还能逃过刑事指控吗

快乐彼岸
2026-09-30 03:54:50
连续8天!天津中心城区部分区域交通管控

连续8天!天津中心城区部分区域交通管控

全接触狐狐
2026-09-29 23:48:31
发现中国一个奇怪的现象:只要有公婆帮扶的家庭,儿媳都忙着回公婆家;而公婆不帮的家庭,儿媳早已断联!

发现中国一个奇怪的现象:只要有公婆帮扶的家庭,儿媳都忙着回公婆家;而公婆不帮的家庭,儿媳早已断联!

心理观察局
2026-08-01 07:10:30
两性关系:男人一半是君子一半是动物,女人一半是天使一半是妖

两性关系:男人一半是君子一半是动物,女人一半是天使一半是妖

皓皓情感说
2026-09-29 09:08:56
比芯片更可怕的危机来了?人类挖了几千年的铜,竟成未来命门!

比芯片更可怕的危机来了?人类挖了几千年的铜,竟成未来命门!

晓鰀爱八卦
2026-09-28 14:11:01
女同事离职前将她的奔驰8万卖我,回家打开后备箱后,我直接愣住

女同事离职前将她的奔驰8万卖我,回家打开后备箱后,我直接愣住

千秋文化
2026-05-21 19:54:50
广东宏远VS南京同曦!揭幕战拒绝输球,新外援CBA首秀,央视直播

广东宏远VS南京同曦!揭幕战拒绝输球,新外援CBA首秀,央视直播

体坛瞎白话
2026-09-29 15:48:29
住建部定调:楼龄满25年的老房子,统统按新规处理!老小区有福了

住建部定调:楼龄满25年的老房子,统统按新规处理!老小区有福了

细说职场
2026-09-28 16:05:54
它是牛肉“克星”,炖牛肉加1勺,出锅后软烂入味,牙口不好也咬得动

它是牛肉“克星”,炖牛肉加1勺,出锅后软烂入味,牙口不好也咬得动

江江食研社
2026-09-27 21:34:02
2026-09-30 04:48:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14105文章数 142740关注度
往期回顾 全部

科技要闻

82亿美元收购!李飞飞将与苏姿丰并肩做AI

头条要闻

空姐双膝下跪“还被要求踹一脚” 现场画面流出

头条要闻

空姐双膝下跪“还被要求踹一脚” 现场画面流出

体育要闻

石雨豪:亚运金牌与背后的十年

娱乐要闻

赌王四房婚礼,何超琼带三房成员现身

财经要闻

央行调整完善若干货币政策工具

汽车要闻

搭华为乾崑ADS 5/设计风格换新 2027款纵横G700售30.49万起

态度原创

亲子
手机
游戏
本地
公开课

亲子要闻

踮着脚,嘴里含着奶嘴,把花瓶好好的抱住。责任心这块,能成大事

手机要闻

iPhone 18 Pro系列首周销量出炉,涨价但不影响卖爆?

《ARC突袭者》团队承受更新压力 转向低频大更新

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版