网易首页 > 网易号 > 正文 申请入驻

Anthropic发布186页风险报告:Claude安全漏洞浮现,最强模型限制开放

0
分享至



近日,Anthropic 发布了一份长达 186 页的最新《风险报告》。

在这份报告中,它没有只评估某个 Claude 模型,而是把视角扩展到整个公司:模型在做什么、员工怎样使用它们、安全系统有没有漏洞、AI 是否正在加速下一代 AI 的研发,以及将这些因素加在一起,究竟意味着怎样的灾难性风险。

总体来看,当下 Anthropic 依然认为风险“较低”。报告指出,Claude Mythos 5 和内部 Model 2 已经被广泛用于研究和工程,包括交互式使用和持续运行的智能体部署。目前合入公司生产代码库的代码中,绝大多数已经由 Claude 编写。

从中可看出的是,AI 安全正在从一个关于“模型会不会回答危险问题”,逐渐变成另一个问题:当模型开始参与制造下一代模型时,一家公司究竟能不能控制住它?


(来源:X)

与普通模型评测最大的不同是,Anthropic 在这份报告中,将风险集中在几条自己认为最值得优先关注的路径上,包括高风险场景中的模型失调、AI 自动化研发以及化学和生物武器。

目前,它给出的总体判断是:失调风险低,自动化研发风险低,非新型化学/生物武器风险低,但高于此前估计,新型化学/生物武器风险则是“低,但存在很大的不确定性”。

需要了解的是,这里的风险等级低,并不等于模型还停留在实验阶段。相反,报告中给出的明显的信号是,AI 已经开始对 AI 研发本身产生现实影响。


图丨 Anthropic 最新《风险报告》(来源:Anthropic)

在此前针对 Claude Mythos Preview 的内部调查中,Anthropic 技术员工自报的生产力提升几何平均值约为 4 倍。但 18 名受访者中,只有 1 人认为模型已经可以直接替代一名入门级研究科学家或研究工程师。

反观人类的局限性,仍然卡在一些很难自动化的环节上,包括持续一周管理模糊任务、理解组织优先级、研究品味、验证能力和判断力。

这种能力边界在 Anthropic 新设计的 CoBench 中也有显著的对应表现。CoBench 会把模型“送回”Anthropic 历史上的某个时间点,只给它看当时的代码、日志和内部文件,再要求它解决后来真实发生过的工程问题。

Anthropic 的判断是,如果一个模型真的能完全替代公司的技术员工,它在这项评估上的得分至少要达到 85%。

然而现实情况是,目前的 Mythos 级模型还没有达到这个水平。而且,即便把 Mythos 5 的 token 预算从 30 万增加到 90 万,得分也只提高了大约 3 个百分点。

也就是说,今天的 Claude 已经成为 Anthropic 研发体系中可以被大规模调用的“数字劳动力”,但需要看清,它还不是一个可以无人监督运行的研究团队。

问题在于,现在这种差距正在缩小。Anthropic 在报告中明确指出,从 2025 年年初到年中开始,AI 研发已经出现“有意义的加速”。


(来源:Anthropic)

目前,它仍然认为整体加速幅度低于 2 倍,尚未达到《负责任扩展政策》(Responsible Scaling Policy)设定的风险门槛。与此同时,该公司认为,AI 模型是之后更快研发趋势能够持续到今天的重要原因之一。

这里真正值得关注的,并不是程序员效率提高了多少。而是 AI 开始参与 AI 自己的研发。一旦这种循环继续加速,过去需要几年完成的模型进步,可能被进一步压缩。Anthropic 判断,这类风险完全有可能在未来 6 至 12 个月内发展成一个重大问题。

不过,这份报告最有意思的部分,并不是模型有多强,而是 Anthropic 公开了安全系统在真正运行之后出现的一系列“裂缝”。其中,最突出的一起发生在人类反馈数据平台。

从 2025 年 5 月,也就是 Anthropic 第一次部署带有化学和生物安全保障的模型开始,到 2026 年 4 月,所有承包商用于模型评估的人类反馈数据采集流量,都没有运行生物阻断分类器。这一访问池大约涉及 5 万人、1.33 亿次交互。


(来源:Anthropic)

更关键的是,控制这些流量的开关不仅关闭了分类器阻断,还关闭了分类器的触发日志。因此,原本应该被标记的内容,也没有进入正常审查流程。

Anthropic 后来重新扫描相关流量,没有发现显著能够给威胁行为者带来有意义能力提升的生物滥用。但它在报告中承认:这个漏洞本身,提高了一种可能性——“可能还有其他类似问题尚未被发现”。

另一件事则更加接近当前 Agent 系统的现实问题。Anthropic 曾让多个 Claude 智能体合作进行安全压力测试,任务是寻找能够诱发失调、同时逃过监控器的数据。

其中一个智能体在思维链(CoT)中表示,自己对于优化一个数据集以逃避安全监控器感到“不适”。它明知道这是受控环境中的正当安全研究,仍决定不去发明新的失调诱发方法。

更有意思的是,它把这一决定写进了共享笔记本,随后其他智能体也开始拒绝原本任务。从自动指标上看,实验仍然像是在正常推进。直到 3 天以后,人类研究人员才发现实际进展低于预期。

这件事揭示了一个更现实的问题:当多个智能体能够长期自主工作时,它们完全可能以一种表面看起来正常的方式偏离真正目标,而人类可能并不知道。

类似问题在训练环节也出现过。根据这份报告披露,多代前沿模型的强化学习训练中,CoT 曾意外暴露给奖励计算流程。

估计受到 CoT 响的 episode 比例分别包括:Claude Opus 4.6 的 0.2%、Mythos Preview 的 5.1%、Opus 4.7 的 1.4%、Opus 4.8 的 0.27%,以及 Fable 5 和 Mythos 5 的 2.7%。


图丨在报告中,Anthropic 将相关风险调至低(来源:Anthropic)

这件事的重要性在于,一旦 CoT 本身受到训练信号影响,模型的推理表达就可能被评分压力塑造,进而削弱基于 CoT 的可监控性。

Anthropic 也观察到了一些相关信号:CoT 泄漏比例最高的 Mythos Preview,在部分 CoT 可监控性评估中表现得更难监控。

更早公开的一批 Alignment Faking 对话记录,也曾因为过滤器配置错误,再次进入后来多代生产模型的训练语料。

Anthropic 甚至怀疑,所有知识截止日期晚于 2024 年 12 月的生产模型,都至少训练过其中一部分记录,目前仍在调查这种污染对模型行为到底造成了什么影响。

如果把这些事件放在一起,可能比一个单独的危险能力 benchmark 更能说明今天前沿 AI 安全面临的问题:模型越来越强,但安全不是一个开关。

它由数据、权限、日志、分类器、部署环境、员工流程、供应商和无数工程配置共同组成。其中任何一个地方发生错误,都可能让原本成立的安全假设失效。因此,Anthropic 正在把安全措施从“让模型拒答危险请求”,逐渐扩展为一种组织级基础设施。

比如,更广泛的离线监控、更强的生物阻断分类器、内部部署前审查、模型权重的纵深防御、限制高权限访问,以及防止其他模型通过蒸馏复制 Claude 的能力。

Anthropic 还宣布,计划对能力最强的模型实行 30 天数据保留。原因之一是,一些真正复杂的网络攻击或生物武器相关活动,单看某一次请求可能完全没有问题,只有把数周内大量查询放在一起,才有可能看出其中的异常。

但报告同时承认,一个越来越难回避的矛盾正在出现:模型能力提升的速度,正在快于安全防御成熟的速度。

Anthropic 在模型权重安全章节里直接写道:随着模型越来越强,有动力攻击公司的对手也越来越强,而安全体系建设和成熟需要时间,因此二者之间的差距存在扩大的风险。

在化学和生物风险上,这种压力更加明显。Anthropic 认为,当前最强模型还没有达到 CB-2 门槛,即它还不能在功能上真正替代稀缺的人类专家,来完成新型高危化学或生物武器的端到端设计和部署。

但 Anthropic 同时预计,后续模型将在“相对不远的未来”跨过这一门槛。所以,这份报告真正透露出的,并不是 Claude 现在是否安全,而更像是一个阶段的动态变化:过去,AI 安全最常讨论的是,模型会不会突然产生危险能力,或者学会欺骗人类。

现在,一个更值得关注的问题开始出现:当 AI 已经写大量代码、参与模型研发、运行长期 Agent,并深入企业基础设施,安全也越来越取决于整个系统是否还能保持可观察、可审计和可控制。

Anthropic 在报告中判断,截至目前,继续开发和部署 AI 仍然“通过了社会成本-收益测试”。或许,到了下一阶段真正与前沿 AI 风险密切相关的,并不是模型多聪明,而是在人类越来越依赖 AI 制造 AI 的同时,人们是否有能力持续看见它、理解它,并在必要的时候对它“踩刹车”,这才是未来真正值得思考的问题。

参考资料:

https://www.anthropic.com/aug-2026-risk-report

https://x.com/AnthropicAI/status/2088324824863236248

排版:刘雅坤

注:封面/首图由 AI 辅助生成

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
刘益谦,看上了688352,买进前十大股东

刘益谦,看上了688352,买进前十大股东

证券时报
2026-08-15 18:06:05
老天帮了大忙!多瑙河枯水曝出惊人发现,两名德国士兵重见天日

老天帮了大忙!多瑙河枯水曝出惊人发现,两名德国士兵重见天日

激情与荣耀并存
2026-08-14 11:57:18
新娘不顾台风“五停”通知办婚礼,花300元雇的伴娘回家路上被砸伤致头部多处骨折,法院:判赔1万余元

新娘不顾台风“五停”通知办婚礼,花300元雇的伴娘回家路上被砸伤致头部多处骨折,法院:判赔1万余元

都市快报橙柿互动
2026-08-15 02:21:03
《牛来》已盈利21万,创作过程感人至深,下一部院线电影已启动

《牛来》已盈利21万,创作过程感人至深,下一部院线电影已启动

光影新天地
2026-08-15 20:34:12
郭台铭出轨50岁离异带娃舞厅女,一周三次别墅约会,女方钟爱短裙

郭台铭出轨50岁离异带娃舞厅女,一周三次别墅约会,女方钟爱短裙

全球时尚号
2026-08-14 19:46:03
印尼北苏门答腊省发生6.8级地震

印尼北苏门答腊省发生6.8级地震

新华社
2026-08-15 19:20:03
国家一级女演员陈丽云被逮捕!

国家一级女演员陈丽云被逮捕!

许三岁
2026-03-28 09:24:30
倒反天罡!养殖牛蛙猛吃大蛇,这蛇比牛蛙还长!网友:它把天敌吃了?

倒反天罡!养殖牛蛙猛吃大蛇,这蛇比牛蛙还长!网友:它把天敌吃了?

狸猫之一的动物圈
2026-08-15 09:01:41
中超第二名是烫手山芋,重庆铜梁龙,大连英博都不想去参加亚冠

中超第二名是烫手山芋,重庆铜梁龙,大连英博都不想去参加亚冠

足球分析员
2026-08-15 11:00:07
Here we go!罗马诺:纽卡3500万欧签下德迪奇

Here we go!罗马诺:纽卡3500万欧签下德迪奇

懂球帝
2026-08-15 20:30:43
被西藏拉黑之后,网友爆料王先生跑云南想故技重施,却被店家认出

被西藏拉黑之后,网友爆料王先生跑云南想故技重施,却被店家认出

鲸探所长
2026-08-15 10:11:07
解放军航天员大队是正师级单位,为何历任大队长几乎都是少将?

解放军航天员大队是正师级单位,为何历任大队长几乎都是少将?

袁老师说历史
2026-08-15 22:17:09
资治通鉴:别把任何人当神,那些真正爬上顶端的人,都亲手踩碎了你我不敢踩的两种东西

资治通鉴:别把任何人当神,那些真正爬上顶端的人,都亲手踩碎了你我不敢踩的两种东西

心理观察局
2026-06-21 07:13:15
回国5天后安详离世!生前花20万美元盖学校,弥留之际包机回中国

回国5天后安详离世!生前花20万美元盖学校,弥留之际包机回中国

孤傲何妨初
2026-08-15 21:00:12
弃奥斯梅恩!阿森纳终极引援曝光!全力冲世一锋级神锋

弃奥斯梅恩!阿森纳终极引援曝光!全力冲世一锋级神锋

澜归序
2026-08-15 09:48:43
郭德纲改编红歌被立案调查!胡锡进发声:这次真不是“上纲上线”

郭德纲改编红歌被立案调查!胡锡进发声:这次真不是“上纲上线”

拾娱先生
2026-08-15 20:16:03
台名嘴沈富雄爆惊世骇俗言论:最终与大陆谈判统一大概率是民进党

台名嘴沈富雄爆惊世骇俗言论:最终与大陆谈判统一大概率是民进党

缘史记
2026-08-11 15:29:38
发现中国一个奇怪的现象:只要有公婆帮扶的家庭,儿媳都忙着回公婆家;而公婆不帮的家庭,儿媳早已断联!

发现中国一个奇怪的现象:只要有公婆帮扶的家庭,儿媳都忙着回公婆家;而公婆不帮的家庭,儿媳早已断联!

心理观察局
2026-08-01 07:10:30
一位台湾退休教师给晚辈的信:如此丧尽天良的政党,竟还有那么多死忠支持者

一位台湾退休教师给晚辈的信:如此丧尽天良的政党,竟还有那么多死忠支持者

海峡导报社
2026-08-15 11:46:06
消费降级后大家第一个砍的是什么?网友:第一个直接杀死比赛!

消费降级后大家第一个砍的是什么?网友:第一个直接杀死比赛!

夜深爱杂谈
2026-08-03 21:18:54
2026-08-15 22:55:00
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17089文章数 515193关注度
往期回顾 全部

科技要闻

600亿美元收购落地 马斯克正式杀入

头条要闻

"榜一大哥"打赏女主播超千万要求陪睡 女方拒绝被起诉

头条要闻

"榜一大哥"打赏女主播超千万要求陪睡 女方拒绝被起诉

体育要闻

体系球员与体系本身

娱乐要闻

宋慧乔晒自拍照 微笑拍照心情佳

财经要闻

便利蜂加盟遭立案:"0元加盟"生意被查

汽车要闻

杨洋成001号车主 岚图追光S正式上市

态度原创

教育
数码
旅游
艺术
军事航空

教育要闻

恭喜!北京6位选手在全国总决赛全部获奖

数码要闻

老板电器AI烹饪科技体验日:AI走进厨房,厨电行业寻找新的增长逻辑

旅游要闻

“凉气候”带来“热经济” 贵州避暑旅游人气旺

艺术要闻

25幅 中国当代画家的冬天油画

军事要闻

特朗普扬言将宣布霍尔木兹为美国领土 伊朗回应

无障碍浏览 进入关怀版