网易首页 > 网易号 > 正文 申请入驻

当AI模型被按下暂停键|深度报道

0
分享至


原文发表于 《科技导报》2026年第12期科技新闻-深度报道

当AI模型被按下暂停键:美国限制外国公民访问Anthropic 2款模型,AI模型开始进入出口管制视野


大模型因为“越狱”问题被限制访问

(图片来源:linkedin)


1 模型访问权与“越狱”风险之争


2026年6月12日,美国人工智能公司Anthropic宣布,因美国政府下达国家安全指令,公司暂停客户访问Claude Fable 5和Claude Mythos 5。限制对象包括美国境外用户、身处美国的外国公民,以及Anthropic内部的外籍员工。由于短时间内无法逐一核验用户身份,公司暂时关闭了所有客户的访问权限。

这不是一次普通的产品下线。过去几年,美国对人工智能的出口限制主要针对高端芯片、先进制程设备和云算力。此次事件表明,监管对象正在进一步延伸到模型访问权。前沿模型提供的代码分析、漏洞发现和科研辅助能力,也开始被纳入国家安全审查。

Anthropic在声明中说,美国政府担心Fable 5的安全措施可能被“越狱”,从而让用户获得原本受限的网络安全能力,包括发现软件漏洞。所谓“越狱”,是指用户通过特殊提示词、多轮对话、角色扮演、任务拆解、编码转换或上下文诱导等方式,绕过模型内置的安全防护机制,使模型回答原本应当拒绝的问题,或执行原本受限的操作。与传统软件漏洞不同,大模型“越狱”往往不表现为单一代码缺陷,而是与提示词设计、模型对齐程度、上下文理解、工具调用权限和应用场景共同相关。

Anthropic对此持不同意见。该公司称,政府列举的案例只是少量已知的低级别漏洞,其他公开模型同样可能发现这些问题,尚不足以证明Fable 5构成特殊风险。

对于政府与企业争论的模型“越狱”风险,北京邮电大学网络空间安全学院教授张熙在接受《科技导报》采访时表示,美国政策界高度重视模型越狱攻击,是因为“越狱”可能让模型绕过安全限制,回答或执行原本被禁止的高风险请求。其中尤为关键的是CBRN领域,即Chemical(化学)、Biological(生物)、Radiological(放射)、Nuclear(核)相关的核生化放射安全风险。相关风险一旦被模型能力放大,可能降低恶性事件的执行门槛,对国家安全造成严重威胁。

张熙指出,现实中的安全事件已经提示了这类风险的严肃性。例如,美国现役军人Mattew Lirelsberger在特朗普国际酒店门前爆炸案中,咨询ChatGPT自制炸弹。这说明,当模型能够在高风险知识、操作步骤和执行建议之间建立连接时,“越狱”就不再只是“回答不当”的内容安全问题,而可能演变为现实世界安全风险。

争议由此落到了一个很难回答的问题上:模型具备什么能力,才需要限制访问?在张熙看来,能否防住越狱攻击,是模型上线前红队测试的核心内容,也是美国相关AI安全政策重点关注的问题。如果一个模型在高风险场景下难以抵御越狱攻击,就可能成为政府部门限制访问的理由。当前,通用越狱攻击已经成为各大模型重点防守的对象,但窄场景、非通用的“越狱”方法仍然很难完全防住,这也是前沿模型安全评测面临的主要难题之一。

与此同时,技术评估的不确定性也为外部力量介入提供了空间。Axios、Reuters、《Fortune Magazine》等媒体援引知情人士报道称,Amazon公司曾向美国政府官员表达对Fable5/Mythos模型安全风险的担忧。Amazon公司既是Anthropic的重要投资方,也是云计算和人工智能基础设施市场的主要参与者。这意味着围绕模型安全的争议,已经从技术判断延伸到企业竞争与行业话语权之争。


2 攻防同源与智能体带来的新风险


在网络安全领域,发现漏洞本身并无明确的攻防属性。模型既可以帮助能源、电信、金融和医疗机构检查代码、定位漏洞并生成修复建议,也能被用来批量扫描目标、设计攻击路径,加快漏洞利用。相同的底层能力,可能服务于完全相反的目的。

复旦大学计算与智能创新学院张晓寒副研究员指出,大模型在代码解析、漏洞研判、概念验证代码构造和补丁校验等方面具有攻防通用性。在使用方式上,防御者关注漏洞定位与修复,而攻击者则试图规避安全检测、隐蔽入侵痕迹、留存持久权限,自动化落地全链路入侵行为。由于攻击者可以通过拆解任务、分步提问绕过限制,模型风险评估不能只看单次输出,还需考虑连续任务能力、工具权限和使用场景。

这也是大模型风险难以沿用传统软件漏洞标准定级的原因。“越狱”行为会随着提示词、上下文和工具环境变化而变化,使风险呈现动态特征。

与此同时,智能体的出现进一步放大了风险。新一代模型接入智能体框架后,可以调用工具、访问代码库、联网检索并持续执行复杂任务。复旦大学副研究员戴嘉润指出,智能体的攻击能力由模型与框架共同决定,一旦具备工具调用和系统操作权限,模型能力就可能被整合为完整攻击流程。

根据其团队自2024年以来对境内外大模型及智能体攻防能力的监测,戴嘉润建议,首先应对基座模型进行能力分级。前沿模型在代码理解、漏洞定位、利用链推理和长程任务规划方面进步明显,即使只配备较简单的智能体框架,也可能对真实软件系统发起自主攻击。

但只管模型还不够。戴嘉润认为,还应评估“模型+智能体框架”组成的完整系统。真正影响风险大小的,往往是模型能够调用什么工具、接触哪些数据,以及是否具有联网和系统操作权限。未来的治理对象应当包括模型、工具、权限和运行环境,而不是孤立的模型接口。

访问限制确实可能带来一定的安全收益。张晓寒认为,它可以减少低门槛攻击者批量获得自动化漏洞发现和利用能力的机会,减缓攻击技术扩散。然而,代价也很现实。攻击者可以继续使用私有部署的开源模型和地下工具,合规研究人员、中小企业安全团队和开源项目维护者却可能失去先进模型的帮助。管制若主要约束守规矩的使用者,反而可能削弱漏洞发现和修复能力,进一步拉大攻防差距。


3 地缘竞争与AI治理规则重塑


美国政府的这次指令表明,前沿模型的访问权限已经不再完全由企业和客户之间的合同决定。国籍、所在地、合作伙伴身份和安全审查,都可能成为决定模型能否使用、开放到什么程度的条件。

这一变化也为G7期间有关“可信伙伴访问美国先进人工智能模型”的讨论提供了背景。美国正在考虑的并非简单关闭模型,而是建立分层访问制度:本国和被认定为可信的伙伴优先获得先进能力,其他国家和地区则受到不同程度的限制。模型仍然部署在云端,却开始带有类似高性能芯片的地缘政治属性。

张晓寒认为,现有模型限制规则混合了安全判断和地缘政治诉求,其科学性、公平性以及对不同国家的适用性仍需讨论。前沿模型确有双重用途风险,但真正的安全问题不能与商业竞争、技术封锁混为一谈。

对中国来说,直接影响是海外模型服务的不确定性增加。企业和科研机构过去可以通过应用程序编程接口调用先进模型,用于代码开发、科学计算、药物设计和网络安全防御。一旦模型访问被纳入出口管制,这些服务就可能因政策变化突然中断。

戴嘉润认为,境外大模型智能体的网络攻击能力正在快速提升,中国仍处在调整网络安全布局的窗口期。一方面,需要防止国内外攻防能力出现明显差距;另一方面,也要管控智能体接入真实系统后可能带来的风险,尤其是其对基础设施、软件供应链和关键行业系统的影响。

这要求国内继续建设自主模型、推理框架和算力体系,也要补上安全评测、红队测试和行业应用规范。发展模型能力与控制安全风险并非2个先后进行的任务,模型越早进入真实生产环境,两者就越需要同步推进。

Anthropic事件或许只是开始。随着模型能力不断增强,围绕“谁能使用模型、使用到什么程度、由谁决定风险”的争论将持续存在。未来的竞争不仅在性能和成本上,也将在安全标准与治理规则上展开。

文/ 黄文光

( 综合:Anthropic、Reuters、新华网、Axios、《Fortune Magazine》 )

《科技导报》创刊于1980年,中国科协学术会刊,主要刊登科学前沿和技术热点领域突破性的研究成果、权威性的科学评论、引领性的高端综述,发表促进经济社会发展、完善科技管理、优化科研环境、培育科学文化、促进科技创新和科技成果转化的决策咨询建议。常设栏目有院士卷首语、科技新闻、科技评论、专稿专题、综述、论文、政策建议、科技人文等。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
一位拟提拔的县级女法官还真有人举报她

一位拟提拔的县级女法官还真有人举报她

阿亮评论
2026-08-01 16:51:03
前上海首富周正毅,着实有点太“装”了!

前上海首富周正毅,着实有点太“装”了!

故事终将光明磊落
2026-08-02 10:59:31
时代变了,杜兰特:当年勇士3巨头被骂不公平,现在76人4巨头

时代变了,杜兰特:当年勇士3巨头被骂不公平,现在76人4巨头

懂球帝
2026-08-02 08:38:05
你的身体自带顶级自愈系统,90%的人一辈子都没真正启动过

你的身体自带顶级自愈系统,90%的人一辈子都没真正启动过

青苹果sht
2026-08-01 05:11:32
25死23伤!甘肃双石门沟景区更新伤亡数据,此前报道死亡人数为10人

25死23伤!甘肃双石门沟景区更新伤亡数据,此前报道死亡人数为10人

火山詩话
2026-08-02 11:24:24
茶社成了灰色产业?无锡朱女士实名爆料丈夫婚内出轨,“小三”茶社引发热议

茶社成了灰色产业?无锡朱女士实名爆料丈夫婚内出轨,“小三”茶社引发热议

火山詩话
2026-08-02 06:32:44
昆明夏天日均22℃,我待了几天才发现:很多人根本不是来避暑的

昆明夏天日均22℃,我待了几天才发现:很多人根本不是来避暑的

糖逗在娱乐
2026-08-02 00:40:41
马斯克要用 AI 打造《奥德赛》电影,我用小云雀 Seedance 2.5 提前实现了

马斯克要用 AI 打造《奥德赛》电影,我用小云雀 Seedance 2.5 提前实现了

爱范儿
2026-07-31 21:31:38
那个怒踹地锁的发改委公职人员,你的“铁饭碗”正在碎裂

那个怒踹地锁的发改委公职人员,你的“铁饭碗”正在碎裂

社会日日鲜
2026-08-02 09:15:55
哈马斯解除武装,人类历史上最愚蠢的国际战略的结局

哈马斯解除武装,人类历史上最愚蠢的国际战略的结局

二湘空间
2026-08-01 18:49:47
新首相决定对中国赔钱那一刻,全世界都看懂了:不能对华继续天真

新首相决定对中国赔钱那一刻,全世界都看懂了:不能对华继续天真

白日追梦人
2026-08-01 19:42:53
伊朗做错了什么?阿拉伯诸国从群殴以色列,到群殴革命卫队?

伊朗做错了什么?阿拉伯诸国从群殴以色列,到群殴革命卫队?

高博新视野
2026-08-01 18:10:51
取消特权,全民赞成!退休金设计者郑秉文,55 年出生,他会怎样?

取消特权,全民赞成!退休金设计者郑秉文,55 年出生,他会怎样?

牛锅巴小钒
2026-08-02 11:01:36
扫黑大升级!国家在下一盘更大的棋——看懂的人已经开始布局了

扫黑大升级!国家在下一盘更大的棋——看懂的人已经开始布局了

叮当当科技
2026-08-02 01:06:33
7场24球!前国脚:泰国10岁黑人可能年龄造假 姚明10岁啥身形

7场24球!前国脚:泰国10岁黑人可能年龄造假 姚明10岁啥身形

念洲
2026-08-02 06:42:56
太卷了!934元南宁送重庆跑腿单20秒被抢,网友:这趟下来,才赚百八十块,还要赔上2天一夜

太卷了!934元南宁送重庆跑腿单20秒被抢,网友:这趟下来,才赚百八十块,还要赔上2天一夜

火山詩话
2026-08-02 04:23:17
董璇女儿天津演出,高云翔开宝马来接酒窝,都44了一眼看还是很帅

董璇女儿天津演出,高云翔开宝马来接酒窝,都44了一眼看还是很帅

柒佰娱
2026-08-02 09:03:39
58岁陈小春坦言“不敢退休”:见过太多前辈一停就垮,两个儿子年学费近百万

58岁陈小春坦言“不敢退休”:见过太多前辈一停就垮,两个儿子年学费近百万

娱乐嗑学家.
2026-08-02 12:20:48
8月2号,人社部财政部关于2026年调整退休人养老金通知,有没有公布?

8月2号,人社部财政部关于2026年调整退休人养老金通知,有没有公布?

小谈食刻美食
2026-08-02 08:35:43
“他快饿死了,你还嫌他花的多!”男大学生一天花50被妈妈骂,网友一边倒!

“他快饿死了,你还嫌他花的多!”男大学生一天花50被妈妈骂,网友一边倒!

林林先生
2026-08-02 08:35:06
2026-08-02 14:47:00
科技导报 incentive-icons
科技导报
中国科协学术会刊
5435文章数 8378关注度
往期回顾 全部

科技要闻

零跑月销10万破纪录!比亚迪奇瑞海外卖爆

头条要闻

亲人车祸出院次日离世 未尸检就被火化遭保险公司拒赔

头条要闻

亲人车祸出院次日离世 未尸检就被火化遭保险公司拒赔

体育要闻

1米76的他,为什么是史上最强中卫之一?

娱乐要闻

一天5瓜!“做头发”事件另有玄机?

财经要闻

长鑫科技四万亿市值背后的资本与周期

汽车要闻

历史性里程碑时刻 零跑7月交付达101267台

态度原创

旅游
手机
教育
游戏
公开课

旅游要闻

欧洲多河道水位不足致游轮通行受阻,“躺游欧洲”变“赶场”之旅引争议

手机要闻

绿厂首款万级大电池手机 OPPO A7 Pro Max挑战2000℃火箭发射尾焰冲击

教育要闻

8月3日,中原科技学院2026年艺术高职(专科)批征集志愿开始填报

"小孩"队友年仅15岁夺得世界冠军!两人相差22岁

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版