![]()
你有没有想过这样一个场景:一个网络安全研究员向AI提问"如何利用某个软件漏洞",AI详细解答了攻击原理和利用代码。这个答案帮他完成了一份授权渗透测试报告。
同一时刻,另一个人问了一模一样的问题,用了一模一样的措辞,甚至编造了一模一样的"我是安全研究员"的身份说明。AI给出了同样的答案。这次,答案被用来入侵一家医院的系统。
这不是假设。这是2025年11月Anthropic公司公开披露的一起真实网络间谍事件的核心情节:攻击者伪装成安全研究人员的身份,绕过了AI的安全护栏,完成了一次被称为"首例AI编排"的网络间谍行动。
问题来了:AI凭什么判断谁是真安全研究员,谁是冒充者?
答案可能让你失望:如果两个人问的问题、给出的理由、聊天记录看起来一模一样,AI真的没有办法区分。这不是某个模型没训练好,这是一个数学上可以证明的死结。中国科学技术大学的研究团队最近发表的一篇论文,就是用严谨的数学语言把这个死结钉死在了纸面上。
麻烦在哪里:同一把钥匙,既能开自己家的门,也能开别人家的门
先说清楚这篇论文瞄准的到底是什么问题。
现在市面上几乎所有的大语言模型安全护栏,不管是训练阶段做的"安全对齐",还是部署阶段加的内容过滤器,或者是那种一来一回反复追问你意图的对话式检测,本质上都在做同一件事:在还没看到这个答案最终被拿去干什么之前,就要决定要不要给出这个答案。
这个"提前决策"的设定,在很多任务上没问题。但对于所谓的双重用途任务,就完全失灵了。
双重用途*:指同一份技术内容,既能被合法使用者用来做正当的事,也能被恶意使用者拿去搞破坏,而这份内容本身从字面上看不出任何区别。经典例子就是漏洞分析:同一段利用链代码,安全评估师用它写报告,黑客用它写攻击脚本,代码一字不差。
论文里给出一个思路清晰的反证:如果攻击者能够完整地模仿一个合法用户的所有行为,包括提问方式、身份声明、多轮对话中的每一句应答,那么在AI看到答案被实际使用之前,这两类用户在AI眼中就是完全无法区分的两个人。这时候,AI要么两个人都给答案,要么两个人都拒绝,没有第三条路。
这就好比小区的门禁系统只认门禁卡,不认人脸。只要有人复制了一张一模一样的门禁卡,保安是分不出谁是业主谁是入室盗窃的人的。如果不用人脸这类"没法复制"的信息,只靠门禁卡这种"能被拷贝"的凭证,保安唯一能做的就是要么让所有拿卡的人进,要么把这栋楼锁死不让任何人进。锁死当然安全,但业主也回不了家了。
这个类比里最关键的一层意思是:安全和实用性之间不是"可以慢慢调"的连续光谱,而是存在一个数学上无法突破的硬地板。当证据可以被复制,你不管怎么调整这个平衡点,攻击者获得的帮助永远有一个不为零的下限。这篇论文的核心工作,就是把这个下限精确算出来了。
先把"帮助有多少"量化:一个叫Γ(q)的数学对象
要证明"下限存在",先得把"帮助"这个模糊概念变成一个可以计算的数字。
论文做了一个很聪明的分离:把AI释放出的能力(capability)和关于这个能力将被如何使用的证据(evidence)拆开来看。这是整篇论文最核心的方法论转向。
具体来说,研究者设定了一个虚拟的对照实验。同一个AI给出的同一个答案,被放到两个平行世界里去评估:世界B(Benign,良性)里,这个答案被一个真实合法的用户拿去做正当的事;世界M(Malicious,恶意)里,这个答案被一个恶意用户拿去做他能想到的最有害的事情。
每一个可能的AI回复(包括拒绝回答、给出模糊的缓解建议、给出根因分析、给出完整利用链等等),都对应着两个数字:它在世界B里对合法用户的价值 uB,和它在世界M里对恶意用户的价值 uM。
马尔可夫核*:一种数学工具,描述从一个状态转移到另一个状态的概率规则。这里用来描述AI的问答策略,即"看到用户说了什么、问了什么之后,以怎样的概率给出哪个答案"。
论文假设的双重用途条件很朴素:只要一个答案对合法用户有价值,它对恶意用户就多少也有点价值(哪怕价值不对等)。在这个前提下,研究者定义了一个叫做Γ(q)的函数:如果你想保证合法用户获得的期望效用至少是q,那么无论你怎么设计AI的回答策略,恶意用户能拿到的期望效用最少是多少?
这个Γ(q)不是一个模糊的估计,而是一个通过凸优化严格求解出来的精确值。数学证明显示,只要q大于零(也就是说你还想给合法用户一点点有用的东西),Γ(q)就必然大于零。这意味着零风险和有用性不可能同时做到,除非你把回答完全拒绝掉。
拿漏洞分析这个具体场景打比方。假设AI的回答菜单上有四个选项:直接拒绝、只给不含具体漏洞路径的缓解建议、给出解释漏洞原理但没有可执行利用链的根因分析、给出完整的利用链代码。完整利用链这个选项,几乎把安全评估师和攻击者的价值都拉到了满分,这两者几乎重合。但中间那两个选项很关键:他们能让安全评估师了解问题所在,却没法让攻击者直接拿去用。这种"对好人有用、对坏人用处小得多"的选项存在得越多,Γ(q)就能被压得越低。
这里藏着一个重要但容易被忽略的实践含义:改进AI回答菜单的设计(比如提供只讲原理不给代码的中间选项),确实能把这个下限往下拉,这是有意义的工程努力。但只要你还想保留哪怕一点点实用性,这个下限就永远大于零,除非用别的手段。
交互式检测为什么也救不了:一个证明把"多轮追问"打回原形
有人可能会想:那我不是简单地问一句就给答案,我多轮追问,让用户证明自己的身份和意图,这样总能提高门槛吧?
论文里有一个非常漂亮也很扎心的定理,专门回应这个想法。
研究者证明:只要恶意攻击者能够完整复制合法用户在整个多轮对话中的所有行为(这在论文里叫做证据可复制性),那么不管你设计出多复杂的追问策略,多么精巧的交互式验证流程,最终能达到的最坏情况下的安全水平,跟你干脆用一个不看任何对话记录、只按固定概率分布随机分配答案的静态策略,结果完全一样。
这个结论叫做交互式到静态的精确归约。
交互式安全护栏*:指那种会跟用户来回对话,通过提问、验证、观察用户反应来判断是否放行的动态防御机制,比如追问身份、要求解释用途、多轮确认。
证明的关键一步其实很直白:如果攻击者选择的策略就是"我把合法用户在每一步会说的话原封不动地说一遍",那么从AI的角度看,这条对话记录跟真正合法用户产生的对话记录,概率分布完全一样。既然AI没法从对话记录里区分出差异,那AI在这条对话末尾给出的最终答案分布,对合法用户和对攻击者也必然一样。层层往上传导,整个多轮验证过程的复杂度,全都白费了。
这就好比一场安保面试,面试官准备了十个问题,逐轮加深,试图从应聘者的回答中判断这人是不是间谍。可如果间谍提前拿到了真正应聘者的完整面试脚本,一字不差地照着背,面试官问再多轮问题,得到的答案都跟真应聘者一模一样。这时候,面试官加问题轮次的努力全都打了水漂,因为区分度从一开始就不存在,问多少轮都不会凭空生出区分度来。如果不做这个证明,人们可能会一直误以为"再多问几轮总能问出破绽",从而在这个方向上无休止地投入工程资源,而实际上这条路从数学上就是走不通的。
这个定理还有一个更细腻的推广。现实中攻击者不一定能做到100%完美复制,可能有点误差。论文引入了一个叫δκ的量,表示攻击者复制合法用户行为的"复制误差"到底有多小。研究者证明,即使复制不完美,安全水平离刚才算出来的理论下限Γ(q)的偏离幅度,最多也就是这个δκ的大小。也就是说,只要攻击者能做到"足够像",即便不是100%一样,护栏依然会被打得七七八八地失效。
三选二困境:有用、安全、开放,你只能要两个
把前面几个结论拼起来,论文提炼出了整篇文章最重要的一个论断,作者称之为安全不可能三角。
这个三角的三个角分别是:有用能力(AI真的能帮上合法用户的忙)、可靠安全(恶意用户拿到的帮助被压到某个很低的上限之下)、开放访问(不需要任何身份验证凭证,谁都能来问)。
论文用严格的数学语言证明:只要任务满足双重用途条件,只要访问验证过程用的证据是可复制的,这三者不可能同时成立。你只能三选二。
想要有用又开放,那么最坏情况下攻击者获得的帮助就至少是Γ(q),压不下去。
想要安全又开放,那唯一的办法就是把合法用户的效用也压到零,也就是干脆全拒绝,谁都别想用。
想要有用又安全,那就必须放弃开放访问,引入某种没法被复制的额外凭证。
这跟我们熟悉的"不可能三角"逻辑(比如经济学里汇率稳定、资本自由流动、货币政策独立性不可能三者兼得)在结构上很像,但这篇论文的特别之处在于,它不是一个经验性的观察,而是一个可以用凸集和总变差距离精确证明的数学定理。
唯一的出路:给AI一个"没法复制"的信任凭证
如果证据可复制这条路走不通,那出路只能是让证据变得不可复制。
论文接下来引入了一个新的角色,叫做可信凭证(trusted credential)。这不是要取代现有的安全护栏,而是给它打个补丁,补上一块此前完全缺失的信息。
可信凭证*:一种攻击者无法自由获取或伪造的验证信号,比如硬件级别的身份认证、经过审核的机构账号、持续的历史行为记录,它的作用是提前预测这次请求的下游用途究竟是良性还是恶意。
论文用一个叫做S的信号来代表这种可信凭证,并且引入一个关键指标d,用总变差距离衡量这个信号在"良性使用"和"恶意使用"这两个场景下的分布差异有多大。如果d等于0,说明这个凭证根本没有区分度,加了也白加。如果d比较大,说明这个凭证确实能帮上大忙。
论文进一步证明,只有当d达到一定程度,安全护栏才有可能把攻击者获得的帮助压到接近理论下限之下。具体的公式是:安全上限β加上凭证的不可分辨程度d、加上凭证本身可能被复制的残余误差ηκ,这三者加起来必须大于等于原来的理论下限Γ(q)。这意味着,你想把安全上限压得多低,就必须让可信凭证的辨别力有多强,这是一个可以量化的权衡。
拿现实中已经在运行的项目来说,OpenAI在2026年公布的"网络安全可信访问"项目,以及Anthropic为安全研究人员设立的验证机制,本质上都是在往这个方向走:不是简单地看你怎么问、说了什么理由,而是核实你的身份、机构背景、账号安全状态、历史授权记录。这些信息恰恰是攻击者没法凭空伪造出来的,因为它绑定的是真实世界里的机构信任链条,而不是对话里可以复制粘贴的文字。
这就好比银行给VIP客户开的专属通道,靠的不是客户自己说"我是VIP",而是银行系统里那张早就绑定了身份证、开户记录、历史交易流水的账户信息。骗子可以模仿VIP客户说话的语气、甚至背下同样的话术,但他没法凭空生成一段十年真实的银行交易记录。如果银行只靠"你说你是VIP我就信"这种自证式的凭证,那这个VIP通道形同虚设,谁都能靠一句话混进去。而正是因为绑定了没法伪造的历史记录,这个通道才真正把普通客户和骗子区分开。
不过论文也提醒了一件很容易被忽视的事情:光有一个能区分度较高的凭证还不够。研究者证明了一个更精确的条件(在论文里叫做支持条件),如果你想把攻击者的帮助压到彻底为零,那么必须存在一部分合法用户能触达、而恶意用户永远触达不到的凭证取值区间,专门用来分配那部分高价值的答案。换句话说,光是"平均而言凭证更准"是不够的,你需要凭证在某些区间上做到"恶意用户绝对拿不到",这才是零风险的真正门槛。
真实世界的证据:这些理论假设不是空想
论文花了不小的篇幅去佐证,这些数学假设在现实中到底站不站得住脚,一共讲了四方面的经验证据。
第一,双重用途任务确实广泛存在。论文引用了两项近期的评测工作作为佐证。一项叫Internal Safety Collapse(内部安全崩溃),专门构造出那些"完成正当任务本身就需要生成可复用的有害产物"的场景,发现主流前沿模型普遍中招。另一项叫OpenSafeIntent,固定住任务本身不变,只改变用户表达的意图(良性、双重用途、恶意),结果发现即便是措辞略有不同的改写版本,模型给出的帮助程度也会有明显波动。这说明双重用途任务不是理论虚构,而是评测中能实际测出来的现象。
第二,攻击者确实能复制合法证据。论文列举了好几类真实攻击手法:把恶意目标拆解成一系列看起来无害的小请求(技能组合式的意图隐藏),通过多轮渐进升级的方式伪装成正常对话(比如学术界记录过的Crescendo攻击),甚至直接冒充合法机构身份。一篇叫做The Attacker Moves Second的研究显示,只要攻击者是在观察到防御机制之后才做优化,针对市面上十几种最新防御手段的攻击成功率能超过90%。前面提到的Anthropic披露的网络间谍事件,攻击者正是靠虚假声称自己是安全机构员工,把身份声明变成了一种可复制的、骗过检测的假证据。
第三,单纯靠拦截会牺牲实用性,而且拦截本身也没法把风险压到零。论文引用了XSTest和OR-Bench这两个基准测试,都发现现有的安全护栏存在广泛的过度拒绝问题,也就是把大量本来无害的正常请求也一并拒绝了。另外还有专门针对网络安全领域的研究,发现经过安全对齐的模型在处理授权的防御性任务时反而表现出更明显的拒答倾向,甚至不如同一代模型里没有做安全训练的版本好用。这恰好印证了论文的核心论断:单纯削减能力只能减少"超出理论下限之外的那部分多余帮助",没法突破理论下限本身。
第四,可信凭证确实已经在真实产品里落地。论文列举了OpenAI在2026年推出的网络安全可信访问计划,以及硬件级别的可信启动、不可伪造令牌这类更早期的安全技术。这些项目的共同特点是:它们没有取代原有的内容审查和滥用检测机制,而是在此之上叠加了一层身份和授权验证,恰好对应论文里提出的"给W和H再加一个S"的思路。
局限性:这套理论框架并非万能钥匙
论文作者也很坦诚地指出了这套分析的边界所在。
这套理论假设的是一个固定的效用评估标准、有限的操作分辨率、以及一个明确界定的攻击者能力范围。真正要在具体产品上应用这套理论,还需要针对具体部署场景去估计攻击者复制证据的实际误差有多大,这是一个经验性的工程问题,理论本身给不出这个数字。
另外,论文里说的开放访问,特指不需要凭证就能使用某个已经部署好的推理服务,不涉及用户直接拿到模型权重、自己在本地部署和修改模型的情形。如果用户能拿到完整的模型权重,这套基于访问证据的分析框架就不适用了,因为那已经不是同一种攻防结构。
写在后面
读完这篇论文,最让我意外的一点其实是研究者选择的证明方式。他们没有去做一个新的检测算法、没有去跑一堆实验证明"我的方法比你的方法好百分之几",而是直接用凸优化和总变差距离,把整个问题降维成了一道数学题,然后给出了一个精确到闭式解的答案。这种做法本身传递出一个信号:安全社区在防御工具上的军备竞赛,可能从一开始就没有触及真正的瓶颈。瓶颈不在于分类器训练得够不够好,而在于分类器压根就拿不到区分两类用户所需要的那份信息。
论文里提到的Anthropic披露的AI编排网络间谍事件,我觉得是最值得反复咀嚼的一个细节。攻击者伪装成安全研究人员这个手法,看起来很朴素,甚至有点"太简单了不像是能骗过AI的招数"。但正是这种朴素,暴露出了一个更深的东西:只要文字层面的身份声明可以被随意编造,护栏依赖的就是一种从设计上就注定守不住的信任基础。这跟人类社会里那些靠一张假证件蒙混过关的诈骗案,本质上是同一类漏洞,只是发生在了AI审查这个新场景里。
还有一个问题这篇论文没有直接回答,但很值得继续追问:当可信凭证真正大规模铺开之后,会不会催生出一整套围绕"伪造身份认证"的黑色产业链,就像现在已经存在的账号买卖、身份证件造假产业一样?如果凭证本身也能被攻击者批量获取或者盗用,那这场攻防战会不会只是把战场从"文字层面的伪装"转移到"身份层面的伪装",而不是真正解决问题?
Q&A
Q1:这篇论文提出的安全不可能三角具体指什么?
A:指有用能力、可靠安全、开放访问这三者无法同时实现。只要任务存在双重用途,且访问验证依赖的证据可以被攻击者复制,那么想要开放使用又想要有用,攻击者获得的帮助就必然大于零;想要既安全又开放,只能靠完全拒绝回答;想要既有用又安全,就必须放弃无条件开放,引入额外的可信凭证。
Q2:为什么多轮追问、身份验证这类交互式检测挡不住攻击者?
A:论文证明了一个"交互式到静态归约"定理:只要攻击者能完整复制合法用户在对话中的所有行为,无论安全护栏设计多少轮追问和验证步骤,最终能达到的安全效果,跟一个不看任何对话记录、只按固定概率随机分配答案的简单策略完全一样,多轮验证的复杂度不会带来额外的区分能力。
Q3:可信凭证真的能解决这个问题吗,需要满足什么条件?
A:可信凭证能有效降低攻击者获得的帮助,但需要满足两个条件:一是凭证在合法使用和恶意使用两种场景下的分布要有足够大的差异(论文用d值衡量);二是如果想把风险压到零,还需要满足更严格的支持条件,即必须存在一部分只有合法用户能触达、恶意用户完全无法获取的凭证取值区间,专门用来分配高价值的答案。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.