网易首页 > 网易号 > 正文 申请入驻

对抗性完整:AI时代,别让一个局部正确骗过整个系统

0
分享至


本文来自微信公众号: HavenlonLabs ,作者:HavenlonLabs

在日常生活中,我们经常会遇到这样一类人。

他们锁车以后,会再回头拉一下车门;发出重要邮件之前,会重新检查收件人和附件;完成转账之前,会再次核对姓名、账号和金额;签署合同之前,即使文件已经经过多人审核,也会重新翻到最后一页确认版本。

站在旁观者的角度,这些动作很容易被理解为过度谨慎。

明明已经按了锁车键,为什么还要拉一次车门?明明流程已经审核通过,为什么还要重新打开文件?明明系统已经显示绿色,为什么还要再确认一次?

有时,周围的人甚至会觉得,这个人是不是有些神经质。

但真正经历过事故的人,往往不会这样看。

他们知道,现实世界里的很多问题,并不是因为人们什么都没有做,而是因为人们做完某个动作以后,太早相信事情已经按照预期发生。

真正成熟的安全意识,不是反复怀疑自己,而是拒绝过早相信现实。

这正是理解“对抗性完整”的一个生活化入口。

一、很多事故,都发生在“已经确认过”之后

人们通常认为,安全问题来自明显的故障、违规或者破坏。

门没有锁,是因为有人忘了锁;转账出错,是因为有人填错账号;系统执行危险操作,是因为权限管理失效;数据被删除,是因为攻击者绕过了防线。

但现实中的大量事故,并没有这么明显。

人确实按下了锁车键,车辆却因为信号干扰没有真正完成锁定;审批人确实点击了同意,但审批页面展示的摘要与最终执行内容并不完全一致;合同确实通过了审核,但正式发出的附件已经不是此前确认的版本。

从流程上看,每一步似乎都发生了。

有人提交,有人审批,有系统记录,有操作日志,权限也完全合法。问题不在于流程不存在,而在于流程中的某个对象、内容、条件或者结果已经发生变化,后面的环节却仍然沿用了前面的信任。

也就是说,人们检查过一件事,却没有继续检查这件事后来是否还是原来的样子。

很多严重错误,不是没有经过确认,而是确认过一次以后,所有人便默认它不会再变化。

锁车以后再拉一下车门,看起来是在重复确认,实际上检查的并不是同一个问题。

第一次确认的是:“我有没有按下锁车键?”

第二次确认的是:“车门现在到底有没有锁上?”

一个检查动作,一个检查结果。

一个确认系统接收了命令,一个确认现实已经发生了变化。

这两个问题看起来接近,实际上并不相同。

二、别人眼里的“多余”,往往只是换了一个角度

在低风险环境中,重复检查确实可能显得效率不高。

一条普通消息发错了,可以撤回;一个普通文件选错了,可以重新发送;一个普通设置改错了,可以恢复。在这些场景里,快速行动通常比反复核对更重要。

但当事情涉及资金、医疗、生产系统、重要数据或者不可逆操作时,判断标准会完全改变。

医院在手术开始前,要重新确认患者身份、手术部位和具体项目。飞机起飞前,机组人员会按照清单进行交叉检查。工业设备启动前,需要确认人员位置、环境状态和关键阀门。银行转账执行前,会再次展示收款人和金额。

外行第一次看到这些流程,可能会问:这些信息不是早就确认过了吗?

答案是,前面确实确认过。

但前面确认的是前面的状态,最后需要确认的是此刻即将发生的现实。

这些检查也并非简单重复。它们通常来自不同角色、不同系统、不同信息来源和不同观察角度。

一个人确认业务意图,另一个人确认实际对象;一个系统检查权限,另一个系统检查执行参数;前面的流程回答“是否允许”,最后的边界回答“当前条件下是否仍然应该发生”。

重复同一种检查,可能只是形式主义;从不同角度重新审视,才是真正的安全设计。

如果所有确认都依赖同一个界面、同一份数据和同一个系统,那么检查次数再多,也可能只是重复接受同一个错误。

例如,一个错误的收款地址被写进申请单,审批页面、财务系统和执行程序都从同一条记录中读取它。整个流程可能经过三个人确认,但三个人看到的都是同一个错误来源。

表面上,这是多重审核。

实际上,只是不同的人重复相信了同一个事实。

真正有效的确认,需要有不同的观察角度:申请内容与实际执行内容是否一致,审批对象与最终操作对象是否一致,系统记录与现实状态是否一致,权限合法与结果安全是否是同一件事。

对抗性完整关注的,正是这种“换一个角度再看一次”的能力。

三、为什么叫Adversarial Completeness

“对抗性完整”的正式英文是:

Adversarial Completeness

这里的两个词都很重要。

首先是Adversarial。

它不是单纯指系统可能自然出错,而是强调系统面对的是一种带有主动性的环境。有人可能故意制造误导,隐藏关键信息,替换执行对象,污染上下文,利用界面差异,或者诱导审批人做出错误判断。

普通错误是偶然发生。

对抗性环境中的错误,可能是有人故意让它发生,并且故意让它看起来没有发生。

因此,对抗性完整并不是在理想环境中检查流程是否合理,而是在假设某些参与者、信息来源或者中间环节可能不可信的情况下,重新审视系统是否仍然可靠。

其次是Completeness。

这里没有使用常见的Integrity,是因为两者关注的重点并不相同。

Integrity通常更容易让人联想到数据是否被修改、文件是否损坏、信息在传输中是否保持一致。它强调的是某个对象本身有没有被篡改。

Completeness强调的则是:我们对风险的考虑是否足够完整。

审批通过了,不代表执行对象没有变化;身份合法,不代表操作结果安全;签名正确,不代表签署内容符合原始意图;日志完整,也不代表这项操作本来就应该发生。

每一项单独看都可能正确,但如果系统只检查其中一项,就仍然可能留下能够被利用的缺口。

所以,“完整”不是指某份数据完整,而是指安全判断不能只覆盖一个局部。

它需要从意图、身份、对象、权限、参数、环境、过程、结果和证据等多个角度,检查一件事情是否仍然成立。

Adversarial Completeness不是证明某一个环节没有问题,而是确认那些可能被对手利用的关键角度,没有被遗漏。

这也是为什么用Completeness更准确。

它强调的不是“这个东西有没有被改”,而是“我们是不是少看了某个决定性的问题”。

四、对抗性完整到底在检查什么

用大白话解释,对抗性完整就是:

一件重要的事情,不能因为某一道检查通过,就默认整体安全,而要从不同角度确认,还有没有能够被利用的缺口。

这意味着,系统不能只问一个问题。

不能只问:“是谁发起的?”

还要问:“发起人真正想做的是什么?”

不能只问:“他有没有权限?”

还要问:“这次操作是否超出了具体授权范围?”

不能只问:“审批有没有通过?”

还要问:“审批人看到的内容,是否与最终执行内容一致?”

不能只问:“签名是否有效?”

还要问:“签名所对应的对象、金额、目标和条件是否仍然没有变化?”

不能只问:“日志是否存在?”

还要问:“日志能否证明当时看到的、批准的和最终执行的是同一件事?”

这些问题单独看都不复杂。

真正困难的是,很多系统只检查其中一个问题,然后把一个局部成立的结论,扩大成整体安全的证明。

身份正确,于是默认意图正确。

权限合法,于是默认结果安全。

审批通过,于是默认执行内容没有变化。

签名有效,于是默认签署对象值得信任。

这正是大量执行风险产生的原因。

局部正确不等于整体安全,流程完整也不等于风险覆盖完整。

对抗性完整要求系统继续追问:有没有另一个角度,可以推翻当前的安全结论?

如果攻击者不能伪造身份,他是否可以诱导合法身份做错事?

如果无法绕过审批,他是否可以操纵审批人看到的内容?

如果无法修改签名,他是否可以在签名前替换签署对象?

如果无法删除日志,他是否可以让日志完整记录一次错误执行?

这种思考方式看起来有些多疑,但它不是无边界的怀疑,而是面向真实攻击路径的系统性检查。

五、为什么这种做法经常被认为“神经质”

对抗性完整在组织内部并不总是受欢迎。

因为它会制造摩擦。

当所有人都急着推进项目时,有人要求重新核对执行对象;当审批已经完成时,有人仍然要求比较最终参数;当系统所有状态都显示正常时,有人还想确认底层实际状态。

这类人容易被评价为保守、拖慢效率、不够信任团队,甚至总是假设事情会出问题。

但安全工作的矛盾就在这里。

当风险尚未发生时,所有保护动作看起来都像额外成本;只有事故真正发生以后,人们才会意识到,之前被省掉的那一步并不是多余。

火灾发生之前,消防通道占用了经营面积;数据丢失之前,备份系统消耗了存储空间;生产事故发生之前,停机检查影响了效率;错误转账发生之前,二次确认增加了操作时间。

这些措施的价值,很难通过“今天创造了多少收入”来直接证明,因为它们成功的表现,恰恰是某件坏事没有发生。

边界在灾难发生之前叫成本,灾难发生之后才会被重新命名为必要。

所以,对抗性完整并不是一种性格上的过度谨慎。

它是一种把经验中的“不放心”转化为工程机制的能力。

它不要求每个人始终保持高度警觉,也不要求某位经验丰富的员工发现所有异常。它要求系统提前明确:哪些操作不可逆,哪些对象必须在最终执行前重新确认,哪些信息不能只来自一个来源,哪些变化必须重新审批,哪些条件不满足就必须停止。

换句话说,它把个人习惯中的谨慎,转化为组织能够稳定执行的制度。

六、AI时代,执行链条正在迅速变长

在传统软件时代,人通常还是最终操作的主体。

系统提供信息,人完成判断,然后点击按钮。即使软件出现错误,许多关键动作仍然需要人主动发起。

AI Agent的出现正在改变这一点。

AI不再只是回答问题、生成文字或者提供建议。它开始读取邮件、调用工具、编写代码、修改云资源、管理账户、生成交易,甚至根据环境变化连续完成一系列任务。

这意味着,从人的最初意图到现实结果之间,出现了一条更长、更复杂的执行链条。

一个人只说一句自然语言,模型需要先理解任务,再拆解计划,选择工具,读取外部信息,组合参数,申请权限,获得审批,最终执行。

每增加一个环节,就多了一次理解偏差、对象替换、上下文污染或者信息遗漏的可能。

更重要的是,AI并不会天然知道自己正在受到诱导。

一份文档中的恶意内容,可能被模型当成任务要求;一个网页中的隐藏指令,可能影响后续工具调用;一个错误的接口返回,可能被当成真实环境状态;一个经过包装的审批摘要,可能掩盖真正危险的执行参数。

在这种环境里,仅仅提高模型准确率是不够的。

因为企业最终承担后果的,不是模型曾经说过什么,而是系统最后做了什么。

AI时代最大的安全变化,不是机器开始思考,而是机器开始把判断直接兑现成现实。

过去,一次错误回答可能只需要重新生成。

未来,一次错误判断可能意味着资金转出、权限改变、数据删除、服务中断或者设备动作。

当错误从信息层进入执行层,对抗性完整就不再只是高级安全设计,而会逐渐成为AI系统的基础能力。

七、AI越智能,越容易让人过早放心

AI有一个特殊风险:它非常擅长制造“事情已经被理解”的感觉。

它能够生成完整的解释、清晰的计划、专业的摘要和看起来合理的理由。正因为表达过于完整,人们很容易把“解释得通”误认为“事情已经被完整验证”。

但语言上的完整,并不等于执行上的完整。

AI可以正确总结一项操作,却遗漏一个危险参数;可以生成合理计划,却在调用工具时选择错误对象;可以获得合法审批,却在审批后因为环境变化执行到另一项资源;可以完整保存日志,却把一次错误行动记录得非常清楚。

传统系统中的很多信任机制,在AI面前可能变得更加脆弱。

因为人容易被摘要说服,被自然语言解释安抚,被自动化流程降低警惕。

当系统告诉人们“风险已检查”“操作已批准”“目标已确认”时,人们很少继续追问:这些结论是否来自独立信息?检查者是否和执行者共享了同一个错误上下文?审批人看到的是否真的是即将执行的内容?

AI最危险的能力之一,不是制造错误,而是把错误解释得像一个合理决定。

因此,AI时代的对抗性完整必须特别强调独立验证。

不能让AI生成计划,再让同一个AI根据自己的计划判断计划是否安全;不能让系统生成摘要,再让审批人只依据摘要批准;不能只验证Agent的身份和权限,而忽略它实际准备执行的对象、参数和后果。

越是高风险的操作,越需要从AI之外获得新的判断角度。

八、对抗性完整不是不断增加审批

谈到多角度检查,很多人会立刻想到增加更多审批人、更多弹窗和更多确认按钮。

但这并不等于对抗性完整。

十个人在同一个界面上点击同意,不一定比一个人更安全。如果十个人看到的都是同一个被操纵的摘要,他们只是共同接受了同一个错误。

系统连续弹出五次“是否确认”,也不一定有意义。如果五次确认都没有增加新的信息,用户最终只会形成机械点击。

真正的对抗性完整,不是增加检查数量,而是增加判断维度。

审批人看到的是业务意图,执行层还要验证实际对象;模型提供操作建议,独立规则还要检查金额和边界;SaaS负责协调流程,最终执行层还要确认关键条件;日志记录过程,证据系统还要证明意图、审批与结果之间存在可靠关联。

检查次数不是安全,独立角度才是安全。

这也意味着,对抗性完整不能只存在于流程图里。

它必须落实为具体能力:对象绑定、参数绑定、上下文绑定、执行前复核、状态交叉验证、独立证据以及最终拒绝。

只要某个关键事实发生变化,系统就不能继续沿用旧的授权。

九、真正重要的是,最后一层能不能说“不”

对抗性完整最终不是为了让系统看到更多问题,而是为了让系统在发现问题时真正停下来。

如果最终检查发现执行对象已经变化,但系统仍然必须继续;如果参数已经超出审批范围,但执行层没有拒绝能力;如果关键证据无法验证,却只能记录日志而不能阻断,那么所谓检查仍然只是形式。

真正的安全边界必须拥有否决权。

它不一定负责理解全部业务,也不需要比AI更聪明。它只需要在少数明确的高风险条件下,能够拒绝执行。

例如,金额超过授权上限时拒绝,执行对象与审批对象不一致时拒绝,关键参数发生变化时拒绝,环境状态无法确认时拒绝,证据链不完整时拒绝。

这样的系统看起来可能不够聪明。

它不会生成漂亮的解释,也不会理解所有上下文,但它能够守住那些已经明确不能越过的边界。

最后一道边界不需要无所不知,但必须有能力拒绝无法证明安全的事情。

AI系统越能自主完成复杂任务,这种最终拒绝能力就越重要。

因为“擅长完成任务”与“适合承担最终风险”并不是同一件事。

一个系统越擅长推动事情向前,就越需要另一个独立机制,在必要时让它停下来。

十、对抗性完整不是让所有事情都变慢

有人可能会认为,如果每个关键节点都从不同角度检查,AI系统就会失去效率。

但这是一种误解。

对抗性完整并不要求所有操作都经过同样复杂的审查。

低风险、可撤销、影响有限的动作,可以快速自动完成。真正需要更强验证的,是那些影响重大、难以恢复或者可能被攻击者利用的执行。

整理文档与删除生产数据库,不应采用同样的控制强度;生成转账建议与正式发出资金,不应共享同样的执行边界;创建测试资源与修改核心权限,也不应依赖相同的确认机制。

成熟的系统,不是在所有地方增加阻力,而是把阻力放在后果最严重的位置。

安全设计的目标不是让每一步都变慢,而是让错误无法轻易跨过最后一步。

从长期看,这种设计反而能够提高组织效率。

因为它减少了事故后的回滚、调查、赔偿和信任损失,也降低了企业对少数经验人员的依赖。

系统不再要求每个人始终保持警觉,而是在关键节点自动提供新的判断角度。

十一、把“神经质”变成制度

生活中那些被认为过度谨慎的人,往往是在用个人习惯弥补系统缺失。

他们反复核对,是因为流程不会替他们核对;他们回头拉门,是因为按键动作不能直接证明现实结果;他们保存截图和记录,是因为事后很难证明当时到底发生了什么。

真正成熟的组织,不应把安全寄托在个人是否足够谨慎。

它应当把这种谨慎转化为设计。

哪些关键步骤必须从不同角度验证,哪些信息需要独立来源,哪些变化必须重新审批,哪些操作应该留下可验证证据,哪些条件不满足时必须停止执行,都应在系统运行之前确定。

这样一来,所谓“神经质”就不再是个人性格,而成为组织稳定运行的一部分。

对抗性完整,不是把每个人都变得多疑,而是把关键时刻的多疑变成制度。

它不是假设所有人都会作恶,也不是要求系统永远不犯错。

它只是承认,信息会变化,人会误判,系统会失效,AI会受到诱导,攻击者也会利用信任和惯性。

因此,在那些不可逆的地方,我们不能只问“前面有没有检查过”,还必须继续问:

现在执行的,还是最初被同意的那件事吗?

审批人看到的,与系统真正准备执行的内容一致吗?

当前身份、权限、对象、参数、环境和结果,是否同时成立?

我们是不是遗漏了某个能够被利用的角度?

结语

很多人理解安全,习惯寻找更聪明的模型、更复杂的规则和更准确的识别技术。

但在现实世界中,真正挡住事故的,往往不是一个无所不知的系统,而是一个看起来有些多余的动作。

再核对一次收款人,再拉一下车门,再比较一次最终参数,再从另一个系统确认一次现实状态。

这些动作不会创造直接收入,也不会让报表更加漂亮。

它们唯一的作用,是防止一个已经偏离原意的事情,被整个系统顺利、准确而高效地执行到底。

这就是Adversarial Completeness|对抗性完整所关心的问题。

它不是证明某个单独环节没有被破坏,而是确认系统没有遗漏那些能够被错误、欺骗和攻击利用的关键角度。

在AI只负责回答问题时,这可能只是一种高级安全理念。

当AI开始管理资金、代码、生产系统、数字资产和现实设备以后,它将成为所有执行系统必须面对的基础问题。

因为AI时代真正危险的,并不是机器偶尔说错一句话。

而是身份合法、权限有效、审批通过、签名正确、日志完整,所有流程看起来都没有问题,最后却把一件早已偏离原意的事情,不可逆地执行到了现实里。

对抗性完整的价值,不是让系统永远正确,而是确保那些决定性的问题,没有因为所有人都觉得“已经检查过”而被遗漏。

本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。如对本稿件有异议或投诉,请联系 tougao@huxiu.com。

本文来自虎嗅,原文链接:https://www.huxiu.com/article/4877247.html?f=wyxwapp

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
47岁汤唯宣布二胎产子:马上开始一家四口的旅行啦;2014年与韩国导演金泰勇结婚,女儿已10岁

47岁汤唯宣布二胎产子:马上开始一家四口的旅行啦;2014年与韩国导演金泰勇结婚,女儿已10岁

极目新闻
2026-07-22 17:46:37
跳水原因,找到了

跳水原因,找到了

中国基金报
2026-07-22 16:46:43
心理学有个极其冷血的结论:让所有人对你又敬又怕的,从来不是你的手腕,也不取决于你的城府,而是你不动声色吃透的这两层“恐惧根源”

心理学有个极其冷血的结论:让所有人对你又敬又怕的,从来不是你的手腕,也不取决于你的城府,而是你不动声色吃透的这两层“恐惧根源”

心理观察局
2026-07-21 07:09:14
破17.8亿!3天就超《功夫女足》夺全球冠军,北美又出了一部爆款

破17.8亿!3天就超《功夫女足》夺全球冠军,北美又出了一部爆款

靠谱电影君
2026-07-21 08:20:24
气人!越南航空柜员当众呵斥中国游客:不许说中文 赶紧滚一边去

气人!越南航空柜员当众呵斥中国游客:不许说中文 赶紧滚一边去

行者聊官
2026-07-22 11:44:06
太炸裂了!一大妈发帖炫耀儿子有貌有才,北美留学,家里有钱有房有车,结果被扒出儿子已成白人老头的“小娇夫”

太炸裂了!一大妈发帖炫耀儿子有貌有才,北美留学,家里有钱有房有车,结果被扒出儿子已成白人老头的“小娇夫”

火山詩话
2026-07-21 15:23:18
LV要起诉中国人民银行?全网爆火调侃,彻底戳穿奢侈品纹样真相

LV要起诉中国人民银行?全网爆火调侃,彻底戳穿奢侈品纹样真相

另子维爱读史
2026-07-22 20:07:47
曾琦医生7月号源,瞬间抢空!至7月30日专家号已全部约满,评论区炸锅

曾琦医生7月号源,瞬间抢空!至7月30日专家号已全部约满,评论区炸锅

火山詩话
2026-07-22 14:32:28
今年国家级气象站出现首个50℃!

今年国家级气象站出现首个50℃!

第一财经资讯
2026-07-22 14:13:36
英伟达GB300再破世界纪录!256块GPU跑DeepSeek-v3:算力提升50%

英伟达GB300再破世界纪录!256块GPU跑DeepSeek-v3:算力提升50%

快科技
2026-07-22 16:19:13
汽车真卖不动了!上半年国内汽车销量暴跌 20%,车市为何遇冷?

汽车真卖不动了!上半年国内汽车销量暴跌 20%,车市为何遇冷?

网易新闻出品
2026-07-22 16:23:35
王毅会见菲律宾外长拉扎罗

王毅会见菲律宾外长拉扎罗

新京报
2026-07-22 18:33:14
瘫痪4年的申军谊后半生才终于明白:有些债,一辈子都还不完

瘫痪4年的申军谊后半生才终于明白:有些债,一辈子都还不完

品茗赏娱
2026-07-22 10:10:18
中菲冲突第2天!菲律宾增兵,美国发声力挺,日本发现大事不妙

中菲冲突第2天!菲律宾增兵,美国发声力挺,日本发现大事不妙

混沌录
2026-07-22 18:23:07
武汉大学投档线崩盘,办学水平被江苏省质疑,网友:还有下跌空间

武汉大学投档线崩盘,办学水平被江苏省质疑,网友:还有下跌空间

娱乐E君
2026-07-22 15:30:05
张凌赫新剧《这一秒过火》遭官媒点名批评:犀利言辞,直戳剧方肺管子

张凌赫新剧《这一秒过火》遭官媒点名批评:犀利言辞,直戳剧方肺管子

八卦南风
2026-07-22 15:05:33
丰田官宣新车:9月3日,正式上市

丰田官宣新车:9月3日,正式上市

科技堡垒
2026-07-22 11:57:54
演员凯莉·霍特尔车祸去世,年仅19岁

演员凯莉·霍特尔车祸去世,年仅19岁

情感大头说说
2026-07-22 15:38:13
港媒曝CoCo猛料:曾冻卵想为谢贤生娃,欠巨债后,四哥卖大劳帮她

港媒曝CoCo猛料:曾冻卵想为谢贤生娃,欠巨债后,四哥卖大劳帮她

胡一舸南游y
2026-07-22 16:07:23
中国企业综合税负长期偏高,扶持个体工商户需持续减轻税费负担

中国企业综合税负长期偏高,扶持个体工商户需持续减轻税费负担

风向观察
2026-07-22 09:47:02
2026-07-23 00:59:00
虎嗅APP incentive-icons
虎嗅APP
个性化商业资讯与观点交流平台
26881文章数 687933关注度
往期回顾 全部

科技要闻

马斯克看笑了:谷歌什么都有 偏偏没最强AI

头条要闻

自驾新能源汽车跨境突然遭远程锁车30多小时 车主发声

头条要闻

自驾新能源汽车跨境突然遭远程锁车30多小时 车主发声

体育要闻

阿根廷的亚军:单核足球的极限?

娱乐要闻

47岁汤唯宣布二胎产子 大女儿10岁

财经要闻

宜家出售八城"蓝盒子" 30年大店逻辑生变

汽车要闻

智能舒适却依旧硬核 泰钽700仍是台与众不同的硬派SUV

态度原创

家居
旅游
亲子
本地
游戏

家居要闻

2026建博会(广州) 公装联探展交流活动

旅游要闻

27公里狂野自驾!清远长隆万兽奔腾,矿坑重生变世界级乐园

亲子要闻

先做买只炸毛蛋的好朋友还是先做丑蛋的家人?

本地新闻

杭州诗意路名,自带氛围感

国行PS5 Pro售罄!索尼自家商城都卖完了 至今无回应

无障碍浏览 进入关怀版