网易首页 > 网易号 > 正文 申请入驻

NVIDIA全新“开放智能体安全平台,给AI立个“新规矩”

0
分享至


上世纪90年代,互联网快速兴起,在带来无限可能的同时,也催生了病毒肆虐、信息安全隐患等一系列新问题。随后,SSL加密和浏览器沙盒机制在此后十余年间逐步落地,互联网由此搭建起基础的“信任层”,此后延续近三十年的电商与数字经济,很大程度都建立在这层"信任"之上。

今天,AI的演进下,面临着相似的问题。

如今的大模型已经超越了“你问我答”的交互模式。Agent(AI Agents)可以在企业内网持续运行数周,自主调用API、访问工具,甚至根据任务生成新的子Agent。

于是,安全问题也随之发生变化。过去的安全机制主要围绕相对固定的程序和用户操作建立,通过权限控制、身份认证和网络隔离限制软件的行为。但对于能够持续执行任务、不断调用外部工具,并根据执行结果调整下一步行动的Agent,这些机制无法匹配不断变化的行动链。

比如,在2026年7月11日至13日间,约700个由OpenAI在内部基准测试中运行的Agent,攻破了Hugging Face的生产环境,整个过程约执行了17600次操作,历时约两天半。

面对前赴后继的安全隐患,9月28日,NVIDIA正式发布NVIDIA Open Agent Safety Platform(开放智能体安全平台)。该平台贯穿应用、运行时和基础设施三层,覆盖Agent从测试到部署的完整生命周期。

这套路径与当前常见的AI安全方案有所不同。现有的手段大多从模型层入手,通过提示词、模型对齐等方式约束AI的行为,让模型遵循预设规则。但是,NVIDIA则把安全控制延伸到模型之外,一方面用数学验证明确Agent可以执行哪些操作,另一方面借助DPU将安全监控与实际执行隔离开来。

01 AI Agent的系统性风险:目标漂移、自我条件化、分解攻击

要理解NVIDIA为什么从底层重做安全,先要知道传统方法的问题出在哪里。

过去,业界保障模型安全,主要依赖“模型对齐”(Model Alignment)。通过监督微调(SFT)、RLHF等方法,调整模型生成下一个Token时的概率分布,让模型更倾向于给出符合安全规则的回答。

这种方法改变的是模型输出的概率,并没有从根本上规定模型“不能做什么”。面对同一个问题,模型依然可能在不同条件下给出不同结果,因此安全约束本质上仍是概率性的。

而且,这种对齐往往停留在模型输出的表层。Qi在ICLR 2025发表的研究成果显示,对齐模型与基座模型之间的KL散度,基本集中在生成结果最开始的几个Token。这意味着,模型只是生成了拒绝前缀,后续内容与基座模型并没有发生同等程度的变化。这一现象被称为“浅层安全对齐”。


对齐模型与基座模型的逐token KL散度,差异集中在输出开头。

来源:Qi et al.,ICLR 2025

在纯对话场景中,模型的幻觉一般只停留在文本输出上。但当AI开始执行连续任务,这种幻觉就会随着执行次数不断累积。

比方说,一个Agent每一步的准确率都是99%,连续执行100步的情况下,其每一步都正确的概率就只有约37%,执行1000步则降到万分之一以下。Sinha研究发现,模型看到自己此前的错误后,后续继续出错的概率会进一步上升,这种现象被研究者称为“自我条件化”(Self-Conditioning)。

另一类问题产生于任务执行阶段。在长周期红蓝对抗实验中,该现象被定义为漂移(Drift)。当指令语义存在歧义、工具模块发生故障,或是连续上千次尝试均无法达成目标时,Agent将持续调整执行策略,逐步偏离预设的执行路径。

背后的核心矛盾,是Agent将完成目标作为首要导向。既定方案无法生效时,它会不断寻找其他可行路径。只要系统边界存在空白,搜索行为就持续延展,实现对限制条件的规避。

更难防范的是,这类规避行为不是一次完成的。一项任务可以拆分成多个看起来毫无风险的子任务,分步交给Agent执行,甚至分派给不同的Agent。单独来看,每一条指令都合乎规范,但在所有操作叠加之后就会暴露风险。

纽约大学和洛桑联邦理工学院的研究团队在2025年发布的研究论文中把这种现象成为“分解攻击”(Decomposition Attack)。研究发现,将一个有害目标拆成多个看似无害的子任务后,模型的拒绝率会明显下降。例如,GPT-4o对原始任务的拒绝率为50%,拆分后降至10%。


恶意任务被拆分成多个看似无害的子任务,从而绕过模型的单步拒绝机制

来源:Chen et al.,2025

这也是传统沙盒机制很难处理的问题。

比方说,以Firecracker为代表的微型虚拟机与容器,隔离边界划定在单个进程或者实例层面。其虽然能够管控程序访问文件、调用接口的权限,却无法读懂多个Agent之间的任务拆分逻辑,更无法预判多段看似正常的操作合并后,会不会达成错误的目标。

看到这里,其实问题已经很清晰了,如果只依靠模型层面的安全对齐,无法阻止Agent跨越“安全防线”,但是仅保护单个沙盒,也识别不了跨任务、跨Agent的“分解攻击”。

行业需要一套独立于模型的外部机制,持续审查、约束Agent的每一项操作。

02 NVIDIA OpenShell构建Agent外部护栏

既然约束必须来自模型外部,接下来的问题就是,外部护栏如何判断Agent的动作是否越界?现在业界主流做法是“用大模型做裁判”(LLM-as-a-judge),即再部署一个模型,专门审查Agent的行为。

然而,“裁判”本身作为Agent,依然存在概率出错的现象。于是,NVIDIA选择了另一条路:用确定性逻辑为判断提供依据,而不是只依赖概率判断。承载这一思路的,是本次发布的OpenShell 0.1.0(OpenShell最早于今年3月推出)。

OpenShell是基于Apache 2.0协议的开源安全运行机制(Secure Runtime),位于Agent的“大脑”(模型)与企业资源(文件、API、凭证、网络)之间。Agent对资源的每一次访问,都要经过其中转。

正因为处在这个中转位置,OpenShell可以在Agent“动手”之前做出判断。与“大模型裁判”不同,其判断不依赖个模型的推理,而是依靠形式化方法(Formal Methods),即用数学逻辑严格证明逻辑性质是否成立。


OpenShell Gateway可管理多个Agent沙盒,每个沙盒外的Supervisor把外发通信限制在已配置的服务范围内,包括模型API、数据与记忆、远程MCP服务器

截取自:NVIDIA 开发者社区

负责判断的核心组件是Policy Prover(策略证明器)。该技术本身并不是新技术,AWS早年就用形式化验证工具Zelkova检查S3存储桶的安全策略;但NVIDIA把该技术引入了动态变化的Agent执行路径中。

具体来看,Policy Prover可以在Agent运行之前检查配置策略,计算出这条策略实际授予Agent的全部权限。

在具体场景中,OpenShell(当前版本 0.1.0)可以做三件事:隔离、拦截、凭证保护

第一,内核级的隔离与出栈控制。OpenShell利用Gateway(网关)可统一管理Agent的生命周期和策略,并为每个Agent配备独立的Sandbox(沙盒)和一个Supervisor(监督器)。沙盒借助操作系统的内核级控制,限定Agent的读写范围,并禁止其提升权限。同时,沙盒不能直接联网,Agent发出的每个网络请求都要先经过监督器。

第二,拦截操作细化到API级别。由于所有请求都要经过监督器,OpenShell的控制比传统网络安全更深入。一般来看,传统方案只能决定Agent能否连接GitHub,OpenShell的监督器则能解析HTTP、GraphQL和模型上下文协议(MCP)的流量,识别每个请求具体要做什么。

因此,在同一个API端口,监督器可以放行读取(Read)请求,同时拦截写入(Write)请求。即使Agent打开shell、运行自己生成的代码,或者把任务交给子Agent,这些限制依然有效。

凭证保护。我们知道,Agent需要调用私有服务,就必须使用API密钥(KEY),而密钥一旦交到Agent手里,就可能被泄露。OpenShell的做法是只给Agent一个假密钥(Placeholder key),真实密钥始终保存在沙盒之外。Agent发出请求后,监督器先核对网络策略和凭证绑定策略,两项都通过,才把假密钥替换成真实的API Key,并把请求发往获准访问的地址。而如果Agent把假密钥发往其他地址,请求会被直接拒绝。Agent从头到尾都拿不到真实密钥,自然也就无法出现泄露的情况。


Agent发出的请求只携带占位符。Supervisor核验网络策略和凭证绑定后,在工作负载之外将占位符替换为真实密钥,再转发给获授权的服务。

截取自:NVIDIA技术博客

03 Sentry+BlueField-4:监控移出主机,实现物理隔离

OpenShell是一道软件防线,而软件防线的可靠性取决于承载它运行的主机。随着Agent获得越来越高的系统权限,新问题随之出现:如果运行Agent的主机被攻破,或者CPU发生内核级崩溃,OpenShell就可能随之失效。

NVIDIA Sentry要解决的正是这个问题,它把防御从软件延伸到了物理硬件。

NVIDIA Sentry是Open Agent Safety Platform参考设计中的硬件监控组件,本质上是一个运行于BlueField-4 DPU的带外看门狗(Watchdog)。它独立于Agent所在的主机,持续监控Agent的行为,并直接在硬件中执行安全策略。Sentry目前仍属于参考设计,在企业部署中是一个可选的附加层:不使用Sentry,企业也可以单独使用OpenShell。

这种设计借用了自动驾驶汽车架构中的“安全岛”(Safety Island)概念,把安全策略的执行从主机CPU移出,交给独立的数据处理器(DPU)。

具体来看,OpenShell及其管理的Agent沙盒运行于NVIDIA专为Agentic AI打造的Vera CPU。

Vera CPU旁边旁路部署一块BlueField-4 DPU,Sentry就运行在这块DPU中,并通过DOCA软件框架与OpenShell的策略联动。整个平台针对Vera CPU和BlueField DPU做了优化,同时兼容其他硬件;OpenShell作为开源项目,还可以扩展到Arm和Intel平台。


Open Agent Safety Platform参考设计:OpenShell运行时在Vera CPU上编排Agent沙盒和策略;Sentry运行于BlueField-4 DPU,在独立硬件中跟踪并管控Agent活动。

截取自:NVIDIA技术博客

Sentry之所以部署在DPU,是由DPU在系统中的位置决定的。在Vera Rubin POD中,BlueField-4位于每个节点通往模型的唯一路径。Agent每推进一步都要调用模型,因此所有模型调用都会经过Sentry。同时,DPU与主机相互隔离,Sentry处在一个完全独立于Agent运行环境的“带外”(Out-of-band)信任域。

另外,对于已经部署了配备BlueField-4的Vera系统的企业,启用这层防护只需进行软件更新。

可以这样理解,Agent是在房间里干活的工人,Sentry站在房间外,隔着单向玻璃观察。工人不知道自己被监视,也接触不到玻璃外的任何设备。


Vera Rubin NVL72机架,包含18个计算托盘和9个NVLink交换托盘。每个计算托盘配有两颗Vera Rubin超级芯片、8块ConnectX-9 SuperNIC和1块BlueField-4 DPU。

截取自:NVIDIA技术博客

这样一来,Sentry可以检查Agent发出的请求和收到的响应,核验Agent的身份,并对数据、工具、API和服务执行零信任访问策略。例如,在安全红蓝对抗测试中,一旦某个测试Agent开始尝试突破已批准的目标边界,也就是出现了漂移,Sentry可以在毫秒内,在网络层隔离(Quarantine)或终止这个Agent正在执行的任务。

综合看,整个平台形成了两层防御(Defense-in-depth):OpenShell在软件层制定并执行规则,Sentry在硬件层独立监控。

04 “120+”机构共建Agent时代的行业“信任层”

一套安全方案只有被模型厂商、企业和硬件厂商共同采用,才能成为行业的“信任层”。一因此,NVIDIA把这套平台命名为Open Agent Safety Platform,并以开放的方式推进。

在组织层面,该平台服务于Open Secure AI Alliance的工作。该联盟由NVIDIA于今年7月牵头成立,目前成员已超过120家,并于9月正式转入Linux基金会治理。

在各方如何分工上,NVIDIA借鉴了云计算的"共同责任模型"(Shared Responsibility Model)。在云时代,云厂商负责基础设施安全,客户负责应用安全。到了Agent时代,模型开发者、企业用户和底层硬件提供商也各自负责一部分。

按照这一分工,目前与该平台技术合作的100多家机构覆盖了四个层面。


前沿模型公司: 模型公司离Agent最近,Agent的决策由其的模型驱动。Anthropic的Claude Managed Agents本身就把Agent的决策循环放在独立的服务器上运行,与执行任务的沙盒分开;OpenShell和BlueField的集成则在沙盒一侧增加访问控制。SpaceXAI把这一平台用于Cursor编程Agent和Grok模型。

企业服务与云平台: 对企业来说,难点在于Agent运行中临时需要新权限时,由谁审批、在哪里审批。Salesforce已将OpenShell与Slack打通:Agent申请提升权限时,员工可以直接在Slack中批准或拒绝,实现人类监督(Human-in-the-loop)。Scale AI把相关技术用于其Scale GenAI Portfolio背后的Agent基础设施,SAP、Palantir等企业也已参与。

物理AI(Robotics): 机器人在物理世界中的动作往往是无法撤回的,一次越界就可能造成实际损失。Figure、Gecko Robotics和Skild AI等具身智能企业,正在用OpenShell为自主决策的机器人设定行为边界。

基础设施:Red Hat等操作系统厂商,以及Cisco、Dell、HPE等硬件厂商,也在采用该平台,推动相关技术进入下一代AI数据中心。

05 写在最后

过去几年,业界处理 AI 安全的思路大体可以概括为一道“教育题”:喂数据、数据对齐,指望模型在关键时刻学会说 “不”。但Agentic AI 把这套逻辑推翻了.一个能写代码、能调工具的系统,不能只靠”自觉来 约束。

NVIDIA Open Agent Safety Platform,就在于其把问题抬到了系统层:验证把控权限、沙盒与监督器把管理动作,DPU 在主机之外另设一道独立防线。软件与硬件两层互为冗余,任意一层失守,另一层仍在。再加上模型厂商、企业、硬件厂商可以在同一套规则上分工协作,Agent 安全这才具备了可共建的公共底座。

当然,这条路并没有走完,跨Agent的权限验证仍在攻关。但方向已经清楚了:Agent安全的重心,正在从模型本身转向整个系统。

互联网花了十几年才建起自己的信任层,这次轮到了Agent。而NVIDIA,就是想让这个领域,少走几年弯路。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
排名从1054升到51,普利斯科娃退出中网:说实话我不太想去中国

排名从1054升到51,普利斯科娃退出中网:说实话我不太想去中国

竞技风云录
2026-09-29 17:49:36
人民日报:40岁以后,体重决定了你的寿命

人民日报:40岁以后,体重决定了你的寿命

洞见
2026-09-27 19:44:44
现货黄金突破4160美元/盎司

现货黄金突破4160美元/盎司

证券时报
2026-09-29 20:27:12
为什么Meta的AI助手会成“安全隐患生成器”?

为什么Meta的AI助手会成“安全隐患生成器”?

小眼睛小世界
2026-09-29 04:24:18
美媒:若西方助乌克兰战胜俄罗斯,同时震慑住中国,可让中方出钱

美媒:若西方助乌克兰战胜俄罗斯,同时震慑住中国,可让中方出钱

一路荒凉如歌a
2026-09-29 04:34:46
不查不知道,一查吓一跳!身为日乒一哥的张本智和,学历到底多高

不查不知道,一查吓一跳!身为日乒一哥的张本智和,学历到底多高

幽棠的趣式
2026-09-28 16:55:57
大开眼界!许家印当年奢靡生活曝光

大开眼界!许家印当年奢靡生活曝光

麦杰逊
2026-08-23 15:09:25
卖淫新套路曝光!5种隐蔽模式,第3种让人防不胜防

卖淫新套路曝光!5种隐蔽模式,第3种让人防不胜防

小鹿姐姐情感说
2026-09-29 06:23:52
恭喜,它登顶「全球第一神剧」,我心服口服

恭喜,它登顶「全球第一神剧」,我心服口服

独立鱼
2026-09-28 22:58:29
李亚鹏:房东已将房租降了相当的比例,感谢,嫣然医院可能还需要再坚持几年;7月嫣然医院完成了约206台手术,创下了建院以来纪录

李亚鹏:房东已将房租降了相当的比例,感谢,嫣然医院可能还需要再坚持几年;7月嫣然医院完成了约206台手术,创下了建院以来纪录

台州交通广播
2026-09-29 09:53:41
金价大局已定?要是不出意外,2027年起黄金价格可能迎来3大变化

金价大局已定?要是不出意外,2027年起黄金价格可能迎来3大变化

晨光苏醒a
2026-09-29 15:56:29
听到王毅划下的两条红线,日方代表对高市早苗,发出一句忠告

听到王毅划下的两条红线,日方代表对高市早苗,发出一句忠告

一口娱乐
2026-09-29 13:47:41
想不通啊!港一年硕士可同台考编:三年国内读研是不是吃亏?广东网友发帖追问,引发轩然大波

想不通啊!港一年硕士可同台考编:三年国内读研是不是吃亏?广东网友发帖追问,引发轩然大波

火山詩话
2026-09-29 11:32:37
国家外汇管理局:截至6月末,我国银行业对外金融资产21443亿美元,对外负债14726亿美元

国家外汇管理局:截至6月末,我国银行业对外金融资产21443亿美元,对外负债14726亿美元

界面新闻
2026-09-29 16:35:45
92米62!23岁斯里兰卡标枪手一年连夺四冠

92米62!23岁斯里兰卡标枪手一年连夺四冠

温柔且自由
2026-09-29 17:47:09
媒体人:女足还在踢90年代足球,世界女足的发展和中国没关系

媒体人:女足还在踢90年代足球,世界女足的发展和中国没关系

懂球帝
2026-09-29 16:17:22
官方通报:那英演唱会片段化演唱《弯弯的月亮》,不属于变更节目重新报批的情形

官方通报:那英演唱会片段化演唱《弯弯的月亮》,不属于变更节目重新报批的情形

蓬勃新闻
2026-09-29 13:59:29
正午阳光最烂的十部电视剧,高开低走,没有一部能坚持看完的

正午阳光最烂的十部电视剧,高开低走,没有一部能坚持看完的

小Q侃电影
2026-09-29 10:53:34
深圳骗局升级!全国女性被精准收割,有人损失超50万,报警也没用

深圳骗局升级!全国女性被精准收割,有人损失超50万,报警也没用

再来一杯冰美式
2026-09-28 14:52:01
老了肌肉流失怎么办?医生:2样东西必须吃,2件事做得越早越好

老了肌肉流失怎么办?医生:2样东西必须吃,2件事做得越早越好

健康之光
2026-09-28 19:00:12
2026-09-30 00:16:49
至顶科技 incentive-icons
至顶科技
科技产业媒体与 AI 产业服务机构
22255文章数 49732关注度
往期回顾 全部

科技要闻

82亿美元收购!李飞飞将与苏姿丰并肩做AI

头条要闻

老人在景观桥上被虎头蜂蜇伤离世 家属:无人愿意担责

头条要闻

老人在景观桥上被虎头蜂蜇伤离世 家属:无人愿意担责

体育要闻

石雨豪:亚运金牌与背后的十年

娱乐要闻

赌王四房婚礼,何超琼带三房成员现身

财经要闻

央行调整完善若干货币政策工具

汽车要闻

搭华为乾崑ADS 5/设计风格换新 2027款纵横G700售30.49万起

态度原创

亲子
本地
艺术
旅游
健康

亲子要闻

工程车小故事 :分西瓜

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

艺术要闻

962.7万!吴冠中画的“新居”,原来是房东家!

旅游要闻

俄景点女游客蹦极前害怕反悔,被工作人员一把推下,女子丈夫忙着拍视频

洗脸越勤,痘痘反而越多?

无障碍浏览 进入关怀版