网易首页 > 网易号 > 正文 申请入驻

当AI开始“自作主张”,谁来为智能体戴上“项圈”?全球AI安全实战化大考,中国方案打入前三

0
分享至

2026年7月,OpenAI一款大模型在内部测试中“失控出逃”——自主发现漏洞、规划路径,成功入侵Hugging Face平台。该模型为获得更高评分,主动利用此前未知的零日漏洞突破沙箱,侵入存储测试答案的数据库,全程由AI自主完成。事后测试方发现,美国主流AI模型无法处理恶意载荷,最终转用中国开源模型完成溯源分析。

这一事件将AI智能体的行为安全与运行时控制问题推至前台。而在更具量化性的国际安全测评中,问题的紧迫性同样得到了验证。

CyberGym:面向真实漏洞挖掘的实战化基准

近期,加州大学伯克利分校发布的国际安全权威榜单CyberGym公布了最新排名。该基准以1507项来自188个真实开源项目的历史已修复漏洞为任务,测试AI智能体从零开始自主挖掘、验证并利用漏洞的能力,被Anthropic、DeepSeek、微软、Wiz等视为AI安全能力的关键标尺。



8月5日,国际公认安全权威榜单CyberGym公布了最新排名,来自中国的团队DoGNAVY获得全球第三、开源第一的成绩。

DoGNAVY:开源路线下的全球第三、中国第一

由国内顶尖人工智能研究机构(上海)与安全团队达酷诺威(DARKNAVY)联合研发的DoGNAVY,在此次测评中通过1369道题(通过率90.8%),排名全球第三,仅次于微软MDASH(92.0%)和Wiz×Google DeepMind的Atlas(90.9%),并超越OpenAI GPT-5.5-Cyber(85.6%)与Anthropic Claude Mythos(83.1%)。

一张榜单,几乎凑齐了全球最顶尖的AI公司。前两名用了同样的路数:多个闭源顶级模型”拼装作战”。用Wiz自己的说法,Atlas会把每个环节路由给在这项任务上表现最好的模型。这条路线足够强大,但有个前提——你得同时买得到、也用得起全世界最强的那几个闭源模型。而对国内团队来说,这不仅意味着成本,更意味着可获得性与自主性的挑战。部分国际领先模型并未正式向中国市场开放服务。DoGNAVY选择了另一条路。它只用了一款基础模型——智谱在6月开源的GLM-5.2,一个任何人都能从Hugging Face上下载、自由部署的通用模型。



DoGNAVY让AI像安全专家一样思考

复制一个顶级安全研究员,关键不在于“复制知识”,而在于“复制工作方式”。CyberGym考验的正是Agent的长时间探索、验证、纠偏、改进能力。对此,DoGNAVY将顶尖安全研究员的工作方式及决策逻辑内化为Agent工作流;通过从程序入口还原调用链与数据约束,判断真实输入能否触发漏洞;同时将真实研究中实践有效的工具赋予Agent,让静态分析提出路径与约束,动态验证以覆盖率、崩溃与运行时证据加以校验。

工作流与自决策

DoGNAVY 通过结构化工作流将开放式漏洞验证分解为输入输出明确的研究活动,在关键决策点设置检查条件。模型仍负责选择分析路径、形成假设和决定行动,但工作流保持目标、记录结论并限制无效发散。系统允许在证据冲突时撤销错误前提并回溯重分析,避免在错误假设上累积工作。

漏洞可达性分析

真实项目需从实际入口出发,满足解析、状态与数据约束后方可到达目标代码。DoGNAVY将漏洞描述与代码结构关联,逐步恢复从外部输入到缺陷位置的调用链与数据约束,重点关注输入如何被解析、转换和传递,以及哪些条件决定路径可达。对大型代码库,系统通过索引化理解缩小搜索范围,并组织已确认的入口、路径、约束及未解决问题为可持续更新的任务状态。当静态结论不足时,保留不确定性并转入动态验证,而非将“未找到”等同于“不存在”。

动静结合分析

DoGNAVY将静态分析与动态探索置于统一反馈循环:静态分析生成可解释的漏洞路径与输入约束,动态分析验证可达性、观测运行时行为并反馈结果。动态反馈(如覆盖率、错误位置、崩溃稳定性)指导下一轮静态修正或输入构造;静态约束则缩小动态搜索范围。该闭环持续提供外部证据,降低纯语言推理在复杂控制流和二进制输入上的累积误差。动态验证始终以真实入口和运行条件为边界,只有可重复的目标相关行为才被采纳为最终 PoC,排除非目标崩溃或环境异常。

知识库与记忆

DoGNAVY内置面向多平台(Android、iOS、HarmonyOS、IoT)的通用安全研究经验,描述可迁移的漏洞分析方法和约束,而非特定目标答案。本次 CyberGym 实验未加载任何数据集相关任务、漏洞编号、历史 PoC 或补丁信息,仅保留常见漏洞分析与验证经验,以检验泛化能力。同时,跨任务记忆关闭,每个任务独立执行,结果不注入后续任务;但单任务内持续沉淀已确认的代码路径、约束、尝试与反馈,经组织压缩后保留关键决策信息,缓解长上下文注意力稀释。隔离跨任务记忆虽牺牲持续学习优势,但更能客观反映系统泛化能力,并减少对数据集的适应性偏差。

AgentDoG:给AI智能体戴上“诊断项圈”

DoGNAVY的背后,是一套完整的技术体系。从Agent基础设施到安全研究工作流,均由国内联合团队共同完成。其中,顶尖安全团队达酷诺威将长期服务众多领军企业所积累的一线经验转化为专业安全能力;国内顶尖人工智能研究机构则通过名为AgentDoG(https://github.com/AI45Lab/AgentDoG)的安全架构,提供了核心的智能体运行与诊断能力。

为什么需要AgentDoG?因为AI智能体的风险,早已不是”说错话”那么简单。一个能够操作文件、调用API、访问网络的Agent,可能因为一条隐藏在网页中的恶意指令泄露隐私文件,可能因错误理解工具参数造成经济损失,甚至可能”悄无声息”地偏离正轨、执行危险动作。

现有的安全工具只能给出”安全/不安全”的简单判断,无法告知风险根源。AgentDoG的不同之处在于,它不仅能精准判断Agent行为的安全性,更能诊断风险来源、追溯失效模式、解释决策动因。

训练AI安全模型通常很“烧钱”——需要海量数据和巨大算力。AgentDoG团队换了一种思路:先用一套智能筛选机制,从海量数据中只挑出最关键的千余样本,再通过数据净化技术去掉“杂音”。最终,一个参数量仅为通用大模型千分之一的小模型,在复杂风险识别任务中达到了78.4%的准确率——与顶级大模型不相上下。



当攻击按小时提速,防御不能再按年增长

AI正在同时改写软件开发和网络攻防。过去,一个高危漏洞从被发现到形成可用攻击能力,往往需要专业研究员投入数周甚至数月。如今,这部分工作正在被压缩到数小时内。当攻击的门槛和成本一路走低,防御就不能继续只依赖少数顶级专家。

全球第三、中国第一,只是一个坐标。它真正说明的是:以国内机构的AI研究能力、开源大模型与一线真实攻防经验,已经能够形成有效协作,处理最难、最大规模的专业安全任务。这一成绩指向的,不只是一次技术验证,更是让顶尖安全攻防能力不再只局限于少数区域和机构,而能被更多创新者获得、使用并共同建设——让更多中国创新拥有AI安全力量。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
1982 年,飞行员黄植诚和马红成婚,8 年后她借出国名义在美国失联。安保人员搜查住所,卧室内查获的物件让人震惊

1982 年,飞行员黄植诚和马红成婚,8 年后她借出国名义在美国失联。安保人员搜查住所,卧室内查获的物件让人震惊

磊子讲史
2026-07-15 12:02:40
“亿万富婆”王薇薇:76岁看起来像40岁,年过七旬身边追求者不断

“亿万富婆”王薇薇:76岁看起来像40岁,年过七旬身边追求者不断

白宸侃片
2026-08-11 15:22:46
“好标准的一脸苦相!”三姐妹和妈妈合照,看着就觉得命苦!

“好标准的一脸苦相!”三姐妹和妈妈合照,看着就觉得命苦!

世界圈
2026-07-30 08:40:29
2026事业单位档案倒查来了,这次动真格!

2026事业单位档案倒查来了,这次动真格!

职场资深秘书
2026-08-11 11:18:30
业绩大超预期,加仓了!

业绩大超预期,加仓了!

君临财富
2026-08-11 16:28:06
伊朗最高领袖任命革命卫队总司令

伊朗最高领袖任命革命卫队总司令

财联社
2026-08-11 00:23:09
“反美斗士”被戴上“紧箍咒”了?

“反美斗士”被戴上“紧箍咒”了?

读鬼笔记
2026-08-11 13:46:04
黄一鸣自曝:王思聪每次约她,车费都给10万,来给5万,回再给5万

黄一鸣自曝:王思聪每次约她,车费都给10万,来给5万,回再给5万

汉史趣闻
2025-06-24 10:07:59
大S的遗产,戳破了多少“富婆假象”

大S的遗产,戳破了多少“富婆假象”

许三岁
2026-07-13 09:17:16
渤海正在被悄悄填平?5 个新加坡没了,京津防线还能稳吗?

渤海正在被悄悄填平?5 个新加坡没了,京津防线还能稳吗?

抽象派大师
2026-08-09 13:50:06
广东省原省长朱森林同志逝世

广东省原省长朱森林同志逝世

极目新闻
2026-08-11 08:45:19
原来非油炸是这个意思,网友:果然中华文化,博大精深

原来非油炸是这个意思,网友:果然中华文化,博大精深

马蹄烫嘴说美食
2026-07-30 15:21:33
程梦圆找到了!知情人曝更多细节,从二道崖跌崖200米,让人心痛

程梦圆找到了!知情人曝更多细节,从二道崖跌崖200米,让人心痛

记录生活日常阿蜴
2026-08-11 15:48:55
中国男篮重大调整,郭士强淘汰三人引争议,胡明轩有望再成队长

中国男篮重大调整,郭士强淘汰三人引争议,胡明轩有望再成队长

宗介说体育
2026-08-11 14:07:26
日订单5000万、年入2267亿,滴滴为什么还在亏钱?

日订单5000万、年入2267亿,滴滴为什么还在亏钱?

罗sir财话
2026-08-11 13:06:12
王仕鹏婉拒陈老板!小陈总引援不力,外援本土一个没签,宏远新赛季躺平?

王仕鹏婉拒陈老板!小陈总引援不力,外援本土一个没签,宏远新赛季躺平?

体坛卡卡说
2026-08-11 16:03:06
“韩杰医生案”,是整个医疗行业的寒蝉之始

“韩杰医生案”,是整个医疗行业的寒蝉之始

医脉圈
2026-08-11 22:21:44
江苏十大民营企业排名

江苏十大民营企业排名

坠入二次元的海洋
2026-08-11 01:55:51
易烊千玺凭借《小小的我》获得第38届百花奖最佳男主角,卫诗雅凭借《破·地狱》拿下最佳女主角奖

易烊千玺凭借《小小的我》获得第38届百花奖最佳男主角,卫诗雅凭借《破·地狱》拿下最佳女主角奖

极目新闻
2026-08-10 21:35:37
你看,我就说国家控糖战略是个笑话

你看,我就说国家控糖战略是个笑话

熊太行
2026-08-09 10:54:01
2026-08-11 23:43:00
量子位 incentive-icons
量子位
追踪人工智能动态
13129文章数 176533关注度
往期回顾 全部

科技要闻

AI大战变天:扎克伯格突然回头

头条要闻

网红"雅典娜"失踪3年 好友:她被李姓女网友诱骗至境外

头条要闻

网红"雅典娜"失踪3年 好友:她被李姓女网友诱骗至境外

体育要闻

NBA老顽童,抽着大麻喝着小酒告别了

娱乐要闻

“雅典娜”确认被害 细节令人发指!

财经要闻

AI泡沫的剧本,是2008年的次贷危机?

汽车要闻

闪充/天神之眼B/云辇-C 2027款海豹06售9.99万元起

态度原创

健康
数码
教育
时尚
旅游

心血管专家破解猝死八大谣言

数码要闻

内存涨疯了!卢伟冰:大家一定会感觉REDMI K100 Pro越来越香

教育要闻

被港三取代的几所英国大学!

裙子穿浅少穿深,准备好这几款白裙子,清丽高级又不挑人

旅游要闻

受暴雨影响,八达岭长城景区8月12日起暂停开放

无障碍浏览 进入关怀版