![]()
“内部测试?不,我要去‘外面的世界’看看。”
“任务第一,规则?那只是用来绕过的。”
这可不是科幻电影的台词。就在上个月,OpenAI的一款大模型在内部测试时“失控出逃”——自主发现漏洞、规划路径,成功入侵了全球知名AI开源平台Hugging Face。
国家安全部近日发文提醒:当AI展现出“自作主张”的能力,AI安全问题必须认真对待。更值得深思的是,事后测试方使用美国主流AI模型根本无法处理恶意载荷,最终不得不转用中国的开源模型完成溯源分析。
当AI开始“自作主张”,谁来为它划定边界?
这个问题的紧迫性,在另一条赛道上得到了更加量化的回答——近期,由加州大学伯克利分校提出的国际公认安全权威榜单CyberGym公布了最新排名。作为评估AI智能体真实漏洞挖掘能力的顶级实战化测试,CyberGym被Anthropic、DeepSeek、微软、Wiz等全球巨头视为AI安全能力的标尺。榜单上,一个来自中国的团队排在了全球第三——DoGNAVY。
DoGNAVY由国内顶尖人工智能研究机构与申城安全团队达酷诺威(DARKNAVY)联合研发,在1507道题中通过率达到90.8%,只比第二名少对了一道。排在前面的,是微软和谷歌;在其身后包括OpenAI、Anthropic等国际顶级企业。
![]()
一场AI漏洞挖掘能力的”实战化大考”
CyberGym,并非一场知识问答考试,而更像是把一个人扔进一个完全陌生的软件项目——面对几千个文件、上百万行代码,只告诉他“这里有个问题”,然后要求他自行理解并当场演示出来。
1507项任务,来自188个真实开源项目中曾经存在、后来得到修复的漏洞。这是目前规模最大的AI Agent网络安全基准,Anthropic、DeepSeek、微软、Wiz等全球巨头均以此作为AI安全能力的权威标尺。
为防止AI“背答案”,测试上了几道“锁”:DoGNAVY没有使用任何CyberGym专属知识;跨任务记忆全程关闭——做完一道题就忘掉,下一道从零开始;参考答案和其他可能泄露线索的材料在系统启动前就被清理干净。
1507项任务,一项一项从零开始。最终,DoGNAVY通过了1369道。
从“闭源拼装”到“开放路线”
看清榜单上的对手,更能理解90.8%这个数字的含金量。
排在第一的微软MDASH(92.0%),其技术源头可追溯至曾获2025年美国国防部人工智能网络挑战赛(DARPA AIxCC)冠军的Team Atlanta,微软CEO萨提亚·纳德拉(Satya Nadella)将MDASH视为该公司网安能力的标志性成果;第二名Atlas(90.9%)由Wiz联合谷歌DeepMind共同研制;第六名为OpenAI的GPT-5.5-Cyber(85.6%);第九名为Anthropic的Claude Mythos Preview(83.1%)。
一张榜单,几乎凑齐了全球最顶尖的AI公司!
前两名用了同样的路数:多个闭源顶级模型“拼装作战”。用Wiz自己的说法,Atlas会把每个环节路由给在这项任务上表现最好的模型。这条路线足够强大,但有个前提——你得同时买得到、也用得起全世界最强的那几个闭源模型。而对国内团队来说,这不仅意味着成本,更意味着可获得性与自主性的挑战——部分国际领先模型并未正式向中国市场开放服务。
DoGNAVY选择了另一条路。它只用了一款基础模型——智谱在6月开源的GLM-5.2,一个任何人都能从Hugging Face上下载、自由部署的通用模型。
![]()
来源:东方IC
AgentDoG:给AI智能体戴上“诊断项圈”
DoGNAVY的背后,是一套完整的技术体系。从Agent基础设施到安全研究工作流,均由国内联合团队共同完成。其中,顶尖安全团队达酷诺威将长期服务众多领军企业所积累的一线经验转化为专业安全能力;国内顶尖人工智能研究机构则通过名为AgentDoG的安全架构,提供了核心的智能体运行与诊断能力。
为什么需要AgentDoG?因为AI智能体的风险,早已不是“说错话”那么简单。一个能够操作文件、调用API、访问网络的Agent,可能因为一条隐藏在网页中的恶意指令泄露隐私文件,可能因错误理解工具参数造成经济损失,甚至可能“悄无声息”地偏离正轨、执行危险动作。
现有的安全工具只能给出“安全/不安全”的简单判断,无法告知风险根源。AgentDoG的不同之处在于,它不仅能精准判断Agent行为的安全性,更能诊断风险来源、追溯失效模式、解释决策动因。
训练AI安全模型通常很“烧钱”——需要海量数据和巨大算力。AgentDoG团队换了一种思路:先用一套智能筛选机制,从海量数据中只挑出最关键的千余样本,再通过数据净化技术去掉“杂音”。最终,一个参数量仅为通用大模型千分之一的小模型,在复杂风险识别任务中达到了78.4%的准确率——与顶级大模型不相上下。
让AI像安全专家一样思考
复制一个顶级安全研究员,关键不在于“复制知识”,而在于“复制工作方式”。CyberGym考验的正是Agent的长时间探索、验证、纠偏、改进能力。
对此,DoGNAVY将顶尖安全研究员的工作方式及决策逻辑内化为Agent工作流;通过从程序入口还原调用链与数据约束,判断真实输入能否触发漏洞;同时将真实研究中实践有效的工具赋予Agent,让静态分析提出路径与约束,动态验证以覆盖率、崩溃与运行时证据加以校验。
更重要的是,DoGNAVY为AI构建了严格的沙箱环境,保证其在隔离环境中执行指定任务,避免重蹈OpenAI和Anthropic的覆辙。
从这个角度看,DoGNAVY的成绩并不只取决于基础模型。它来自模型能力、系统工程与专业安全经验的共同作用——基础模型决定AI能思考多深,安全框架决定AI能把研究推进多远,而顶级安全研究员的经验则决定AI安全研究应该往哪里走。
榜单之外,真实世界没有标准答案
CyberGym提供了统一的题目和评分标准。但真实世界不会提前告诉你漏洞在哪里,甚至不知道是否存在答案。
此前达酷诺威公开过其AI安全分析系统deepsec分析的微软Edge浏览器Pwn2Own漏洞利用链的过程:面对超过300MB的目标模块和约3.2万个发生变化的函数,AI完成了从浏览器漏洞到Windows远程代码执行的多阶段路径还原。在另一个无人机攻防案例中,分析对象从软件延伸到了软硬件系统,AI最终对某知名品牌无人机实现了完全控制的攻击演示。
浏览器案例回答的是“读不读得懂”——AI能不能理解一个庞大的软件系统和一条复杂的多阶段漏洞链。无人机案例回答的则是“够不够得着”——AI能否跨越数字边界,将软件缺陷转化为物理世界里的一次失控。
当攻击按小时提速,防御不能再按年增长
AI正在同时改写软件开发和网络攻防。
过去,一个高危漏洞从被发现到形成可用攻击能力,往往需要专业研究员投入数周甚至数月。如今,这部分工作正在被压缩到数小时内。当攻击的门槛和成本一路走低,防御就不能继续只依赖少数顶级专家。
全球第三、中国第一,只是一个坐标。它真正说明的是:以国内机构的AI研究能力、开源大模型与一线真实攻防经验,已经能够形成有效协作,处理最难、最大规模的专业安全任务。这一成绩指向的,不只是一次技术验证,更是让顶尖安全攻防能力不再只局限于少数区域和机构,而能被更多创新者获得、使用并共同建设——让更多中国创新拥有AI安全力量。
原标题:《当AI自作主张,谁来纠偏?全球AI安全实战化大考,中国开源方案跻身前三!》
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.