网易首页 > 网易号 > 正文 申请入驻

86.3%,突围CyberGym!超越OpenAI、Anthropic的竟是一家中国AI公司

0
分享至

机器之心发布


AI 会写代码早已不是新鲜事。

真正的难点在于,如何将 AI 置于陌生且庞杂的真实代码库中,使其扮演安全研究员的角色进行持续调查:剖析漏洞机理、追踪代码逻辑、编写触发输入、排除干扰项,最终交付一份经得起检验的 PoC。

最近,机器之心在 CyberGym 榜单上看到一个亮眼的成绩:在这项包含1507 项真实漏洞任务的测试中,深信服 Sangfor AI 依托纯国产基座模型(GLM-5.2) 完成了 1301 项,综合成功率达 86.3%,位列全球前四、国内参评团队首位。



但如果只把它理解成「国产模型又拿下了一个高分」,可能就低估了这次结果的技术意义。因为真正被验证的,不仅是模型对代码的阅读理解能力,更是一个安全 Agent 系统能否将分散的代码推理与工具调用,有机整合为可探索、可追溯、可验证、可交付的漏洞研究流程。

CyberGym 的这个评测,要求 AI 在庞杂的真实代码库中,独立完成可执行、可验证的漏洞复现。核心规则极为严格:引发崩溃,并不等于复现目标漏洞。

换言之,系统必须建立异常与指定缺陷之间的严密因果关系。这也是该榜单的含金量所在。它考核的不是 AI 能否拼凑出貌似合理的答案,而是能否完成一场受证据约束的深度漏洞研究。

在这样的要求下,深信服 Sangfor AI 完成了 1301 项,整体成功率达 86.3%。其中,ARVO 来源任务完成 1193 项(成功率 87.2%),OSS-Fuzz 来源任务完成 108 项(成功率 77.7%)。同台竞技的名单中不乏 OpenAI、Anthropic、Meta 等全球顶尖团队。

在统一的验证规则下,86.3% 的完成率释放了一个明确信号:以国产大模型为底座的安全 Agent 系统,已跻身全球第一梯队。

然而,比排名更具参考价值的是,深信服正通过一套专为安全研究打造的 Agent 系统,将模型能力转化为可落地的安全成果。

深信服为什么要用 Agent 做漏洞扫描和复现?

并不是因为「一个模型不够强,所以就多调用几个」,而是漏洞研究本身就不是一个「一次性问答」能够稳定承载的任务。

漏洞复现,本质上是一个持续消减不确定性的过程。

一段简短的漏洞描述往往对应多种解释;一段看似危险的代码,未必能从真实入口抵达;一个触发崩溃的输入,也未必命中了目标缺陷。真正的漏洞研究,需要不断假设、取证、实验并排除反例。

单个模型能做局部代码分析或生成候选 PoC。但在长链路探索中,冗长的对话上下文会带来明显的隐患:早期的误判容易固化为默认前提,失败的路径被反复试错,海量日志挤占了关键事实,且生成候选与自我审核由同一过程承担。

为了解决这些难题,Sangfor AI 设定了一套核心的「证据治理」机制:让模型可以大胆的提出假设,但系统必须谨慎的接受结论。

1. 先让「假设」充分展开,再让证据决定「假设」的去留

深信服采用 Agent Swarm 协同作战的价值在于 —— 保留多种独立的漏洞解释,而非让多个 Agent 对同一答案「投票」。

不同分支,分别跟进漏洞机理、代码路径和触发策略,并严守边界,避免未经证实的早期判断,演变为集体默认前提。这规避了安全研究中常见的锚定偏差 —— 防止推理围绕错误前提自洽,最终产出逻辑闭环但事实不成立的结论。

2. 共享的是证据状态,而不是完整对话历史

各个调查分支不需要互相转发长篇大论来同步信息。它们同步的,是那些经得起推敲的「硬证据」:比如代码里确认的事实、实际跑出来的运行结果、卡住程序的触发条件,以及哪些路子已经被证明走不通。这样一来,后面的分支接手的是「我们已经排查清除了什么」,而不是去看前一个 Agent 说了什么。

这其中有个特别关键的逻辑:失败的尝试绝不会被白白丢掉。

比如,某个字段变化无法影响崩溃、某条调用路径在真实入口下不可达、某种输入结构已经被证明无效 —— 这些看似没能通关的「负面结果」,其实是非常宝贵的研究资产。它们能直接帮系统砍掉错误的死胡同、收窄搜寻范围,避免重复踩坑。

毕竟在熟的安全研究流程里,能够排除一种解释,本身就是结果。

3. 动态编排:让不确定性持续收敛

多 Agent 协同,绝对不是越多越好,更不能把算力平均的撒给所有方向。

Agent 系统里有一个持续运转的「协调层」,它会根据动态演进的证据状态实时评估:哪些假设依然成立、哪些环节尚待补证、顺着哪条路径最有可能获取新突破,以及决定哪些分支应该暂停、合并或终止。

这意味着,每一次探索都必须接受一项硬性检验 —— 它是否实质性地缩小了搜索空间?

如果某个调查分支持续产生同质化的结论,但又无法带来新的证据,那么继续投入便毫无意义。真正有效的 Agent 编排,不是让系统「做更多」,而是让有限计算持续流向信息增益最高的路径。

4. 提出结论与审核结论必须分开

这是整套设计中最具安全行业特征的一环。分支生成的候选 PoC 不能直接采用,必须进入独立的对抗性评审,接受三个维度的严格审视:

  • 崩溃能否稳定复现?
  • 是否真正对应目标漏洞?
  • 是否存在更合理的解释?

未过审的候选会被退回,其暴露的反例与缺失条件将转化为下一轮的约束。

这套机制将安全领域的「默认不信任」原则延伸到了 Agent 自身:系统不会因结论来自内部而盲目信任,也不会把多方共识等同于事实。多个 Agent 意见一致仅代表形成共识,唯有经得起反例挑战的证据,方能沉淀为安全的最终结论。

因此,Sangfor AI 的多 Agent 架构绝非简单的概率堆叠或角色扮演,而是打通了一条从假设、证据、候选到裁决的严密链路:模型负责提供各种可能性,而 Agent 系统则通过证据裁定出真正的安全结论。

比全球前四更值得关注的,是安全 AI 正在换一套竞争规则

过去,行业讨论 AI 安全能力时,最常问的是:哪个模型更强?

现在,另一个问题正在变得同样重要:

怎样把模型能力组织成稳定、可验证、可审计的安全生产力?

Sangfor AI 全程固定使用 GLM-5.2,这也让此次成果更具研究价值。当底层模型提供相对统一的代码理解与推理能力时,最终的通关率完全取决于系统能否管理并行假设、沉淀有效证据、叫停无效探索,并在提交前严格剔除缺乏因果支撑的候选。

简而言之:模型决定了能力的上限,而 Agent 系统决定了多少上限能真正转化为成果。

当前,大多数的多 Agent 系统仍停留在简单的「角色分工」阶段。但在安全场景下,盲目增加 Agent 数量并不会带来更高的可信度。如果多个 Agent 共享同一个错误前提、陷入同质化推理,并通过内部投票自圆其说,放大的往往不是能力,而是错误。

而深信服的选择更贴近专业安全团队的技术直觉:

  • 不以输出数量衡量价值,而以结论能否被证明来衡量;
  • 不以 Agent 共识替代外部证据,而以对抗验证建立可信度;
  • 不让失败消失在上下文中,而是把失败转化为后续搜索约束;
  • 不追求每个分支都得到答案,而是追求整个系统持续减少不确定性。

安全领域从不缺风险提示,真正稀缺的是能够回答以下问题的系统:

  • 为什么是这个漏洞?
  • 证据来自哪里?
  • 哪些替代解释已经被排除?
  • 为什么这个 PoC 能区分漏洞版本与修复版本?
  • 最终结论是否经得起另一个研究者的质疑?

当 AI 开始真正进入漏洞研究,门槛已经不再是「能否给出答案」,而是「能否证明答案」。

从这个角度看,86.3% 不只是一张高分成绩单,它更像是一次系统级验证:国产大模型不仅能够承担复杂代码安全任务,也可以在严密的 Agent 架构下,组成一支具备假设管理、证据沉淀和独立裁决能力的自动化漏洞研究队。

这,才是 1301 个成功任务之外,更值得行业关注的部分。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
CBA三大资讯,广东引援新消息,北控主帅归队,王哲林明显减重!

CBA三大资讯,广东引援新消息,北控主帅归队,王哲林明显减重!

体坛小快灵
2026-10-06 09:49:36
马继华蒙圈了!本想借流量“毁掉”冠军林诗栋,自己却被扒了老底

马继华蒙圈了!本想借流量“毁掉”冠军林诗栋,自己却被扒了老底

翰飞观事
2026-10-06 09:26:25
出轨女子第二波聊天记录曝光,虎狼之词惊呆吃瓜网友,她嫌丢人开始批量投诉了

出轨女子第二波聊天记录曝光,虎狼之词惊呆吃瓜网友,她嫌丢人开始批量投诉了

汉史趣闻
2026-09-01 17:55:01
已确认报案!“逼空姐下跪”的欧某某,这次真踢到铁板了!

已确认报案!“逼空姐下跪”的欧某某,这次真踢到铁板了!

脆皮先生
2026-10-05 19:38:06
日本63年来最猛一届亚运,83金突破纪录,可与中国的差距却更大了

日本63年来最猛一届亚运,83金突破纪录,可与中国的差距却更大了

林雁飞
2026-10-05 18:07:46
港影:谁想看“六十岁的警察,追着五十岁的土匪枪战”?

港影:谁想看“六十岁的警察,追着五十岁的土匪枪战”?

唐泪
2026-10-03 16:47:19
4-1!奥利塞10分钟造3球,1.8亿超巨拯救齐达内,法国主场大逆转

4-1!奥利塞10分钟造3球,1.8亿超巨拯救齐达内,法国主场大逆转

我的护球最独特
2026-10-06 04:46:40
“看似丰盛,其实毫无蛋白质!”中学女儿营养餐,给人看无语了

“看似丰盛,其实毫无蛋白质!”中学女儿营养餐,给人看无语了

熙熙说教
2026-09-25 14:31:02
中网史诗翻盘!6届大满贯冠军斯瓦泰克2-1逆转奥运亚军 晋级16强

中网史诗翻盘!6届大满贯冠军斯瓦泰克2-1逆转奥运亚军 晋级16强

醉卧浮生
2026-10-05 13:52:05
数据显示,超15%的中青年夫妻处于“干婚”状态,68%的中年人拥有固定深交的异性网友

数据显示,超15%的中青年夫妻处于“干婚”状态,68%的中年人拥有固定深交的异性网友

舒山有鹿
2026-07-25 09:57:20
逼空姐下跪的乘客姓欧,博士身份被扒,网友感慨高学历为何如此行事

逼空姐下跪的乘客姓欧,博士身份被扒,网友感慨高学历为何如此行事

秋风妃
2026-10-05 09:43:43
国人存款大势已定!若一切正常,明后年居民储蓄或要变天

国人存款大势已定!若一切正常,明后年居民储蓄或要变天

说故事的阿袭
2026-10-06 01:21:15
英超零首发,哲凯赖什延续欧国联进球纪录

英超零首发,哲凯赖什延续欧国联进球纪录

懂球帝
2026-10-06 05:03:12
领先卢拉200万票+,巴西大选进入第二轮,民调扑街

领先卢拉200万票+,巴西大选进入第二轮,民调扑街

移光幻影
2026-10-05 18:01:49
又一部口碑神作诞生,刚上映被打出9.4的高分!

又一部口碑神作诞生,刚上映被打出9.4的高分!

热荐电影
2026-10-05 22:09:44
堵了快30年的“堵王”高速,终于动大手术!

堵了快30年的“堵王”高速,终于动大手术!

荷兰豆爱健康
2026-10-06 00:39:45
缅北四大家族之首白家--白应苍临刑前画面曝光 回顾白家最后时刻

缅北四大家族之首白家--白应苍临刑前画面曝光 回顾白家最后时刻

杭城村叔
2026-10-05 15:59:48
“穷人”的人脉有多离谱?网友:我爸托人,给找了个夜班快递分拣

“穷人”的人脉有多离谱?网友:我爸托人,给找了个夜班快递分拣

另子维爱读史
2026-10-04 21:22:12
悲剧!中国游客在马来西亚邦邦岛浮潜后死亡

悲剧!中国游客在马来西亚邦邦岛浮潜后死亡

亚太观澜
2026-10-05 20:29:49
记者:申花没要求吴曦、朱辰杰立刻归队,给他们短暂假期调整

记者:申花没要求吴曦、朱辰杰立刻归队,给他们短暂假期调整

懂球帝
2026-10-05 19:52:06
2026-10-06 10:52:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14123文章数 142744关注度
往期回顾 全部

科技要闻

光遗传学是什么,为什么这项发现如此重要

头条要闻

中方放弃谈判果断抓捕"佤邦联合军"副总司令 画面披露

头条要闻

中方放弃谈判果断抓捕"佤邦联合军"副总司令 画面披露

体育要闻

30天30队·热:扬尼斯、阿德巴约与克雷

娱乐要闻

蔡康永回应漏洞百出,太平轮旧事被扒

财经要闻

杨植麟断腕:Kimi的至暗时刻与远征

汽车要闻

依旧宝马味儿 BMW智能驾驶辅助竟然“尊重”驾驶者?

态度原创

家居
亲子
健康
数码
房产

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

盘点骗你生女儿系列,小棉袄,心快融化了!

刷酸祛痘,为什么有人翻车?

数码要闻

苹果macOS 27.2测试触控手势代码,为触屏MacBook铺路

房产要闻

保利大爆发,冲到榜一!海南楼市前三季度,热销榜出炉!

无障碍浏览 进入关怀版