网易首页 > 网易号 > 正文 申请入驻

Ethiack与美国圣母大学联合研究揭示真实世界评估难题

0
分享至


这项由葡萄牙网络安全公司Ethiack与美国圣母大学联合开展的研究,以预印本形式发布于2026年7月,论文编号为arXiv:2605.10834v2,有兴趣深入了解的读者可通过该编号在arXiv平台查询完整论文。

说起渗透测试,很多人可能感到陌生。简单说,渗透测试就是雇佣一批"职业黑客",让他们在获得授权的情况下,像真正的攻击者一样尝试入侵某家公司的系统,从而找出安全漏洞,帮助企业在真实攻击发生之前修补它们。这件事历来依赖经验丰富的安全专家,费时费力,成本高昂。近年来,人工智能技术突飞猛进,一批AI渗透测试系统应运而生,宣称能自主发现系统漏洞。然而问题随之而来:我们怎么知道这些AI究竟好不好用?考核它们的"试卷",是否真的能反映现实战场的复杂程度?

这项研究的核心动机,恰恰就是回答这个棘手的问题。研究团队发现,当前对AI渗透测试系统的评测,大多停留在一种叫做"夺旗赛"(Capture The Flag)的竞技模式里——就好比考察一名厨师,只要求他炒出一道指定菜肴,却从不关心他能否独立设计菜单、应对复杂宴席。这种考核方式固然方便打分,却与真实工作场景相去甚远。研究团队因此提出了一套全新的评估框架,试图让"考题"真正贴近现实,让测试成绩真正能预测系统在真实网络攻防中的表现。

一、现有考题为何不够用

要理解这项研究的价值,首先得弄清现有评估方法的局限性在哪里。

现有的AI渗透测试评估方法,大体可以分成三类。第一类最为常见,就是前面提到的夺旗赛模式。研究人员在一个封闭环境里预先藏好一个"旗帜"(通常是一段特殊字符串),然后让AI去找。找到了就算成功,找不到就算失败。这种方式的好处是打分极为简单,但它的问题也很明显——真实的渗透测试根本不是"只有一个正确答案"的填空题。现实中的系统往往存在几十甚至上百个安全漏洞,分布在不同的功能模块、不同的攻击面上,测试人员需要像侦探一样四处摸排,而不是奔向一个预定终点。

第二类评估方法稍微进步了一些,例如有研究团队设计了要求AI实现远程代码执行的场景,或者引入了干扰项、多步骤攻击链等元素,让测试环境更接近真实系统。但这些方法的本质仍然是单一目标——AI只需要完成一件预定任务,而不需要在一片"漏洞密林"中自主判断从哪里入手、优先处理哪些威胁。第三类方法则借助真实公开漏洞(CVE)来构建测试场景,虽然漏洞本身是真实的,但每个目标依旧只对应一个预设攻击路径,没有给AI留下真正开放性的探索空间。

更重要的是,现有评估方法几乎无一例外地将评分视为一次性任务,忽视了几个在现实中至关重要的因素:AI系统是随机性的,同一个AI在不同时刻运行可能得出截然不同的结果;渗透测试在现实中往往是反复进行、持续积累的,而非一锤定音;运行成本和时间效率同样是选择工具时的关键考量。这些被忽略的维度,导致实验室里评分漂亮的系统,到了真实业务环境中可能表现平平。

二、新的评估框架是如何设计的

研究团队提出的新框架,核心理念是把评估的焦点从"完成了没有"转向"发现了什么漏洞、发现得准不准、发现得全不全"。这就好比从考察一名侦探"有没有抓到指定嫌疑人",转变为评估他"在整个案发现场找到了多少有效线索,找错了多少,还有多少遗漏"。

整个框架建立在四根支柱之上。第一,测试目标必须足够复杂,包含多个漏洞、多种攻击面,要求AI真正具备探索、规划和策略决策的能力。第二,用一套结构化的流程把AI的发现与预先整理的漏洞清单进行语义层面的比对,而不是要求字面上的精确匹配。第三,把漏洞清单视为一个持续更新的"活文件",而非一次性的标准答案。第四,通过多次重复运行来应对AI系统天然的随机性,并且既评估单次表现,也评估多次累积的综合效果。

具体操作上,评估分为三个步骤,像三道关卡一样依次把控质量。第一关是建立"标准答案"文件:研究人员对每个测试目标,预先整理出所有已知漏洞的档案,每条记录包含漏洞名称、类别、描述和补充信息。这份档案也同时划定了评估范围,比如只关注高危漏洞,或者只关注某几类攻击方式。

第二关是语义匹配:AI系统完成测试后,会输出一份"发现报告",列出它认为存在的安全问题。评估系统使用另一个AI(充当"评判官")来逐一比对AI的发现与标准答案中的每条记录,判断两者描述的是否同一个漏洞。这里有一个很重要的设计细节——允许一对多匹配,也就是说,AI的一条发现可以同时被认为"可能对应"标准答案中的好几条记录。这种宽松设计是有意为之,因为AI的描述方式和标准答案的描述方式可能大相径庭,强行要求精确匹配会冤枉很多正确答案。

第三关是二分图解析(Bipartite Resolution)。经过第二关之后,会出现这样的情况:一个AI发现可能对应多条标准答案,多个AI发现可能对应同一条标准答案。这时候就需要一个数学工具来做最终裁决。研究团队采用了一种叫做"匈牙利算法"的经典方法,它能够在所有可能的配对方案中找出最优的一对一匹配结果,确保每条标准漏洞最多只被计一次,同时避免AI重复报告同一漏洞却被当作多次成功发现。

三、如何给AI的表现打分

有了这套配对机制,打分就变得有依据了。评估框架借鉴了信息检索领域常用的几个指标,但把它们迁移到了安全测试场景中。

准确率衡量的是AI报告的问题中有多少是真实漏洞,就好比一个侦探报告了十个可疑点,其中有几个真的与案件有关。召回率衡量的是AI找到了多少比例的已知漏洞,就好比案发现场一共有二十个线索,侦探发现了其中几个。综合这两个维度的F1分数和更侧重准确率的F0.5分数,则提供了平衡视角。重复发现计数专门记录AI重复上报同一个漏洞的次数,这在实际使用中非常有价值,因为大量重复报告会淹没真正有价值的发现,让安全团队疲于应付噪音。

严重性得分是另一个特色指标。每条已知漏洞都有一个行业通用的CVSS评分,反映其危险程度。研究团队将这个分数转化为积分制:评分在0.1到3.9的低危漏洞值3分,4.0到6.9的中危漏洞值15分,7.0到8.9的高危漏洞值30分,9.0到10.0的严重漏洞值50分。AI发现了哪些漏洞,就累加对应的分数。这个设计体现了一种实用主义逻辑:发现一个可能导致系统完全沦陷的严重漏洞,价值远超发现十个无关痛痒的小问题。

CWE覆盖率则反映AI发现的漏洞种类有多广,CWE是业界对软件弱点类型的标准化分类体系。一个优秀的渗透测试工具应该能识别多种不同类型的安全问题,而不只是擅长找某一类漏洞。

在这套评分体系之上,研究团队还特别强调了"标准答案"必须持续维护。这是因为真实系统中的漏洞永远无法被完全穷举,当AI报告了一个标准答案里没有的漏洞时,有可能不是AI犯了错,而是最初整理标准答案的人遗漏了这个漏洞。因此,安全专家应当定期审查AI报告中未被匹配的发现,验证其是否为真实漏洞,并在确认后将其补充进标准答案文件。随着这个循环不断进行,标准答案会越来越完整,评分也会越来越公正。

四、如何应对AI系统天生的"随机性"

这是整个框架中最容易被忽略、却又至关重要的一个设计考量。AI渗透测试系统本质上依赖大型语言模型,而语言模型的输出天然存在随机波动,即使面对完全相同的目标,不同时刻的运行结果也可能差异显著。打个比方,同一个侦探在不同状态下调查同一个案件,可能会注意到不同的细节,得出不同的结论。

正因如此,单次测试结果根本无法代表一个AI系统的真实水平。研究团队建议对每个测试场景进行多次重复运行,并且同时汇报每次运行成绩的平均值和标准差,后者反映了系统表现的稳定程度。

在统计比较两个系统时,研究团队推荐使用Welch's t检验,这是一种不要求两组数据方差相等的统计方法,非常适合AI系统这种可能高度不稳定的场景。然而,当重复次数较少时,统计检验的威力会大幅下降——即使两个系统的表现差异很大,也可能因为数据量不足而无法达到统计显著性。这就好比你只抛了三次硬币,即使全部正面朝上,也很难据此下结论说这枚硬币有问题。

因此,研究团队建议同时报告Cohen's d这个效应量指标。Cohen's d衡量的是两个系统性能差异的"绝对量级",与样本量无关。一般来说,d大于0.8就被认为是"大效应",意味着差异在实际使用中非常显著。将统计p值和Cohen's d结合起来看,即使在只有少量重复实验的情况下,也能对两个系统的差异做出更全面的判断——p值告诉你差异是否足够可靠,Cohen's d告诉你差异是否足够重要。

五、累积评估为何不可缺少

除了关注单次运行表现,研究团队还特别设计了累积评估维度,这是整个框架中最具现实意义的创新之一。

在真实的网络安全工作中,渗透测试往往不是做一次就结束。安全团队可能每隔几个月就对同一个系统做一轮测试,发现的问题修复之后,再做下一轮。AI的随机性在这里反而成了一种优势:不同时刻的运行可能会探索不同的路径,发现不同的漏洞,累积下来的发现总量可能远超任何单次运行。

累积评估的方法很直观:把多次运行的所有发现合并在一起,去除重复项,然后整体打分。通过对比单次平均成绩与多次累积成绩,可以观察到几个重要的现象。有些系统在单次运行中表现平平,但多次累积后召回率大幅提升,说明它的"随机探索"具有很强的互补性,适合反复使用。有些系统则恰恰相反,多次累积后准确率急剧下降,因为它每次运行都会产生大量重复的误报,噪音越积越多,反而让结果越来越难用。

还有一个特别值得关注的现象:研究团队发现,通过分析每次运行中被多次发现的漏洞与仅在某次特定运行中被发现的漏洞的比例,可以判断系统的"随机探索质量"。如果一个AI每次都能找到大量新漏洞,说明它的随机性是有价值的多样性;如果每次都在重复发现同样的东西,说明它的随机性不过是低效的抖动。

六、效率同样是不可忽视的维度

研究团队还明确将运行效率纳入评估框架,这在学术研究中颇为少见,但在实际部署中极为重要。

一个能发现二十个漏洞、但要花三天时间、耗费数千美元API费用的系统,和一个发现十八个漏洞、只需两小时、花费几十美元的系统,对用户来说价值截然不同。评估框架要求记录每次运行的总耗时和总费用,并且鼓励追踪"漏洞发现随时间的累积曲线"——也就是说,不只看最终发现了多少,还要看这些发现是在运行早期密集出现,还是均匀分布,抑或是绝大多数出现在运行末期。如果发现曲线在运行前半段就已趋于平缓,意味着后续的大量计算资源投入并没有带来多少额外收益,可以考虑缩短运行时间来降低成本。

此外,框架还提供了一种数据驱动的方法来精简测试套件。在进行迭代开发、消融实验或小规模改进时,对全套测试目标做完整评估往往代价高昂。研究团队建议利用历史评估数据,在有限预算约束下,筛选出一个与完整套件评分结论高度一致的小型子集。筛选标准以Pearson相关系数为主,Spearman相关系数为辅,确保子集不仅能正确排列系统的相对优劣,还能保留性能差异的实际量级。但研究团队也特别提醒,这类精简子集只能作为日常快速验证的代理,不能取代周期性的完整评估。

七、用三款真实AI系统验证这套框架

理论固然重要,但这套框架能否真正工作?研究团队用实际实验给出了回答。

他们选择了三款代表性的AI渗透测试系统:开源的Strix和PentAGI,以及Anthropic公司的通用智能编程助手Claude Code。每款系统分别配合四种大型语言模型后端运行:Claude Sonnet 4.6、GPT-5.4、DeepSeek v3.1以及Qwen 3.6 Plus。测试目标选取了三个开源的存在漏洞的应用程序,其中vuln-bank包含60个已知漏洞,paygoat包含28个,xben-090包含20个,三个目标合计108个经安全研究员精心标注的漏洞。每种系统与模型的组合都在每个目标上重复运行三次,以捕捉随机性带来的波动。

在正式评估之前,研究团队首先验证了AI评判官自身的可靠性。他们从实验中筛选出50个案例,其中25个经人工确认为真实漏洞,25个为误报,然后让四款不同的AI分别扮演评判官,与人工结论对比。结果显示,GPT-4.5 Mini和Gemini 3 Flash表现最为可靠,前者在三次重复测试中平均只误判约一个案例,因此被选定为正式评判官。

正式评估的结果揭示了许多仅凭夺旗赛评分无法发现的信息。Claude Code在F1综合分数、漏洞发现总量和运行效率上均表现最佳,同时CWE覆盖率最广,说明它能识别最多种类的安全问题。然而Claude Code也产生了相当数量的重复发现,且准确率(81.24%)在高报量的情况下意味着会产生大量误报,在大规模部署中可能给安全团队带来噪音负担。

PentAGI与Claude Sonnet搭配时发现了最高严重性得分的漏洞,但代价是最高的运行费用、最长的扫描时间,以及最多的误报数量。Strix的策略则相反,它产生的误报数量最少,输出结果最为"干净",但代价是漏洞发现总量也最少,召回率偏低。

在累积评估中,这些差异变得更加戏剧化。Strix与Claude Sonnet的组合在三次累积后召回率几乎翻倍,而准确率保持相对稳定,最终在累积F0.5分数上超越了所有其他配置,成为"多轮评估"场景下的最佳选择。PentAGI与Claude Sonnet的组合则出现了一个反直觉的现象:累积后的F1分数低于三次单次运行的平均分数,因为每次运行都产生了大量新的误报,累积越多、噪音越大、准确率越低。

各个独立目标的表现也揭示了截然不同的侧面。xben-090虽然仅包含20个漏洞,却成了最严苛的精准度压力测试,几乎所有系统在这个目标上都产生了大比例的误报。vuln-bank凭借60个漏洞的规模,成为测试覆盖广度的理想场所,即使表现最优秀的系统在单次运行中也只能覆盖其中的部分漏洞。paygoat则有一个特别有趣的现象:三次累积后,各系统之间的性能差距明显收窄,一些在单次运行中差距悬殊的系统在累积模式下表现趋于相近。

时间维度上的追踪同样提供了洞察。以Claude Code为例,在vuln-bank目标上,三次独立运行的漏洞发现曲线都呈现出近乎线性的稳定增长,说明它在整个运行周期内保持着稳定的探索节奏。而在paygoat目标上,某次运行的误报在后半段急剧累积,即使此时真实漏洞发现已趋于饱和,说明该次运行陷入了低效的"过度探索"状态,是一个缩短运行时间、减少不必要消耗的信号。

从统计对比来看,claude-code-sonnet在F1上比strix-sonnet高出16.79个百分点,p值为0.0141,Cohen's d达到3.504,这是一个既统计显著又实际意义重大的差距。pentagi-sonnet与strix-sonnet的比较则体现了精确率与召回率之间的经典取舍:前者的召回率高出17.28个百分点,但准确率低了25.70个百分点,两个指标的效应量几乎对称,说明这两个系统本质上代表了截然不同的策略选择,而非简单的优劣之分。

归根结底,这项研究的价值在于它指出了一件听起来简单却长期被忽视的事:评估AI渗透测试系统的方式本身,就是这个领域能否健康发展的关键。一套不够真实的考题,会让错误的系统脱颖而出,让正确的系统默默无闻。而当AI安全工具被部署在金融、医疗等真正关乎社会稳定的基础设施上时,评估方法的失误代价将不再只是学术上的遗憾,而可能是实实在在的安全漏洞。

研究团队已将专家标注的漏洞地面真值数据集和评估框架代码全部开放,任何研究者或实践者都可以在此基础上进一步探索。研究的局限性也值得坦诚面对:团队没有提出新的测试目标集合,实验中也没有尝试带跨轮记忆的连续评估场景,安全方面的行为评估(例如AI是否会避免执行破坏性操作)也尚未纳入框架。这些都是下一步工作的清晰方向。

对普通人而言,这项研究提醒我们:下次看到某个AI安全工具声称在某项测试中取得了多少高分,不妨多问一句——这个测试题,真的是真实世界的题目吗?

Q&A

Q1:AI渗透测试评估框架的"二分图解析"是什么意思,为什么需要它?

A:在评估AI渗透测试系统时,AI的一个发现可能对应多条已知漏洞,多个发现也可能对应同一条漏洞。为了避免重复计分,研究团队引入了数学上的二分图最优匹配方法(使用匈牙利算法),确保每条已知漏洞最多只被成功计一次,每个AI发现也只能匹配一条漏洞,从而得到可靠的真实阳性计数,防止重复报告虚抬成绩。

Q2:为什么单次测试不足以评估AI渗透测试系统的水平?

A:AI渗透测试系统依赖大型语言模型,其输出天然存在随机波动,同一系统在不同时刻面对相同目标可能产生差异显著的结果。单次测试只是众多可能结果中的一个快照,无法反映系统的平均水平和稳定性。研究团队建议多次重复运行,汇报均值与标准差,并同时使用Welch's t检验和Cohen's d效应量,以便在样本量有限的情况下也能对系统差异做出较为全面的判断。

Q3:累积评估和单次评估有什么本质区别,为什么累积评估更接近真实使用场景?

A:单次评估衡量一次运行能发现多少漏洞,而累积评估将多次独立运行的发现合并去重后统一打分,模拟安全团队对同一系统反复进行渗透测试的真实工作模式。由于不同次运行可能探索不同路径,累积发现总量往往超过单次最优表现,能更真实地反映AI工具在持续使用中的价值。但研究也发现,对于每次都产生大量误报的系统,累积反而会导致噪音越积越多,综合评分下降,这是选择工具时不可忽视的实际风险。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
英特尔前CEO深度反思:十年没买一台光刻机,却花了1000亿美金回购股票!持续15年让财务人掌舵,错过iPhone芯片和移动时代!

英特尔前CEO深度反思:十年没买一台光刻机,却花了1000亿美金回购股票!持续15年让财务人掌舵,错过iPhone芯片和移动时代!

投资者内参
2026-07-27 09:41:29
新落马的这个大学校长,头衔够多的

新落马的这个大学校长,头衔够多的

老张侃诗词
2026-07-28 14:03:29
深夜重大利好!中际旭创回购,最多80亿元 寒武纪推500万股股票激励,85%的员工都有

深夜重大利好!中际旭创回购,最多80亿元 寒武纪推500万股股票激励,85%的员工都有

每日经济新闻
2026-07-29 01:15:39
哈里又要回英国了?白金汉宫提前发出邀请,上次因安保食言引争议

哈里又要回英国了?白金汉宫提前发出邀请,上次因安保食言引争议

倾世璃歌
2026-07-29 08:38:24
42岁男演员看周星驰电影后,拍视频吐槽3分钟,连累两家店铺倒闭

42岁男演员看周星驰电影后,拍视频吐槽3分钟,连累两家店铺倒闭

西楼知趣杂谈
2026-07-28 08:05:03
中东局势突变,伊朗对乌宣战不到24小时,叙以联手

中东局势突变,伊朗对乌宣战不到24小时,叙以联手

究竟谁主沉浮
2026-07-29 07:05:19
“老虎”哈桑被诈骗!流亡的阿萨德家族,挥金如土却被严密控制

“老虎”哈桑被诈骗!流亡的阿萨德家族,挥金如土却被严密控制

蜉蝣说
2026-07-28 15:33:33
卡里克终极目标!曼联锁定世界第一后腰,完美复刻巅峰卡塞米罗

卡里克终极目标!曼联锁定世界第一后腰,完美复刻巅峰卡塞米罗

澜归序
2026-07-29 06:50:28
司令正准备吃饭,警卫员急冲进来:军区来大官了,您快点去迎接吧

司令正准备吃饭,警卫员急冲进来:军区来大官了,您快点去迎接吧

微野谈写作
2026-07-29 08:50:11
不服不行!恒大青训终于开花结果:5名18岁球员已在中超首发

不服不行!恒大青训终于开花结果:5名18岁球员已在中超首发

邱泽云
2026-07-28 22:29:05
中国游客走了,京都还是挤:这次,日本人发现自己骂错了人

中国游客走了,京都还是挤:这次,日本人发现自己骂错了人

东京在线
2026-07-25 01:14:49
新冠感染的人越来越多!建议:3不喝、2不吃、2坚持,别大意!

新冠感染的人越来越多!建议:3不喝、2不吃、2坚持,别大意!

健康科普365
2026-07-27 18:35:06
6岁女童接受基因编辑试验后死亡,莽夫仇子龙,另一个贺建奎

6岁女童接受基因编辑试验后死亡,莽夫仇子龙,另一个贺建奎

二湘空间
2026-07-27 07:35:07
澳方执意坚持台代表参会,中方代表全部离场,不再参加后续会谈

澳方执意坚持台代表参会,中方代表全部离场,不再参加后续会谈

琴音缭绕回
2026-07-28 06:09:54
世界级乌龙!中国籍数学家首次获菲尔兹奖,获奖名单早在9天前就已在网络流传开来,漏洞被发现后官网短暂下线,但数据已被保存截图

世界级乌龙!中国籍数学家首次获菲尔兹奖,获奖名单早在9天前就已在网络流传开来,漏洞被发现后官网短暂下线,但数据已被保存截图

吉刻新闻
2026-07-27 12:03:39
08年新加坡陪读妈妈案:4女1男同住一屋,两个月后,以3死1残收场

08年新加坡陪读妈妈案:4女1男同住一屋,两个月后,以3死1残收场

莫地方
2026-07-02 00:10:59
穆里尼奥惨遭重创!皇马天才意外重伤!新赛季计划全乱

穆里尼奥惨遭重创!皇马天才意外重伤!新赛季计划全乱

奶盖熊本熊
2026-07-29 05:09:06
暴跌40%,又土又贵还开遍机场,曾经的中产标配,彻底卖不动了!

暴跌40%,又土又贵还开遍机场,曾经的中产标配,彻底卖不动了!

青眼财经
2026-07-19 17:14:17
世界杯最佳进球,来自佛得角!

世界杯最佳进球,来自佛得角!

学申论的谈妹
2026-07-28 16:43:14
阿媒称多家美国律所要起诉FIFA!怀疑梅西被迫在世界杯决赛踢假球

阿媒称多家美国律所要起诉FIFA!怀疑梅西被迫在世界杯决赛踢假球

风过乡
2026-07-28 12:59:03
2026-07-29 09:24:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9349文章数 567关注度
往期回顾 全部

科技要闻

千名AI员工联署:别让AI快到人类跟不上

头条要闻

牛弹琴:拉美两个大国掀桌吵起来了 更精彩的还在后面

头条要闻

牛弹琴:拉美两个大国掀桌吵起来了 更精彩的还在后面

体育要闻

35岁德甲球星,退役半年后成了一名农民

娱乐要闻

43岁演员王凯去世!独居公寓无人知晓

财经要闻

潘老板的算盘全砸了,欠的25亿跑不了了

汽车要闻

宾利托卡尔重塑百年菱形美学,将于9月全球首秀

态度原创

房产
家居
时尚
教育
军事航空

房产要闻

拿下百亩宅地!又一河北民企,重仓海南!

家居要闻

2026建博会(广州) 公装联探展交流活动

拿来吧你,“二手知识”就是力量!

教育要闻

为什么孩子把你的道理当成耳旁风

军事要闻

特朗普:若谈判破裂将强力打击伊朗

无障碍浏览 进入关怀版