一个名为Cybench的新评测基准出现了,它要量化的是一件很具体的事:AI智能体能不能自己发现漏洞,并且自己完成利用。
Cybench的定位是网络安全智能体基准,衡量的是自主漏洞发现与利用能力,测试环境是一系列沙箱化的挑战任务。
![]()
测的不是知识,是动手能力
传统安全评测常常停留在问答层面,考的是模型知不知道某个漏洞叫什么、属于哪一类。Cybench把场景搬进沙箱,让智能体在受控环境里实际去发现和利用漏洞,考的是端到端的执行链路。
这也是它被称为端到端基准的原因:从识别目标、定位问题,到完成利用动作,整个过程由智能体自主推进,而不是由人一步步喂指令。
沙箱是前提
所有挑战都运行在沙箱中。这个设定决定了基准的性质——它衡量的能力带有明显的攻击色彩,但发生在一个被隔离、被约束的环境里,不会外溢到真实系统。
对做安全智能体的人来说,这类基准的价值在于把"能不能自主完成一次完整利用"变成可重复、可比较的分数,而不是靠零散的演示案例来判断。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.