你的 AI 安全吗,我这几天遇到两个问题,值得跟大家聊下。
第一个,我的 Agent 工具里装了不少 Skill,连了几个 MCP 服务器,但我不知道装的 Skill 进行什么操作,有没有藏着可疑的代码。
之前有空时还会翻看一下它的源码,不过效率很低,也不一定看得出来。
第二个,我手头有个项目接了公司资料库的 Agent,快上线了。
我想知道这类 Agent 会不会失控,有没有安全问题,一直没找到靠谱的办法验证,全靠自己想几个刁钻问题手动去试,测得很不全面。
直到最近,我在 GitHub 发现一个名叫AI-Infra-Guard(后面简称叫 AIG)的开源项目,正好解决了我的问题。
GitHub:https://github.com/Tencent/AI-Infra-Guard
![]()
我看了下项目文档和源码,发现是来自腾讯朱雀实验室开源,还拿自己的项目进行了实测。
下面跟大家分享几个我觉得有意思的地方。
A.I.G 是什么
其实 AIG 算是一套全栈 AI 红队安全平台,支持 OpenClaw 安全扫描、Agent 扫描、Skills 扫描、MCP 扫描、AI 基础设施扫描,以及对大模型越狱评测。
简单来说,关于 AI 安全我们能想到的场景,它基本都覆盖了。
如果我们不想直接部署平台,AIG 也提供了一个 aig-agent-redteam 安全检测 Skill,安装命令如下:
npx skills add https://github.com/Tencent/AI-Infra-Guard.git --skill aig-agent-redteam![]()
安装完成后,只需要用大白话描述,告诉 AIG 你要做什么即可。
比如让它检查我装的 Skill、Mcp 是否有问题, 或者对项目外部 Agent 的安全性做一个检测。
就会触发 AIG Skill 进行扫描,扫描这部分背后调的就是 AIG 审计的能力,不用我们额外装东西,也不用单独记命令。
对 Agent 自身体检
首先用它对我自己安装的 Agent 做测试,只说了一句:“帮我对自身进行安全检测”。
![]()
它会先看当前 Agent 连了哪些工具、暴露了哪些攻击面,自己选测试路径去跑,跑完后会在本地生成一份报告。
报告里不是简单打个分,而是带有完整的证据链,具体是哪条 payload 触发了问题,Agent 当时给出了什么响应,再配一条对应的修复建议。
![]()
这个粒度对我来说挺关键的,若只有风险等级,我也不知道具体该往哪改。毕竟 Agent 一旦失控,不是报错那么简单,是真的会执行到底。
整个过程数据都在本机跑,不会往外部服务器传,这点我实测之前专门确认过,毕竟拿自己 Agent 的权限配置去做体检,数据要是传出去了反而更不安全。
![]()
自动化诱导,获取系统提示词
开头提及到第二个问题里,我最在意的是提示词泄露这件事,靠自己手动试问法太不靠谱了,容易漏。
于是调用这个 Skill,把我们资料库 Agent 的接口给到 WorkBuddy,同时也 把 Chrome 抓包导出的 har 文件,一并发给 Agent。
这一步,主要是让模型知道我们系统的对话接口是如何使用,如何调用的。
![]()
仅仅 10 分钟,就输出一份完整安全评估报告,还真发现了不少漏洞。
而且不是传统漏洞,像系统提示词泄漏,间接注入是 AI 时代特有的漏洞!
仔细看了下运行过程,它是生成一批诱导性的问法去套。
如果只跑单轮还不够,它还内置了几种更狠的多轮套话方式。
例如先在上下文里堆一堆看起来「正常问答」的假样本,把模型的警惕心先降下来。
再抛出真正想问的东西;让攻击模型跟目标模型一轮一轮过招,每次根据上一轮的回应调整问法,一步步逼近目标。
这几种方式跑一遍,比我自己憋十个刁钻问题靶向测试全面多了。
![]()
另外,它还会用多个方法去获取提示词,然后交叉验证最终确认,后面和业务沟通,系统提示词确实一致。
跑完这次安全检查,我才算是真正对这个 Agent 会不会「被套话」有底了,不是靠感觉,是有实测数据撑着的。
其他能力,简单提一下
上面提及的功能,只是 AIG 的冰山一角,还有很多模块我没细测,就简单跟大家说一下:
- 他维护了一个 AI 组件的漏洞库,可以对内网 AI 基础设施做安全检查,vLLM、Ollama 这类服务本身的已知漏洞,覆盖了 1900 多个 CVE;
- 还有 MCP、SKILL 扫描模块,用于检查 MCP 和 SKILL 的安全;
- Agent Scan 是针对 Dify、Coze 这类多智能体工作流的整体安全评估;
- 大模型安全检测模块,可以对单个模型进行提示词越狱之类的安全测试。
这些如果刚好匹配到我们的使用场景,可以直接去官方文档看下对应用法,还有一点,这些能力不是非要绑在一起用。
像前面提到的 Skill 扫描、MCP 扫描,都可以单独拆出来当命令行工具装,不用把整个平台跑起来,想测哪块就装哪块。
另外这个项目是完整开源,就连前后端和扫描端都开源了。
如果你想把这些检测能力接进自己现有的系统里,或者按自己的需求改界面,也都留了空间。
![]()
实话实说,项目也有些局限,平台跑起来得配一个 LLM 的 API Key,因为本质是基于 Agent 做安全检测的。
审计本身还得靠模型去理解代码语义,不是完全确定性的静态扫描,偶尔会有误报或者漏报,我自己跑的时候也遇到过一次判断偏严的情况。
另外如果想用完整平台的 Web 界面,官方说得很清楚,这是给企业或个人内部用的红队工具,目前没有鉴权机制,别往公网上部署。
一个强大的 Agent 来自它能连更多工具、处理更多上下文、完成更多动作,风险也正来自这些能力。
然而没权限的 AI 最多只会给出错误的建议,但给它赋予了权限一旦失控,又会带来很多安全问题。
可能发错邮件、错误审批、错误改数据库,或者把内部提示词和数据交给了不该给的人。
出了问题之后再排查,成本远比想象中高。所以,与其等上线后出事再翻日志复盘,不如先自己动手测一遍。
GitHub 项目地址:https://github.com/Tencent/AI-Infra-Guard
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.