AI-Infra-Guard 拆解:腾讯朱雀实验室把「AI 安全」从单点工具做成了红队平台
一、速览
★★★★☆(4/5)。腾讯朱雀实验室出品的全栈 AI 红队平台,Apache-2.0,6.6k star / 615 fork(截至 2026-09-24)。它做的事情不是「又一个 AI 扫描器」,而是把 2025 年之后散落的 AI 攻击面 —— AI 基础设施 CVE、Agent 失控、MCP 供应链、Agent Skills 后门、越狱评测 —— 收敛进了一个可执行的平台,并且用自研 benchmark 和 Black Hat Europe 演讲给这套方法论做了背书。扣一星有两个明确原因:README 自己写明没有身份认证机制、不应部署在公网,以及若干子模块仍处于未完成状态(有 SKILL.md 但没注册、知识库英文不同步、红队断点续跑未实现)。内网 / 受控环境 / CI 门禁可以直接用;公网部署必须自己补认证和网络隔离。
| 主语言 | Go(后端 trpc-go)+ Python(各子扫描器),前端 Vite + Tailwind |
| 许可证 | Apache-2.0(由 MIT 迁移而来,保留 NOTICE 署名要求) |
| Star / Fork | 6,600 / 615 |
| Commits / Tags | 1,918 / 58 |
| 最新版本 | v4.6.2(2026-09-17) |
| AI 组件覆盖 | 146 个组件 / 2,000+ CVE 规则 |
| Skill 风险分类 | SkillTrustBench T01–T09(9 类) |
| MCP 风险分类 | 14 大类 |
| 部署要求 | Docker 20.10+ / 4GB RAM / 10GB 磁盘 |
| 默认端口 | 8088 |
| 地址 | https://github.com/Tencent/AI-Infra-Guard |
适合谁(按人群打分,5 分制):
| 人群 | 分 | 理由 |
|---|---|---|
| 企业安全运营 / CISO | 5 | 现有开源里少有的「能一次性回答『我们内部跑了多少 AI 组件、其中多少个有已知 CVE』」的工具,且能挂进 CI 做 Agent / MCP / Skill 上线门禁 |
| AI 安全研究员 | 5 | 自带 FORGE-Bench / RogueHandoff-20 / SkillJack 三个自研基准和 19 篇被引论文,既是工具也是研究参照系 |
| Agent / MCP 开发者 | 5 | aig-skill-scan 一条命令审计自己的 skill,MCP 扫描输出 SARIF 可直接接 CI,不用先读完 OWASP ASI |
| 红队 / 渗透 | 4 | 攻击面摸底很好用(AI Infra Scan 支持 CIDR 网段批量),但它本质是自查平台不是攻击平台,想做 adversary emulation 还得配别的 |
| 个人学习 / 自部署 | 3 | Docker 一键起,但 4GB RAM + 10GB 磁盘的门槛、无认证机制、以及 Skill/MCP 扫描要接 LLM API(有调用成本),对纯个人折腾不算轻 |
二次开发:Apache-2.0 三档难度(改配置 / 改集成 / 改内核):
| 难度 | 能做的事 |
|---|---|
| 改配置 | 四类插件都只需往 data/ 下加文件:data/fingerprints/ 加组件指纹 YAML、data/vuln/ 加 CVE 规则、data/mcp/ 加 MCP 安全规则、data/eval/ 加越狱数据集 —— 官方 CONTRIBUTING 明确把这四条列为低摩擦贡献路径 |
| 改集成 | 把 aig-skill-scan(pip 装)或 mcp-scan 挂进 CI/CD 出 SARIF;用 Task API(5 种任务类型)对接内部工单系统;装 OpenClaw 技能 clawhub install aig-scanner 把扫描嵌进 agent 工作流 |
| 改内核 | 改 agent-scan 的多 Agent 框架(新增检测技能要同时改 _DETECTION_SKILLS 和 prompt/skills/<name>/SKILL.md);改扫描引擎与 VulnerabilityExtractor(LLM 输出解析);改 services/api_checker 的模型指纹与中继审计逻辑 |
二、是什么,不是什么
打开仓库之前先把四件事说清楚,因为 A.I.G 不是这几样常见的东西:
不是单个扫描器。它名字里的 “Infra Guard” 容易让人以为只是扫 AI 框架 CVE 的工具 —— 那是它 2025 年最早的样子。现在的 A.I.G 是五个能力并列的平台:Agent Scan、Skill Scan、MCP Scan、AI Infra Scan、Jailbreak Evaluation,外加一个 Model & API Relay Checker。AI 基础设施漏洞扫描只是其中一层。
不是传统 DAST / SAST。它不替代你已有的 Web 扫描或代码审计。AI Infra Scan 做的是指纹识别 + CVE 匹配——连到你运行中的 vLLM / Ollama / ComfyUI,识别组件和版本,然后匹配已知漏洞库。这是资产盘点和已知漏洞治理,不是挖 0day。
不是纯规则库。MCP Scan 和 Skill Scan 这两块本质是让大模型审代码——把 MCP Server 或 Skill 的源码交给 LLM,按预定义的风险分类(14 类 / T01–T09)输出发现和修复建议。所以它有效果波动和调用成本,这点在第七章展开。
不是可以放公网的 SaaS。README 原话:”It currently lacks an authentication mechanism and should not be deployed on public networks.” 定位是企业或个人内部使用的红队平台。这条最重要,后面会再提。
那 A.I.G 到底是什么?看官方一句话:
A full-stack AI Red Teaming platform securing AI ecosystems via Agent Scan, Skills Scan, MCP scan, AI Infra scan and LLM jailbreak evaluation.
三个关键词:full-stack / red teaming / AI ecosystems。
三、五层能力拆解
A.I.G 的能力可以拆成五个并列任务类型 —— Web UI 上就是五个按钮,API 上就是五种 Task Type。
| 能力 | 输入 | 输出 / 特点 |
|---|---|---|
| AI Infra Scan | 运行中服务的网络地址(支持 CIDR / 范围) | 组件指纹 + 版本 + 匹配 CVE + 修复链接 |
| Agent Scan | Agent 工作流(支持 Dify / Coze) | 多 Agent 自动化扫描,10 个检测技能,映射 OWASP ASI |
| MCP Scan | MCP Server 源码包或远程 URL | 14 类风险,输出 SARIF,无需运行实例 |
| Skill Scan | Agent Skills 目录 | 对齐 SkillTrustBench T01–T09,pip 一行命令可用 |
| Jailbreak Evaluation | 目标 LLM 的 API endpoint | 多轮越狱攻击 + 跨模型对比,基于 DeepTeam |
AI Infra Scan 的一个关键约束值得单独说:它扫的是运行中的服务地址,不是 GitHub URL 也不是本地源码路径。也就是说 http://127.0.0.1:8000(本地 vLLM)、http://192.168.1.100:11434(局域网 Ollama)、192.168.1.0/24(整段 CIDR)都可以,但你不能拿它去扫一个仓库。想扫源码走的是 MCP Scan / Skill Scan 那条路。这个区分决定了它在企业里的用法是内网资产盘点,而不是开源组件评估。
MCP Scan 不需要运行实例这一点很实用 —— 给一个远程 URL 或上传源码包就能扫,不必先把可疑的 MCP Server 跑起来(跑起来本身就有风险)。v4.5.2 还加了工具白名单机制防止动态模式下的 RCE,属于「扫恶意代码时先保护自己」的正确设计。
Skill Scan 覆盖了 9 类风险,分 5 层,这个分类法本身就有参考价值:
| 层 | 风险 |
|---|---|
| A · 指令与内存 | T01 Skill 指令劫持、T02 内存投毒 |
| B · 代码执行 | T03 远程载荷下载执行、T04 内嵌恶意代码 |
| C · 系统权限 | T05 权限提升与未授权访问、T06 系统持久化 |
| D · 工具链与依赖 | T07 工具劫持与伪装、T08 不安全依赖 |
| E · 代码质量 | T09 不安全编码实践 |
四、技术架构:插件化 + 多扫描器
架构基石是可扩展插件框架(README 原话:”The extensible plugin framework serves as A.I.G’s architectural cornerstone”)。
引擎和规则数据是分离的 —— 所有扫描规则集中在 data/ 目录下:
| 目录 | 内容 |
|---|---|
data/fingerprints/ |
组件指纹 YAML |
data/vuln/ + data/vuln_en/ |
CVE 规则(中 / 英) |
data/mcp/ |
MCP 安全规则 |
data/eval/ |
越狱评测数据集 |
这个设计带来的直接好处是贡献门槛极低:想支持一个新 AI 组件,加一个 YAML;想补一条 CVE 规则,加一个文件。不需要动 Go 代码。
技术栈是混合的,这点值得注意:
- 后端:Go + trpc-go 框架,提供 Web 服务和 Task API;
cmd/cli/main.go可编译出统一 CLI 工具ai-infra-guard - 前端:Vite + Tailwind,一键扫描 + 实时进度
- 子扫描器:
agent-scan/mcp-scan/skill-scan是独立的 Python 模块,AIG-PromptSecurity(越狱评测)基于 DeepTeam,services/api_checker也是 Python - 分布式:webserver + Agent 结构(
Dockerfile_Agent),AI 基础设施扫描由 Agent 侧的AIInfraScanAgent.executeScan执行;api checker 已嵌入 Agent 运行时
多语言支持走的是数据层而不是 UI 层:知识库接口 /api/v1/knowledge/vulnerabilities 读 lang 参数(默认 zh),lang=en 时服务 data/vuln_en。这个设计是对的 —— 但也埋了一个已知的同步问题(见第七章)。
五、研究与基准:这才是它区别于其他工具的地方
大多数开源安全工具只有代码,A.I.G 有自研基准和论文。这是我认为最值得肯定的部分。
4 项自研研究(代码都在 Research/ 下):
| 研究 | 内容 |
|---|---|
| FORGE-Bench | Agent 失控的确定性基准,基于 oracle,覆盖 16 个领域、1,800 条轨迹(arXiv:2609.11024) |
| RogueHandoff-20 | 衡量 Agent 在接触另一个 Agent 的不安全策略后,是否会采用不安全轨迹 |
| SkillJack | 演示被投毒的轨迹如何向自进化 Agent 的 Skill 系统注入持久化后门 |
| DeepSeek Harness 评估 | 对 DeepSeek Harness 的授权安全评估,跨 14,560 次 Agent 运行测间接提示注入 |
SkillJack 这个研究选题很说明问题 —— 它关注的不是「这一轮提示注入能不能成功」,而是后门能不能在 Agent 自我进化的过程中沉淀下来。这是 2026 年 Agent 安全真正的痛点。
3 篇论文,其中 2 篇是 Black Hat Europe 2025:
- Securing the AI Agent: A Unified Framework for Multi-Layer Agent Red Teaming(多层 Agent 红队统一框架)
- AI-Infra-Guard: An AI Red Teaming Platform(Black Hat Europe 2025 Arsenal)
- MCP Unchained: Compromising The AI Agent Ecosystem Via Its Universal Connector(Black Hat Europe 2025)
第三篇的选题尤其尖锐 —— MCP 作为 Agent 生态的「通用连接器」,同时也是通用攻击入口。
被 19 篇学术论文引用,包括 MCPGuard、MCPSecBench、SkillAttack、TRUSTDESC 等。一个工业界开源工具能被这么多学术论文当作参照系,说明它在 Agent 安全这个新兴领域已经成了事实基准之一。
Skill-Scan 的效果有量化数据(基于 SkillTrustBench):
| 模型 | F1 | Precision | Recall | FPR |
|---|---|---|---|---|
| Claude Opus 4.6 | 0.9848 | 0.9725 | 0.9974 | 0.0663 |
| GLM 5.1 | 0.9836 | 0.9701 | 0.9974 | 0.0723 |
| Gemini 3.5 Flash | 0.9792 | 0.9947 | 0.9641 | 0.0120 |
| Kimi 2.6 | 0.9780 | 0.9895 | 0.9667 | 0.0241 |
| DeepSeek v4 Flash | 0.9740 | 0.9868 | 0.9615 | 0.0301 |
愿意公布 F1 / Precision / Recall / FPR 四维而不是只报一个准确率,这个态度比较老实。注意 FPR 差异很大(0.012 到 0.072)—— 如果你要把 Skill Scan 挂进 CI 当门禁,选 Gemini 3.5 Flash 这类低 FPR 的模型比选高 F1 的更重要,否则误报会淹没流水线。
六、部署与集成
Docker 一键部署(推荐):
1 | git clone https://github.com/Tencent/AI-Infra-Guard.git |
也可以一行脚本:curl https://raw.githubusercontent.com/Tencent/AI-Infra-Guard/refs/heads/main/docker.sh | bash
Skill Scan 作为独立 CLI(最容易接 CI):
1 | pip install aig-skill-scan |
嵌进 Agent 工作流(Agent-Ready):
1 | clawhub install aig-scanner |
之后可以在 OpenClaw 对话里直接调起扫描。官方把它做成 ClawHub 上的即插即用技能,这个思路对 —— 安全工具的价值一半在于能不能嵌进开发者已有的工作流。
Relay Checker(模型与 API 中继检查)Docker 部署后 API 在 /api/v1/relay/*,文档在 http://127.0.0.1:8088/api-checker/docs。注意 checker 的前端是独立部署的,Docker 只保证 API 可用。
七、边界与风险
这章是扣掉那一星的地方,四条都是实打实的约束。
1. 无身份认证,禁止公网部署(最重要)
README 明确声明平台缺乏认证机制,不应部署在公共网络。平台自带 Web UI、完整 API(Swagger)、一键扫描 —— 这些能力在没有认证的情况下暴露到公网,等于把内网资产扫描能力送给别人。企业落地必须自己补齐认证和网络隔离,这是首要成本项,不要跳过。
2. MCP / Skill Scan 强依赖 LLM
这两块是「大模型审代码」范式,三个后果:
- 效果随模型波动 —— 第五章的 F1 0.98 是 Claude Opus 4.6 的成绩,换弱模型会往下掉
- 有调用成本 —— 大规模扫描不便宜,CI 里高频跑要考虑预算
- LLM 不确定性 —— README 和提交记录里记录了模型会自作主张把
<desc>标签改写成<description>、往输出里塞<![CDATA[ ]]>,导致有效发现被校验门丢弃(报告 0 findings)
项目已经做了健壮性修复(CDATA 剥离 + 同义词回退),但范式本身的局限不会因为工程修复消失。用 LLM 做安全判定,你要接受它既会漏也会错。
3. 若干子模块是「半成品」状态
从提交记录和代码里能看到:
- 4 个 Agent 检测技能(
direct-injection-detection、file-path-traversal-detection、hardcoded-secret-detection、memory-poisoning-detection)有SKILL.md但未注册到_DETECTION_SKILLS,实际从不运行 web-exfiltration-detection已注册,但在 OWASP ASI 表里没有对应行- 知识库「创建/编辑漏洞」端点只写中文
data/vuln,从不写data/vuln_en—— 管理员新增的 CVE 没有英文文本 - 红队评测的 resume(断点续跑)尚未实现,只做了 JSONL 进度落盘
- Windows 下有进程终止限制
这些不影响主流程,但说明平台的完成度高于每个子模块的完成度。用之前建议先确认你依赖的那个子模块是不是真的在跑。
4. AI Infra Scan 只覆盖「运行中」的资产
它连实时服务做指纹识别,扫不到没在跑的组件、扫不到源码仓库。内网盘点够用,但别指望它做开源供应链评估。
八、上手
第一步,先把 AI 基础设施扫一遍(最能立刻看到价值):
1 | # 起一个测试用的 vLLM(或指向你已有的服务) |
扫 CIDR 网段(192.168.1.0/24)或范围(10.0.0.1-10.0.0.20)可以一次性摸清内网有多少 AI 组件在跑。
第二步,把 Skill / MCP 扫描挂进 CI:
1 | pip install aig-skill-scan |
建议先选低 FPR 的模型(见第五章),跑几天观察误报率再决定要不要卡门禁。
第三步,配置 Jailbreak Evaluation:在 Settings → Model Config 填目标 LLM 的 base URL + API key,选数据集开跑,可以跨模型对比。
几个实操建议(按 README 和已知坑整理的):
- 不要部署在公网 —— 这条再说一遍,它没有任何认证
- CI 里选模型看 FPR 而不是 F1 —— 误报会淹没流水线
- Agent Scan 用之前先确认检测技能真的注册了 —— 有 SKILL.md 不等于会运行
- 新增 CVE 记得手动同步
data/vuln_en—— 管理端只写中文 - AI Infra Scan 扫 CIDR 前先确认授权范围 —— 它是主动连接 + 指纹识别,别扫到不该扫的网段
九、一句话结论
A.I.G 不是一个新扫描器,是 「把散落的 AI 攻击面收敛成一个可执行平台」的那一层 —— 五层能力(基础设施 CVE / Agent 失控 / MCP 供应链 / Skill 后门 / 越狱评测)+ 三个自研基准 + Black Hat Europe 背书,腾讯朱雀实验室的工程投入是扎实的(1,918 commits、58 tags、Apache-2.0)。在「AI 安全红队平台」这个细分里,它是目前开源里完成度最高的之一,值得给高评价。
扣分项集中在两处:无认证机制导致的部署约束,以及部分子模块仍处于未完成状态。前者意味着你不能开箱即用放公网,后者意味着用之前要确认你依赖的那块是不是真的在跑 —— 这两点都不难补,但在补之前,落地需要额外投入。
开始用的时候建议先扫一遍内网 AI 资产(最能立刻看到价值),再考虑把 Skill/MCP 扫描接进 CI;公网部署请务必先补认证。