AI-Infra-Guard 拆解:腾讯朱雀实验室把「AI 安全」从单点工具做成了红队平台

一、速览

★★★★☆(4/5)。腾讯朱雀实验室出品的全栈 AI 红队平台,Apache-2.0,6.6k star / 615 fork(截至 2026-09-24)。它做的事情不是「又一个 AI 扫描器」,而是把 2025 年之后散落的 AI 攻击面 —— AI 基础设施 CVE、Agent 失控、MCP 供应链、Agent Skills 后门、越狱评测 —— 收敛进了一个可执行的平台,并且用自研 benchmark 和 Black Hat Europe 演讲给这套方法论做了背书。扣一星有两个明确原因:README 自己写明没有身份认证机制、不应部署在公网,以及若干子模块仍处于未完成状态(有 SKILL.md 但没注册、知识库英文不同步、红队断点续跑未实现)。内网 / 受控环境 / CI 门禁可以直接用;公网部署必须自己补认证和网络隔离。

主语言 Go(后端 trpc-go)+ Python(各子扫描器),前端 Vite + Tailwind
许可证 Apache-2.0(由 MIT 迁移而来,保留 NOTICE 署名要求)
Star / Fork 6,600 / 615
Commits / Tags 1,918 / 58
最新版本 v4.6.2(2026-09-17)
AI 组件覆盖 146 个组件 / 2,000+ CVE 规则
Skill 风险分类 SkillTrustBench T01–T09(9 类)
MCP 风险分类 14 大类
部署要求 Docker 20.10+ / 4GB RAM / 10GB 磁盘
默认端口 8088
地址 https://github.com/Tencent/AI-Infra-Guard

适合谁(按人群打分,5 分制):

人群 理由
企业安全运营 / CISO 5 现有开源里少有的「能一次性回答『我们内部跑了多少 AI 组件、其中多少个有已知 CVE』」的工具,且能挂进 CI 做 Agent / MCP / Skill 上线门禁
AI 安全研究员 5 自带 FORGE-Bench / RogueHandoff-20 / SkillJack 三个自研基准和 19 篇被引论文,既是工具也是研究参照系
Agent / MCP 开发者 5 aig-skill-scan 一条命令审计自己的 skill,MCP 扫描输出 SARIF 可直接接 CI,不用先读完 OWASP ASI
红队 / 渗透 4 攻击面摸底很好用(AI Infra Scan 支持 CIDR 网段批量),但它本质是自查平台不是攻击平台,想做 adversary emulation 还得配别的
个人学习 / 自部署 3 Docker 一键起,但 4GB RAM + 10GB 磁盘的门槛、无认证机制、以及 Skill/MCP 扫描要接 LLM API(有调用成本),对纯个人折腾不算轻

二次开发:Apache-2.0 三档难度(改配置 / 改集成 / 改内核):

难度 能做的事
改配置 四类插件都只需往 data/ 下加文件:data/fingerprints/ 加组件指纹 YAML、data/vuln/ 加 CVE 规则、data/mcp/ 加 MCP 安全规则、data/eval/ 加越狱数据集 —— 官方 CONTRIBUTING 明确把这四条列为低摩擦贡献路径
改集成 aig-skill-scan(pip 装)或 mcp-scan 挂进 CI/CD 出 SARIF;用 Task API(5 种任务类型)对接内部工单系统;装 OpenClaw 技能 clawhub install aig-scanner 把扫描嵌进 agent 工作流
改内核 agent-scan 的多 Agent 框架(新增检测技能要同时改 _DETECTION_SKILLSprompt/skills/<name>/SKILL.md);改扫描引擎与 VulnerabilityExtractor(LLM 输出解析);改 services/api_checker 的模型指纹与中继审计逻辑

二、是什么,不是什么

打开仓库之前先把四件事说清楚,因为 A.I.G 不是这几样常见的东西:

不是单个扫描器。它名字里的 “Infra Guard” 容易让人以为只是扫 AI 框架 CVE 的工具 —— 那是它 2025 年最早的样子。现在的 A.I.G 是五个能力并列的平台:Agent Scan、Skill Scan、MCP Scan、AI Infra Scan、Jailbreak Evaluation,外加一个 Model & API Relay Checker。AI 基础设施漏洞扫描只是其中一层。

不是传统 DAST / SAST。它不替代你已有的 Web 扫描或代码审计。AI Infra Scan 做的是指纹识别 + CVE 匹配——连到你运行中的 vLLM / Ollama / ComfyUI,识别组件和版本,然后匹配已知漏洞库。这是资产盘点和已知漏洞治理,不是挖 0day。

不是纯规则库。MCP Scan 和 Skill Scan 这两块本质是让大模型审代码——把 MCP Server 或 Skill 的源码交给 LLM,按预定义的风险分类(14 类 / T01–T09)输出发现和修复建议。所以它有效果波动和调用成本,这点在第七章展开。

不是可以放公网的 SaaS。README 原话:”It currently lacks an authentication mechanism and should not be deployed on public networks.” 定位是企业或个人内部使用的红队平台。这条最重要,后面会再提。

那 A.I.G 到底是什么?看官方一句话:

A full-stack AI Red Teaming platform securing AI ecosystems via Agent Scan, Skills Scan, MCP scan, AI Infra scan and LLM jailbreak evaluation.

三个关键词:full-stack / red teaming / AI ecosystems

三、五层能力拆解

A.I.G 的能力可以拆成五个并列任务类型 —— Web UI 上就是五个按钮,API 上就是五种 Task Type。

能力 输入 输出 / 特点
AI Infra Scan 运行中服务的网络地址(支持 CIDR / 范围) 组件指纹 + 版本 + 匹配 CVE + 修复链接
Agent Scan Agent 工作流(支持 Dify / Coze) 多 Agent 自动化扫描,10 个检测技能,映射 OWASP ASI
MCP Scan MCP Server 源码包或远程 URL 14 类风险,输出 SARIF,无需运行实例
Skill Scan Agent Skills 目录 对齐 SkillTrustBench T01–T09,pip 一行命令可用
Jailbreak Evaluation 目标 LLM 的 API endpoint 多轮越狱攻击 + 跨模型对比,基于 DeepTeam

AI Infra Scan 的一个关键约束值得单独说:它扫的是运行中的服务地址,不是 GitHub URL 也不是本地源码路径。也就是说 http://127.0.0.1:8000(本地 vLLM)、http://192.168.1.100:11434(局域网 Ollama)、192.168.1.0/24(整段 CIDR)都可以,但你不能拿它去扫一个仓库。想扫源码走的是 MCP Scan / Skill Scan 那条路。这个区分决定了它在企业里的用法是内网资产盘点,而不是开源组件评估。

MCP Scan 不需要运行实例这一点很实用 —— 给一个远程 URL 或上传源码包就能扫,不必先把可疑的 MCP Server 跑起来(跑起来本身就有风险)。v4.5.2 还加了工具白名单机制防止动态模式下的 RCE,属于「扫恶意代码时先保护自己」的正确设计。

Skill Scan 覆盖了 9 类风险,分 5 层,这个分类法本身就有参考价值:

风险
A · 指令与内存 T01 Skill 指令劫持、T02 内存投毒
B · 代码执行 T03 远程载荷下载执行、T04 内嵌恶意代码
C · 系统权限 T05 权限提升与未授权访问、T06 系统持久化
D · 工具链与依赖 T07 工具劫持与伪装、T08 不安全依赖
E · 代码质量 T09 不安全编码实践

四、技术架构:插件化 + 多扫描器

架构基石是可扩展插件框架(README 原话:”The extensible plugin framework serves as A.I.G’s architectural cornerstone”)。

引擎和规则数据是分离的 —— 所有扫描规则集中在 data/ 目录下:

目录 内容
data/fingerprints/ 组件指纹 YAML
data/vuln/ + data/vuln_en/ CVE 规则(中 / 英)
data/mcp/ MCP 安全规则
data/eval/ 越狱评测数据集

这个设计带来的直接好处是贡献门槛极低:想支持一个新 AI 组件,加一个 YAML;想补一条 CVE 规则,加一个文件。不需要动 Go 代码。

技术栈是混合的,这点值得注意:

  • 后端:Go + trpc-go 框架,提供 Web 服务和 Task API;cmd/cli/main.go 可编译出统一 CLI 工具 ai-infra-guard
  • 前端:Vite + Tailwind,一键扫描 + 实时进度
  • 子扫描器agent-scan / mcp-scan / skill-scan 是独立的 Python 模块,AIG-PromptSecurity(越狱评测)基于 DeepTeam,services/api_checker 也是 Python
  • 分布式:webserver + Agent 结构(Dockerfile_Agent),AI 基础设施扫描由 Agent 侧的 AIInfraScanAgent.executeScan 执行;api checker 已嵌入 Agent 运行时

多语言支持走的是数据层而不是 UI 层:知识库接口 /api/v1/knowledge/vulnerabilitieslang 参数(默认 zh),lang=en 时服务 data/vuln_en。这个设计是对的 —— 但也埋了一个已知的同步问题(见第七章)。

五、研究与基准:这才是它区别于其他工具的地方

大多数开源安全工具只有代码,A.I.G 有自研基准和论文。这是我认为最值得肯定的部分。

4 项自研研究(代码都在 Research/ 下):

研究 内容
FORGE-Bench Agent 失控的确定性基准,基于 oracle,覆盖 16 个领域、1,800 条轨迹(arXiv:2609.11024)
RogueHandoff-20 衡量 Agent 在接触另一个 Agent 的不安全策略后,是否会采用不安全轨迹
SkillJack 演示被投毒的轨迹如何向自进化 Agent 的 Skill 系统注入持久化后门
DeepSeek Harness 评估 对 DeepSeek Harness 的授权安全评估,跨 14,560 次 Agent 运行测间接提示注入

SkillJack 这个研究选题很说明问题 —— 它关注的不是「这一轮提示注入能不能成功」,而是后门能不能在 Agent 自我进化的过程中沉淀下来。这是 2026 年 Agent 安全真正的痛点。

3 篇论文,其中 2 篇是 Black Hat Europe 2025:

  1. Securing the AI Agent: A Unified Framework for Multi-Layer Agent Red Teaming(多层 Agent 红队统一框架)
  2. AI-Infra-Guard: An AI Red Teaming Platform(Black Hat Europe 2025 Arsenal)
  3. MCP Unchained: Compromising The AI Agent Ecosystem Via Its Universal Connector(Black Hat Europe 2025)

第三篇的选题尤其尖锐 —— MCP 作为 Agent 生态的「通用连接器」,同时也是通用攻击入口

被 19 篇学术论文引用,包括 MCPGuard、MCPSecBench、SkillAttack、TRUSTDESC 等。一个工业界开源工具能被这么多学术论文当作参照系,说明它在 Agent 安全这个新兴领域已经成了事实基准之一。

Skill-Scan 的效果有量化数据(基于 SkillTrustBench):

模型 F1 Precision Recall FPR
Claude Opus 4.6 0.9848 0.9725 0.9974 0.0663
GLM 5.1 0.9836 0.9701 0.9974 0.0723
Gemini 3.5 Flash 0.9792 0.9947 0.9641 0.0120
Kimi 2.6 0.9780 0.9895 0.9667 0.0241
DeepSeek v4 Flash 0.9740 0.9868 0.9615 0.0301

愿意公布 F1 / Precision / Recall / FPR 四维而不是只报一个准确率,这个态度比较老实。注意 FPR 差异很大(0.012 到 0.072)—— 如果你要把 Skill Scan 挂进 CI 当门禁,选 Gemini 3.5 Flash 这类低 FPR 的模型比选高 F1 的更重要,否则误报会淹没流水线。

六、部署与集成

Docker 一键部署(推荐):

1
2
3
4
git clone https://github.com/Tencent/AI-Infra-Guard.git
cd AI-Infra-Guard
docker-compose -f docker-compose.images.yml up -d
# 访问 http://localhost:8088

也可以一行脚本:curl https://raw.githubusercontent.com/Tencent/AI-Infra-Guard/refs/heads/main/docker.sh | bash

Skill Scan 作为独立 CLI(最容易接 CI):

1
2
3
pip install aig-skill-scan
export LLM_API_KEY="your-api-key"
aig-skill-scan --repo /path/to/your/skill -m deepseek-v4-flash --language en -o result.json

嵌进 Agent 工作流(Agent-Ready):

1
2
clawhub install aig-scanner
# 配置 AIG_BASE_URL 指向运行中的 A.I.G 服务

之后可以在 OpenClaw 对话里直接调起扫描。官方把它做成 ClawHub 上的即插即用技能,这个思路对 —— 安全工具的价值一半在于能不能嵌进开发者已有的工作流

Relay Checker(模型与 API 中继检查)Docker 部署后 API 在 /api/v1/relay/*,文档在 http://127.0.0.1:8088/api-checker/docs。注意 checker 的前端是独立部署的,Docker 只保证 API 可用。

七、边界与风险

这章是扣掉那一星的地方,四条都是实打实的约束。

1. 无身份认证,禁止公网部署(最重要)

README 明确声明平台缺乏认证机制,不应部署在公共网络。平台自带 Web UI、完整 API(Swagger)、一键扫描 —— 这些能力在没有认证的情况下暴露到公网,等于把内网资产扫描能力送给别人。企业落地必须自己补齐认证和网络隔离,这是首要成本项,不要跳过。

2. MCP / Skill Scan 强依赖 LLM

这两块是「大模型审代码」范式,三个后果:

  • 效果随模型波动 —— 第五章的 F1 0.98 是 Claude Opus 4.6 的成绩,换弱模型会往下掉
  • 有调用成本 —— 大规模扫描不便宜,CI 里高频跑要考虑预算
  • LLM 不确定性 —— README 和提交记录里记录了模型会自作主张把 <desc> 标签改写成 <description>、往输出里塞 <![CDATA[ ]]>,导致有效发现被校验门丢弃(报告 0 findings)

项目已经做了健壮性修复(CDATA 剥离 + 同义词回退),但范式本身的局限不会因为工程修复消失。用 LLM 做安全判定,你要接受它既会漏也会错。

3. 若干子模块是「半成品」状态

从提交记录和代码里能看到:

  • 4 个 Agent 检测技能(direct-injection-detectionfile-path-traversal-detectionhardcoded-secret-detectionmemory-poisoning-detection)有 SKILL.md未注册到 _DETECTION_SKILLS,实际从不运行
  • web-exfiltration-detection 已注册,但在 OWASP ASI 表里没有对应行
  • 知识库「创建/编辑漏洞」端点只写中文 data/vuln从不写 data/vuln_en —— 管理员新增的 CVE 没有英文文本
  • 红队评测的 resume(断点续跑)尚未实现,只做了 JSONL 进度落盘
  • Windows 下有进程终止限制

这些不影响主流程,但说明平台的完成度高于每个子模块的完成度。用之前建议先确认你依赖的那个子模块是不是真的在跑。

4. AI Infra Scan 只覆盖「运行中」的资产

它连实时服务做指纹识别,扫不到没在跑的组件、扫不到源码仓库。内网盘点够用,但别指望它做开源供应链评估。

八、上手

第一步,先把 AI 基础设施扫一遍(最能立刻看到价值):

1
2
3
# 起一个测试用的 vLLM(或指向你已有的服务)
# 浏览器打开 http://localhost:8088 → 点「AI 基础设施安全扫描」
# 输入 http://127.0.0.1:8000 → Start Scan

扫 CIDR 网段(192.168.1.0/24)或范围(10.0.0.1-10.0.0.20)可以一次性摸清内网有多少 AI 组件在跑。

第二步,把 Skill / MCP 扫描挂进 CI

1
2
pip install aig-skill-scan
aig-skill-scan --repo ./my-skill -m <model> -o result.json

建议先选低 FPR 的模型(见第五章),跑几天观察误报率再决定要不要卡门禁。

第三步,配置 Jailbreak Evaluation:在 Settings → Model Config 填目标 LLM 的 base URL + API key,选数据集开跑,可以跨模型对比。

几个实操建议(按 README 和已知坑整理的):

  1. 不要部署在公网 —— 这条再说一遍,它没有任何认证
  2. CI 里选模型看 FPR 而不是 F1 —— 误报会淹没流水线
  3. Agent Scan 用之前先确认检测技能真的注册了 —— 有 SKILL.md 不等于会运行
  4. 新增 CVE 记得手动同步 data/vuln_en —— 管理端只写中文
  5. AI Infra Scan 扫 CIDR 前先确认授权范围 —— 它是主动连接 + 指纹识别,别扫到不该扫的网段

九、一句话结论

A.I.G 不是一个新扫描器,是 「把散落的 AI 攻击面收敛成一个可执行平台」的那一层 —— 五层能力(基础设施 CVE / Agent 失控 / MCP 供应链 / Skill 后门 / 越狱评测)+ 三个自研基准 + Black Hat Europe 背书,腾讯朱雀实验室的工程投入是扎实的(1,918 commits、58 tags、Apache-2.0)。在「AI 安全红队平台」这个细分里,它是目前开源里完成度最高的之一,值得给高评价。

扣分项集中在两处:无认证机制导致的部署约束,以及部分子模块仍处于未完成状态。前者意味着你不能开箱即用放公网,后者意味着用之前要确认你依赖的那块是不是真的在跑 —— 这两点都不难补,但在补之前,落地需要额外投入。

开始用的时候建议先扫一遍内网 AI 资产(最能立刻看到价值),再考虑把 Skill/MCP 扫描接进 CI;公网部署请务必先补认证。

评论Comments