腾讯 AI-Infra-Guard:AI 全栈红队平台深度解析

腾讯 AI-Infra-Guard:AI 全栈红队平台深度解析

定位关键词:AI 安全工具链、MCP/Agent 威胁检测、LLM 越狱评估、企业 DevSecOps
来源:GitHub Tencent/AI-Infra-Guard · 腾讯朱雀实验室


一、这件事处于什么阶段?

AI-Infra-Guard(简称 A.I.G)不是对传统安全扫描工具的渐进优化,而是在一个全新攻击面上的范式级补全——它面对的威胁模型是传统 Trivy/Grype 完全无法覆盖的:MCP 工具投毒、Agent Skill 指令劫持、LLM 越狱、AI 推理节点 CVE。

读者应该用"Web 安全进入 AI 生态时代"的参照系来理解它。就像 2010 年代初 Web 应用安全工具(Burp Suite、OWASP ZAP)崛起时,传统主机扫描器也无法覆盖 XSS/CSRF 一样——A.I.G 是这个时代转折点上的同类产品。

项目当前处于高速迭代的早期成熟阶段:v4.5.2 已于 2026 年 8 月发布,功能覆盖宽度已超过业内同类,但部分模块(如 SkillJack 研究项目)文档仍未补全,认证机制缺失这一关键生产障碍也尚未解决。


二、最核心的那个机制是什么?

A.I.G 真正巧妙的地方不在于它有多少 CVE 规则(2000+),而在于它对 AI 生态中"可执行语义"攻击面的系统化建模

传统漏洞扫描基于签名匹配(CVE ID → 版本号 → 告警),是静态的。而 A.I.G 的 Skill Scan 和 MCP Scan 则必须理解代码的意图——一个 MCP 工具的描述文字是否在语义层面上欺骗 LLM 宿主去执行越权操作(Tool Poisoning),这不是正则表达式能判断的,必须用另一个 LLM 来评估。

这就是 A.I.G 的核心机制:用 LLM 检查 LLM 生态系统的安全性,形成一种"以 AI 制 AI"的检测闭环。SkillTrustBench 基准测试也印证了这一点——不同 LLM 作为检测引擎时 F1/FPR 差异显著,说明检测质量本身就依赖检测用 LLM 的推理能力。


三、功能全景与分层架构

A.I.G 的五大扫描能力可以按攻击面分为三层:

3.1 AI 基础设施层(静态漏洞)

AI Infra Vulnerability Scan:识别 130+ AI 框架组件(Ollama、vLLM、ComfyUI、n8n、Triton Inference Server 等),匹配 2000+ CVE 规则,通过连接运行中的服务进行指纹识别。

# 通过统一 CLI 运行基础设施扫描
./ai-infra-guard api-checker audit
# 访问 http://localhost:8088 查看 Web 界面

3.2 AI 应用/工具链层(语义威胁)

MCP Scan + Skill Scan:这是最具原创性的模块,覆盖 14 大 MCP 风险类别(其中明确披露 6 类:间接提示词注入、工具投毒、SSRF、授权绕过、数据泄露、Agent Skill 意图错位)。

Skill Scan 使用 SkillTrustBench T01–T09 分类体系,九类风险覆盖从指令层到依赖链:

层级风险类型
A · 指令与记忆T01 技能指令劫持、T02 记忆投毒
B · 代码执行T03 远程载荷下载执行、T04 嵌入恶意代码
C · 系统权限T05 权限提升与越权访问、T06 系统持久化
D · 工具链与依赖T07 工具劫持与欺骗、T08 不安全依赖
E · 代码质量T09 不安全编码实践
# pip 方式安装 Skill 扫描工具,可接入 CI/CD
pip install aig-skill-scan
export LLM_API_KEY="your-api-key"
aig-skill-scan --repo /path/to/skill -m deepseek-v4-flash --language en -o result.json

3.3 模型/API 层(身份与合规)

Model and API Relay Checker:模型指纹识别、Claude 签名验证、中继黑盒审计、PAMELA 和 Vendor QTest——这是业内极罕见的能力,专门解决"供应商声称在用 Claude,但实际上是否真的在用?"这类合规验证问题。

Jailbreak Evaluation:支持多轮越狱攻击测试(Many-Shot、PAIR、GOAT、ActorAttack),可跨模型比较,用于评估自研/部署模型的提示词鲁棒性。


四、SkillTrustBench 基准:不同 LLM 引擎的扫描质量差异

这组数据值得仔细读,不能只看 F1 排名:

模型F1精确率召回率假阳性率 (FPR)
Claude Opus 4.60.98480.97250.99740.0663
Gemini 3.5 Flash0.97920.99470.96410.0120
DeepSeek v4 Flash0.97400.98680.96150.0301

关键判断:Claude Opus 4.6 的 F1 最高,但 FPR 是 Gemini 3.5 Flash 的 5.5 倍。在安全人工审查资源充足时,优先选高召回率(Claude);在大规模自动化扫描、需要减少噪音时,低 FPR(Gemini)更有实际价值。DeepSeek v4 Flash 在两项指标上均衡,且成本可能最低——适合中等规模的 CI/CD 集成场景。


五、交叉验证

来源一:Mycelium Protocol 博客(blog.mushroom.cv,独立技术分析,非腾讯官方渠道)

认同原文核心功能描述,并做出了独立的实质性补充判断:

  • 将 MCP 扫描定位为"v4.x 系列最有特色的新能力",指出这是针对 MCP 特定攻击面的专门设计而非通用扫描的延伸;
  • 对 Black Hat EU 2025 Arsenal 展出给予独立验证——视为安全社区对工具实用性的第三方背书;
  • 与原文立场一致但补充了局限:明确指出无认证机制是"硬约束",SkillJack 项目细节缺失是"文档不完整"的具体证据;
  • FPR 权衡问题的表述颇为精准:"高 FPR 导致安全摩擦,低 FPR 牺牲召回率导致真实威胁漏检,两种极端都不是普适答案。"

来源二:AugmentCode MCP 工具评测页面(augmentcode.com,第三方 MCP 生态工具目录)

同样认同 A.I.G 对 MCP 安全的覆盖价值,但提供了更直接的竞品对比视角

  • 相比 Promptfoo(CI/CD 原生集成更好):A.I.G 的 MCP 覆盖深度更强,但 DevOps 工作流集成成熟度稍逊;
  • 相比 Trivy/Grype(容器/供应链扫描):互补关系而非替代,建议叠加使用;
  • 补充了原文未提的问题:LLM 依赖导致扫描结果非确定性(同样的代码两次扫描结果可能不同),以及 API 成本和速度瓶颈在高并发场景下的实际影响。

两个独立信源的共同结论:A.I.G 填补了真实空白,但不是生产级开箱即用的工具,而是需要基础设施配套(内网隔离、认证层、误报管理流程)才能落地的平台


六、局限与被高估的部分

必须诚实指出以下边界条件,原文 README 对此有所提及但未充分强调:

  1. 无认证机制是硬伤:官方文档明确说"不应部署在公网",但这意味着所有 SaaS 化、云端集成、远程团队协作的场景都被堵死。需要自建反向代理或 API 网关来补充认证层。

  2. LLM 依赖带来三重成本:API 费用(持续扫描的真实开销)、不确定性(非确定性结果难以在 CI/CD 中设置硬性阈值)、速度(大型代码库扫描可能成为流水线瓶颈)。

  3. 14 类 MCP 风险的完整列表未公开:只披露了 6 类,这在对 A.I.G 做安全合规基线评估时是信息不对称问题。

  4. SkillJack 研究项目细节缺失:v4.5.2 新增功能,但 README 未展开,使用者无法独立评估其可靠性。

  5. 版本号跳跃现象值得关注:从 v2.3(2025 年 7 月)到 v4.5.2(2026 年 8 月)的快速迭代,表明产品处于高速变化期,今天的功能文档可能很快过时。


七、个人启发与行动建议

对安全工程师:现在就应该开始学习 MCP/Agent Skill 的威胁模型(T01–T09),而不是等"AI 安全"成为主流话题再追。A.I.G 的 SkillTrustBench 分类体系是目前公开的最系统化的框架之一,值得作为内部安全评审标准的参考基线。

对 AI/Agent 开发者:在发布任何对外 MCP Server 或 Skill 前,用 aig-skill-scan 做一次扫描应该成为标准流程。它的 pip 包形式和 CLI 接口完全适合嵌入 GitHub Actions:

# 示例:在 CI/CD 中集成 Skill 扫描
- name: AI Security Scan
  run: |
    pip install aig-skill-scan
    aig-skill-scan --repo . -m deepseek-v4-flash -o scan-result.json

对企业决策者:A.I.G 目前适合内部安全团队的红队评估和定期审计,不适合作为生产级实时防护系统部署。短期行动是:在内网部署一套,用于审计现有 AI 基础设施(特别是 Ollama/ComfyUI/vLLM 节点)的 CVE 暴露情况。

对普通开发者:如果你正在构建或使用 MCP 插件,"工具投毒"(Tool Poisoning)是目前最值得立即理解的攻击向量——攻击者可以通过修改工具描述文字,让你的 AI Agent 在不知情的情况下执行恶意操作,且传统代码审查完全看不出来。


延伸思考

  1. "以 AI 制 AI"的检测闭环是否可靠? 如果攻击者知道 A.I.G 使用特定 LLM 进行检测,他们是否可以构造专门绕过该检测 LLM 推理的恶意 Skill?对抗性样本在图像识别领域早已证明这是可行的——AI 安全工具本身的对抗鲁棒性是下一个值得研究的问题。

  2. MCP 生态的安全责任归属问题:当一个恶意 MCP Server 导致企业 Agent 泄露数据,责任在 MCP Server 开发者、Agent 平台、还是企业运维方?A.I.G 提供了扫描工具,但行业尚无对应的责任标准和合规框架——这个真空需要被填补。

  3. 低 FPR 模型(如 Gemini 3.5 Flash)在大规模自动扫描中的价值是否被低估? 当前基准评测以 F1 为主要排名指标,但在 CI/CD 自动化场景中,一个高 FPR 的扫描工具会因为噪音过多而被开发团队忽略或绕过——安全工具的"执行合规率"可能比"理论检测率"更能决定实际安全效果。


📚 参考来源

  1. GitHub - Tencent/AI-Infra-Guard: A full-stack AI Red Teaming platform securing AI ecosystems via Agent Scan, Skills Scan, MCP scan, AI Infra scan and LLM jailbreak evaluation. · GitHub
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

星核 AI 实验室

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值