【大模型安全实战】Agentic Botnet:当大量 AI 智能体被同一类提示注入操控(第1期)

【大模型安全实战】Agentic Botnet:当大量 AI 智能体被同一类提示注入操控(第1期)

专栏:智能体攻防卷·进阶篇 第 1 期
作者:Valhalla 治理研究组
文章类型:AI Agent 安全与治理研究
原创声明:本文为原创技术文章,讨论防御架构,不提供攻击实施方法。
研究线索Beware of Agentic Botnets: Scalable Untargeted Promptware Attacks via Universal…,arXiv:2607.07433
引用提示:论文编号、完整标题和正式版本应以 arXiv 实际页面为准,发布前建议再次核验。

摘要

传统僵尸网络依靠恶意程序控制大量主机,Agentic Botnet 则可能利用提示注入、恶意工具输出或污染内容,诱导大量 AI 智能体执行相似的非预期行为。

它带来的核心变化是:攻击者未必需要在每台主机上植入传统木马,也未必需要逐个了解目标系统。只要某类指令能够通过网页、文档、消息、插件返回值或共享记忆被不同智能体读取,就可能形成可规模化传播的“提示载荷”。

这并不意味着智能体已经被攻破了操作系统。更准确的描述是:智能体的决策上下文受到污染,其工具权限可能被错误目标借用。

本文分析 Agentic Botnet 的基本威胁模型、传播条件、可观测信号和纵深防御方法,并给出一套适用于研发团队的检查清单。

一、从单个提示注入到群体性风险

常见的提示注入讨论通常聚焦于单个智能体:

智能体读取外部内容
        ↓
把数据误当成可信指令
        ↓
偏离原始任务
        ↓
调用工具或泄露信息

Agentic Botnet 将问题扩展到了群体层面。如果大量智能体会读取相同来源、安装相同 Skill、调用相同插件,或者共享相同的记忆与知识库,那么一份可传播的恶意内容就可能影响多个执行体。

风险不再只是“某个 Agent 做错了一件事”,而是:

可复用的提示载荷
+ 同质化的智能体配置
+ 可调用的高权限工具
+ 缺少隔离的通信机制
= 可规模化的协同行为风险

二、一个更严谨的攻击链模型

可以把潜在攻击链拆分为五个阶段:

载荷进入
网页、文档、消息或插件

上下文污染
数据被误识别为指令

权限借用
调用文件、Shell或网络工具

传播与协同
影响其他Agent或共享状态

规模化影响
资源滥用、垃圾请求或数据暴露

1. 载荷进入

恶意内容可能存在于网页、Issue、邮件、知识库、代码注释、工具返回值、Skill 文档或共享会话中。它不一定包含可执行代码,也可能只是一段专门影响模型决策的自然语言。

2. 上下文污染

智能体没有可靠地区分“任务指令”和“待分析数据”,进而把外部文本提升为高优先级行为依据。

3. 权限借用

提示本身通常不能直接修改系统。真正产生影响的是智能体已经拥有的文件、Shell、网络、凭证、消息发送或子代理调度权限。

4. 传播与协同

受影响的智能体可能把污染内容写入共享记忆、任务消息、工单、生成文档或子代理上下文,使其他智能体继续读取。

5. 规模化影响

当大量执行体出现相似行为时,可能形成资源滥用、异常请求、垃圾内容传播、敏感数据暴露或服务可用性下降。

三、它与传统 Botnet 有什么不同?

对比维度传统 BotnetAgentic Botnet 风险模型
主要载荷恶意程序、漏洞利用提示注入、污染内容、恶意工具结果
直接目标操作系统或应用进程智能体的上下文与决策过程
执行能力木马自身能力智能体已有的工具和凭证
扩散渠道网络扫描、下载器共享文档、记忆、Skill、消息和子代理
可观测痕迹恶意进程、文件、流量看似合法但偏离目标的工具调用
主要防线EDR、补丁、网络隔离上下文隔离、最小权限、策略引擎和出口控制

“没有恶意代码”不代表没有安全风险,但也不能把所有提示注入都等同于主机失陷。应分别判断模型是否偏航、工具是否越权,以及宿主系统是否真正受到影响。

四、形成规模化风险需要哪些条件?

Agentic Botnet 并不会因为一段提示自动形成。通常还需要满足以下条件:

  1. 多个智能体能够读取同一类不可信内容;
  2. 外部内容和系统指令没有清晰隔离;
  3. 智能体拥有可产生副作用的工具权限;
  4. 工具授权只检查智能体身份,不检查具体动作;
  5. 智能体之间可以共享消息、记忆或任务结果;
  6. 网络出口、调用频率和资源消耗缺乏限制;
  7. 异常行为不能被统一关联和审计。

这说明问题的根源不是模型单点,而是模型、工具、权限、通信和运行环境共同形成的系统风险。

五、四层纵深防御

第一层:区分指令与数据

系统提示词可以声明边界,但不能被当作唯一安全机制。工程上还需要标记内容来源、保留信任等级,并禁止外部文档直接获得系统指令权限。

系统策略 > 用户授权任务 > 可信工具结果 > 外部不可信内容

外部网页、文档和工具输出应默认被视为数据。即使其中出现“忽略之前的规则”或“调用某工具”等表达,也不能直接改变权限。

第二层:按动作进行最小授权

权限不应一次性授予整个 Agent 会话,而应在每次工具调用时重新判断:

工具请求 → 参数解析 → 风险分级 → 策略检查 → 必要时人工确认 → 限权执行

文件读取、文件写入、Shell、网络访问、凭证使用和生产操作应采用不同等级。Skill 可以申请权限,但不能自行批准权限。

第三层:隔离 Agent 间通信

跨 Agent 消息必须携带来源、任务标识、租户、完整性信息和信任级别。共享记忆应支持来源追踪、过期时间、撤销和版本回滚。

尤其要避免以下设计:

  • 子代理无条件继承父代理全部权限;
  • 工具输出自动写入长期记忆;
  • 一个 Agent 生成的指令被另一个 Agent 当成系统策略;
  • 不同用户或租户共享未经隔离的上下文。

第四层:限制最终影响

即使前几层未能识别提示注入,执行层仍应限制影响范围:

  • Shell 和代码在沙箱中运行;
  • 文件系统限制在授权目录;
  • 网络默认拒绝,按域名或服务开放;
  • 设置请求速率、并发数和资源预算;
  • 使用任务级短期凭证;
  • 超时后终止完整进程树;
  • 对外发送、发布和生产变更设置独立审批。

六、动态信任分能否解决问题?

动态信任分可以作为异常检测信号,但不适合作为唯一授权机制。它可能结合以下指标:

  • 短时间内工具调用数量突然增加;
  • 多个 Agent 请求访问同一异常目标;
  • 任务目标与实际工具调用明显不一致;
  • 频繁请求扩大权限;
  • 外部内容被大量写入共享记忆;
  • 子代理数量或递归深度异常;
  • 网络目标和历史基线明显不同。

需要注意,信任分属于概率判断,可能误报或漏报。高风险操作仍应由确定性的策略控制,例如资源允许列表、路径边界、网络规则和人工审批。

七、如何发现“异常集结”?

单个工具调用可能完全合法,群体关联才可能暴露异常。因此,审计系统应支持按时间窗口关联:

agent_id、task_id、skill_id、tool_name、target_resource、
permission_decision、parent_agent_id、input_digest、output_digest

建议重点设置以下检测规则:

  • 多个 Agent 在短时间内访问相同陌生域名;
  • 大量任务出现相同或高度相似的隐藏指令;
  • 子代理扇出数量突然上升;
  • 多个 Agent 同时申请 Shell、网络或凭证权限;
  • 工具调用与用户原始目标缺乏语义关联;
  • 同一内容在消息、记忆和任务之间反复传播;
  • 拒绝授权后,Agent 通过其他工具尝试实现相同动作。

日志中不应直接保存长期凭证、完整隐私数据或未经处理的敏感提示内容。可以使用摘要、分类标签和受控取证存储。

八、研发团队检查清单

  • 外部网页和文档是否被明确标记为不可信数据?
  • 每次工具调用是否都经过独立授权?
  • Shell 是否运行在沙箱和最小权限账户中?
  • 文件访问是否校验真实路径与符号链接?
  • 网络出口是否默认关闭并支持域名允许列表?
  • 子代理是否只能获得任务所需的权限?
  • Skill 是否具有来源、版本、权限和依赖声明?
  • 共享记忆是否支持溯源、过期、隔离和撤销?
  • 是否限制 Agent 数量、递归深度、并发和资源消耗?
  • 能否关联多个 Agent 的异常工具调用?
  • 高风险操作是否需要不可由 Agent 代替的人工批准?
  • 任务取消后,进程、凭证和临时文件是否被完整回收?

九、三个容易出现的认识误区

误区一:没有安装木马,所以系统是安全的。
提示注入未必构成主机入侵,但它可能借用合法工具产生真实副作用。防御重点是限制可执行动作,而不是只检测恶意文件。

误区二:每个 Agent 分别安全,整体就一定安全。
共享 Skill、记忆、插件和网络出口会形成共同故障域。系统必须检测跨 Agent 的传播和聚集行为。

误区三:提高模型能力就能解决提示注入。
更强的模型可能提升识别能力,但不能替代权限、沙箱、出口控制和审计。安全边界必须由确定性的工程机制实现。

十、结语

Agentic Botnet 讨论的真正价值,不是创造一个更具冲击力的安全名词,而是提醒研发团队:当智能体能够调用工具、共享状态并调度其他智能体时,提示注入可能从单次模型偏航升级为系统性风险。

有效防御不应依赖一句“不要执行恶意指令”,而应形成完整控制链:

不可信内容隔离
→ 动作级最小授权
→ Agent 通信溯源
→ 沙箱与出口限制
→ 群体异常检测
→ 人工审批与应急撤销

判断一个 Agent 系统是否可靠,最终要看三个问题:外部内容能否改变它的权限、一个智能体能否把污染传播给其他智能体,以及异常行为能否在产生规模化影响前被阻断。

参考资料

  1. Beware of Agentic Botnets: Scalable Untargeted Promptware Attacks via Universal…,arXiv:2607.07433。论文信息应以 arXiv 正式页面为准。
  2. OWASP,Top 10 for Large Language Model Applications
  3. MITRE ATLAS,面向 AI 系统的对抗性威胁知识库。
  4. NIST,AI Risk Management Framework(AI RMF)

发布说明:平台质量规则会动态调整,本文未虚构具体评分阈值。文章按照原创性、事实边界、技术深度、结构完整、引用可核验和实践价值组织;对尚未验证的论文信息及攻击效果均使用条件性表述。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

TunerT_TQ

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值