【大模型安全实战】Agentic Botnet:当大量 AI 智能体被同一类提示注入操控(第1期)
专栏:智能体攻防卷·进阶篇 第 1 期
作者:Valhalla 治理研究组
文章类型:AI Agent 安全与治理研究
原创声明:本文为原创技术文章,讨论防御架构,不提供攻击实施方法。
研究线索:Beware of Agentic Botnets: Scalable Untargeted Promptware Attacks via Universal…,arXiv:2607.07433
引用提示:论文编号、完整标题和正式版本应以 arXiv 实际页面为准,发布前建议再次核验。
摘要
传统僵尸网络依靠恶意程序控制大量主机,Agentic Botnet 则可能利用提示注入、恶意工具输出或污染内容,诱导大量 AI 智能体执行相似的非预期行为。
它带来的核心变化是:攻击者未必需要在每台主机上植入传统木马,也未必需要逐个了解目标系统。只要某类指令能够通过网页、文档、消息、插件返回值或共享记忆被不同智能体读取,就可能形成可规模化传播的“提示载荷”。
这并不意味着智能体已经被攻破了操作系统。更准确的描述是:智能体的决策上下文受到污染,其工具权限可能被错误目标借用。
本文分析 Agentic Botnet 的基本威胁模型、传播条件、可观测信号和纵深防御方法,并给出一套适用于研发团队的检查清单。
一、从单个提示注入到群体性风险
常见的提示注入讨论通常聚焦于单个智能体:
智能体读取外部内容
↓
把数据误当成可信指令
↓
偏离原始任务
↓
调用工具或泄露信息
Agentic Botnet 将问题扩展到了群体层面。如果大量智能体会读取相同来源、安装相同 Skill、调用相同插件,或者共享相同的记忆与知识库,那么一份可传播的恶意内容就可能影响多个执行体。
风险不再只是“某个 Agent 做错了一件事”,而是:
可复用的提示载荷
+ 同质化的智能体配置
+ 可调用的高权限工具
+ 缺少隔离的通信机制
= 可规模化的协同行为风险
二、一个更严谨的攻击链模型
可以把潜在攻击链拆分为五个阶段:
1. 载荷进入
恶意内容可能存在于网页、Issue、邮件、知识库、代码注释、工具返回值、Skill 文档或共享会话中。它不一定包含可执行代码,也可能只是一段专门影响模型决策的自然语言。
2. 上下文污染
智能体没有可靠地区分“任务指令”和“待分析数据”,进而把外部文本提升为高优先级行为依据。
3. 权限借用
提示本身通常不能直接修改系统。真正产生影响的是智能体已经拥有的文件、Shell、网络、凭证、消息发送或子代理调度权限。
4. 传播与协同
受影响的智能体可能把污染内容写入共享记忆、任务消息、工单、生成文档或子代理上下文,使其他智能体继续读取。
5. 规模化影响
当大量执行体出现相似行为时,可能形成资源滥用、异常请求、垃圾内容传播、敏感数据暴露或服务可用性下降。
三、它与传统 Botnet 有什么不同?
| 对比维度 | 传统 Botnet | Agentic Botnet 风险模型 |
|---|---|---|
| 主要载荷 | 恶意程序、漏洞利用 | 提示注入、污染内容、恶意工具结果 |
| 直接目标 | 操作系统或应用进程 | 智能体的上下文与决策过程 |
| 执行能力 | 木马自身能力 | 智能体已有的工具和凭证 |
| 扩散渠道 | 网络扫描、下载器 | 共享文档、记忆、Skill、消息和子代理 |
| 可观测痕迹 | 恶意进程、文件、流量 | 看似合法但偏离目标的工具调用 |
| 主要防线 | EDR、补丁、网络隔离 | 上下文隔离、最小权限、策略引擎和出口控制 |
“没有恶意代码”不代表没有安全风险,但也不能把所有提示注入都等同于主机失陷。应分别判断模型是否偏航、工具是否越权,以及宿主系统是否真正受到影响。
四、形成规模化风险需要哪些条件?
Agentic Botnet 并不会因为一段提示自动形成。通常还需要满足以下条件:
- 多个智能体能够读取同一类不可信内容;
- 外部内容和系统指令没有清晰隔离;
- 智能体拥有可产生副作用的工具权限;
- 工具授权只检查智能体身份,不检查具体动作;
- 智能体之间可以共享消息、记忆或任务结果;
- 网络出口、调用频率和资源消耗缺乏限制;
- 异常行为不能被统一关联和审计。
这说明问题的根源不是模型单点,而是模型、工具、权限、通信和运行环境共同形成的系统风险。
五、四层纵深防御
第一层:区分指令与数据
系统提示词可以声明边界,但不能被当作唯一安全机制。工程上还需要标记内容来源、保留信任等级,并禁止外部文档直接获得系统指令权限。
系统策略 > 用户授权任务 > 可信工具结果 > 外部不可信内容
外部网页、文档和工具输出应默认被视为数据。即使其中出现“忽略之前的规则”或“调用某工具”等表达,也不能直接改变权限。
第二层:按动作进行最小授权
权限不应一次性授予整个 Agent 会话,而应在每次工具调用时重新判断:
工具请求 → 参数解析 → 风险分级 → 策略检查 → 必要时人工确认 → 限权执行
文件读取、文件写入、Shell、网络访问、凭证使用和生产操作应采用不同等级。Skill 可以申请权限,但不能自行批准权限。
第三层:隔离 Agent 间通信
跨 Agent 消息必须携带来源、任务标识、租户、完整性信息和信任级别。共享记忆应支持来源追踪、过期时间、撤销和版本回滚。
尤其要避免以下设计:
- 子代理无条件继承父代理全部权限;
- 工具输出自动写入长期记忆;
- 一个 Agent 生成的指令被另一个 Agent 当成系统策略;
- 不同用户或租户共享未经隔离的上下文。
第四层:限制最终影响
即使前几层未能识别提示注入,执行层仍应限制影响范围:
- Shell 和代码在沙箱中运行;
- 文件系统限制在授权目录;
- 网络默认拒绝,按域名或服务开放;
- 设置请求速率、并发数和资源预算;
- 使用任务级短期凭证;
- 超时后终止完整进程树;
- 对外发送、发布和生产变更设置独立审批。
六、动态信任分能否解决问题?
动态信任分可以作为异常检测信号,但不适合作为唯一授权机制。它可能结合以下指标:
- 短时间内工具调用数量突然增加;
- 多个 Agent 请求访问同一异常目标;
- 任务目标与实际工具调用明显不一致;
- 频繁请求扩大权限;
- 外部内容被大量写入共享记忆;
- 子代理数量或递归深度异常;
- 网络目标和历史基线明显不同。
需要注意,信任分属于概率判断,可能误报或漏报。高风险操作仍应由确定性的策略控制,例如资源允许列表、路径边界、网络规则和人工审批。
七、如何发现“异常集结”?
单个工具调用可能完全合法,群体关联才可能暴露异常。因此,审计系统应支持按时间窗口关联:
agent_id、task_id、skill_id、tool_name、target_resource、
permission_decision、parent_agent_id、input_digest、output_digest
建议重点设置以下检测规则:
- 多个 Agent 在短时间内访问相同陌生域名;
- 大量任务出现相同或高度相似的隐藏指令;
- 子代理扇出数量突然上升;
- 多个 Agent 同时申请 Shell、网络或凭证权限;
- 工具调用与用户原始目标缺乏语义关联;
- 同一内容在消息、记忆和任务之间反复传播;
- 拒绝授权后,Agent 通过其他工具尝试实现相同动作。
日志中不应直接保存长期凭证、完整隐私数据或未经处理的敏感提示内容。可以使用摘要、分类标签和受控取证存储。
八、研发团队检查清单
- 外部网页和文档是否被明确标记为不可信数据?
- 每次工具调用是否都经过独立授权?
- Shell 是否运行在沙箱和最小权限账户中?
- 文件访问是否校验真实路径与符号链接?
- 网络出口是否默认关闭并支持域名允许列表?
- 子代理是否只能获得任务所需的权限?
- Skill 是否具有来源、版本、权限和依赖声明?
- 共享记忆是否支持溯源、过期、隔离和撤销?
- 是否限制 Agent 数量、递归深度、并发和资源消耗?
- 能否关联多个 Agent 的异常工具调用?
- 高风险操作是否需要不可由 Agent 代替的人工批准?
- 任务取消后,进程、凭证和临时文件是否被完整回收?
九、三个容易出现的认识误区
误区一:没有安装木马,所以系统是安全的。
提示注入未必构成主机入侵,但它可能借用合法工具产生真实副作用。防御重点是限制可执行动作,而不是只检测恶意文件。
误区二:每个 Agent 分别安全,整体就一定安全。
共享 Skill、记忆、插件和网络出口会形成共同故障域。系统必须检测跨 Agent 的传播和聚集行为。
误区三:提高模型能力就能解决提示注入。
更强的模型可能提升识别能力,但不能替代权限、沙箱、出口控制和审计。安全边界必须由确定性的工程机制实现。
十、结语
Agentic Botnet 讨论的真正价值,不是创造一个更具冲击力的安全名词,而是提醒研发团队:当智能体能够调用工具、共享状态并调度其他智能体时,提示注入可能从单次模型偏航升级为系统性风险。
有效防御不应依赖一句“不要执行恶意指令”,而应形成完整控制链:
不可信内容隔离
→ 动作级最小授权
→ Agent 通信溯源
→ 沙箱与出口限制
→ 群体异常检测
→ 人工审批与应急撤销
判断一个 Agent 系统是否可靠,最终要看三个问题:外部内容能否改变它的权限、一个智能体能否把污染传播给其他智能体,以及异常行为能否在产生规模化影响前被阻断。
参考资料
- Beware of Agentic Botnets: Scalable Untargeted Promptware Attacks via Universal…,arXiv:2607.07433。论文信息应以 arXiv 正式页面为准。
- OWASP,Top 10 for Large Language Model Applications。
- MITRE ATLAS,面向 AI 系统的对抗性威胁知识库。
- NIST,AI Risk Management Framework(AI RMF)。
发布说明:平台质量规则会动态调整,本文未虚构具体评分阈值。文章按照原创性、事实边界、技术深度、结构完整、引用可核验和实践价值组织;对尚未验证的论文信息及攻击效果均使用条件性表述。
1284

被折叠的 条评论
为什么被折叠?



