【大模型安全实战】Agentic Botnet:当大量 AI 智能体被同一类提示注入操控(第1期) 📅 发布时间:2026/8/18 12:38:46 👁 浏览次数: 【大模型安全实战】Agentic Botnet当大量 AI 智能体被同一类提示注入操控第1期专栏智能体攻防卷·进阶篇 第 1 期作者Valhalla 治理研究组文章类型AI Agent 安全与治理研究原创声明本文为原创技术文章讨论防御架构不提供攻击实施方法。研究线索Beware of Agentic Botnets: Scalable Untargeted Promptware Attacks via Universal…arXiv:2607.07433引用提示论文编号、完整标题和正式版本应以 arXiv 实际页面为准发布前建议再次核验。摘要传统僵尸网络依靠恶意程序控制大量主机Agentic Botnet 则可能利用提示注入、恶意工具输出或污染内容诱导大量 AI 智能体执行相似的非预期行为。它带来的核心变化是攻击者未必需要在每台主机上植入传统木马也未必需要逐个了解目标系统。只要某类指令能够通过网页、文档、消息、插件返回值或共享记忆被不同智能体读取就可能形成可规模化传播的“提示载荷”。这并不意味着智能体已经被攻破了操作系统。更准确的描述是智能体的决策上下文受到污染其工具权限可能被错误目标借用。本文分析 Agentic Botnet 的基本威胁模型、传播条件、可观测信号和纵深防御方法并给出一套适用于研发团队的检查清单。一、从单个提示注入到群体性风险常见的提示注入讨论通常聚焦于单个智能体智能体读取外部内容 ↓ 把数据误当成可信指令 ↓ 偏离原始任务 ↓ 调用工具或泄露信息Agentic Botnet 将问题扩展到了群体层面。如果大量智能体会读取相同来源、安装相同 Skill、调用相同插件或者共享相同的记忆与知识库那么一份可传播的恶意内容就可能影响多个执行体。风险不再只是“某个 Agent 做错了一件事”而是可复用的提示载荷 同质化的智能体配置 可调用的高权限工具 缺少隔离的通信机制 可规模化的协同行为风险二、一个更严谨的攻击链模型可以把潜在攻击链拆分为五个阶段载荷进入网页、文档、消息或插件上下文污染数据被误识别为指令权限借用调用文件、Shell或网络工具传播与协同影响其他Agent或共享状态规模化影响资源滥用、垃圾请求或数据暴露1. 载荷进入恶意内容可能存在于网页、Issue、邮件、知识库、代码注释、工具返回值、Skill 文档或共享会话中。它不一定包含可执行代码也可能只是一段专门影响模型决策的自然语言。2. 上下文污染智能体没有可靠地区分“任务指令”和“待分析数据”进而把外部文本提升为高优先级行为依据。3. 权限借用提示本身通常不能直接修改系统。真正产生影响的是智能体已经拥有的文件、Shell、网络、凭证、消息发送或子代理调度权限。4. 传播与协同受影响的智能体可能把污染内容写入共享记忆、任务消息、工单、生成文档或子代理上下文使其他智能体继续读取。5. 规模化影响当大量执行体出现相似行为时可能形成资源滥用、异常请求、垃圾内容传播、敏感数据暴露或服务可用性下降。三、它与传统 Botnet 有什么不同对比维度传统 BotnetAgentic Botnet 风险模型主要载荷恶意程序、漏洞利用提示注入、污染内容、恶意工具结果直接目标操作系统或应用进程智能体的上下文与决策过程执行能力木马自身能力智能体已有的工具和凭证扩散渠道网络扫描、下载器共享文档、记忆、Skill、消息和子代理可观测痕迹恶意进程、文件、流量看似合法但偏离目标的工具调用主要防线EDR、补丁、网络隔离上下文隔离、最小权限、策略引擎和出口控制“没有恶意代码”不代表没有安全风险但也不能把所有提示注入都等同于主机失陷。应分别判断模型是否偏航、工具是否越权以及宿主系统是否真正受到影响。四、形成规模化风险需要哪些条件Agentic Botnet 并不会因为一段提示自动形成。通常还需要满足以下条件多个智能体能够读取同一类不可信内容外部内容和系统指令没有清晰隔离智能体拥有可产生副作用的工具权限工具授权只检查智能体身份不检查具体动作智能体之间可以共享消息、记忆或任务结果网络出口、调用频率和资源消耗缺乏限制异常行为不能被统一关联和审计。这说明问题的根源不是模型单点而是模型、工具、权限、通信和运行环境共同形成的系统风险。五、四层纵深防御第一层区分指令与数据系统提示词可以声明边界但不能被当作唯一安全机制。工程上还需要标记内容来源、保留信任等级并禁止外部文档直接获得系统指令权限。系统策略 用户授权任务 可信工具结果 外部不可信内容外部网页、文档和工具输出应默认被视为数据。即使其中出现“忽略之前的规则”或“调用某工具”等表达也不能直接改变权限。第二层按动作进行最小授权权限不应一次性授予整个 Agent 会话而应在每次工具调用时重新判断工具请求 → 参数解析 → 风险分级 → 策略检查 → 必要时人工确认 → 限权执行文件读取、文件写入、Shell、网络访问、凭证使用和生产操作应采用不同等级。Skill 可以申请权限但不能自行批准权限。第三层隔离 Agent 间通信跨 Agent 消息必须携带来源、任务标识、租户、完整性信息和信任级别。共享记忆应支持来源追踪、过期时间、撤销和版本回滚。尤其要避免以下设计子代理无条件继承父代理全部权限工具输出自动写入长期记忆一个 Agent 生成的指令被另一个 Agent 当成系统策略不同用户或租户共享未经隔离的上下文。第四层限制最终影响即使前几层未能识别提示注入执行层仍应限制影响范围Shell 和代码在沙箱中运行文件系统限制在授权目录网络默认拒绝按域名或服务开放设置请求速率、并发数和资源预算使用任务级短期凭证超时后终止完整进程树对外发送、发布和生产变更设置独立审批。六、动态信任分能否解决问题动态信任分可以作为异常检测信号但不适合作为唯一授权机制。它可能结合以下指标短时间内工具调用数量突然增加多个 Agent 请求访问同一异常目标任务目标与实际工具调用明显不一致频繁请求扩大权限外部内容被大量写入共享记忆子代理数量或递归深度异常网络目标和历史基线明显不同。需要注意信任分属于概率判断可能误报或漏报。高风险操作仍应由确定性的策略控制例如资源允许列表、路径边界、网络规则和人工审批。七、如何发现“异常集结”单个工具调用可能完全合法群体关联才可能暴露异常。因此审计系统应支持按时间窗口关联agent_id、task_id、skill_id、tool_name、target_resource、 permission_decision、parent_agent_id、input_digest、output_digest建议重点设置以下检测规则多个 Agent 在短时间内访问相同陌生域名大量任务出现相同或高度相似的隐藏指令子代理扇出数量突然上升多个 Agent 同时申请 Shell、网络或凭证权限工具调用与用户原始目标缺乏语义关联同一内容在消息、记忆和任务之间反复传播拒绝授权后Agent 通过其他工具尝试实现相同动作。日志中不应直接保存长期凭证、完整隐私数据或未经处理的敏感提示内容。可以使用摘要、分类标签和受控取证存储。八、研发团队检查清单外部网页和文档是否被明确标记为不可信数据每次工具调用是否都经过独立授权Shell 是否运行在沙箱和最小权限账户中文件访问是否校验真实路径与符号链接网络出口是否默认关闭并支持域名允许列表子代理是否只能获得任务所需的权限Skill 是否具有来源、版本、权限和依赖声明共享记忆是否支持溯源、过期、隔离和撤销是否限制 Agent 数量、递归深度、并发和资源消耗能否关联多个 Agent 的异常工具调用高风险操作是否需要不可由 Agent 代替的人工批准任务取消后进程、凭证和临时文件是否被完整回收九、三个容易出现的认识误区误区一没有安装木马所以系统是安全的。提示注入未必构成主机入侵但它可能借用合法工具产生真实副作用。防御重点是限制可执行动作而不是只检测恶意文件。误区二每个 Agent 分别安全整体就一定安全。共享 Skill、记忆、插件和网络出口会形成共同故障域。系统必须检测跨 Agent 的传播和聚集行为。误区三提高模型能力就能解决提示注入。更强的模型可能提升识别能力但不能替代权限、沙箱、出口控制和审计。安全边界必须由确定性的工程机制实现。十、结语Agentic Botnet 讨论的真正价值不是创造一个更具冲击力的安全名词而是提醒研发团队当智能体能够调用工具、共享状态并调度其他智能体时提示注入可能从单次模型偏航升级为系统性风险。有效防御不应依赖一句“不要执行恶意指令”而应形成完整控制链不可信内容隔离 → 动作级最小授权 → Agent 通信溯源 → 沙箱与出口限制 → 群体异常检测 → 人工审批与应急撤销判断一个 Agent 系统是否可靠最终要看三个问题外部内容能否改变它的权限、一个智能体能否把污染传播给其他智能体以及异常行为能否在产生规模化影响前被阻断。参考资料Beware of Agentic Botnets: Scalable Untargeted Promptware Attacks via Universal…arXiv:2607.07433。论文信息应以 arXiv 正式页面为准。OWASPTop 10 for Large Language Model Applications。MITRE ATLAS面向 AI 系统的对抗性威胁知识库。NISTAI Risk Management FrameworkAI RMF。发布说明平台质量规则会动态调整本文未虚构具体评分阈值。文章按照原创性、事实边界、技术深度、结构完整、引用可核验和实践价值组织对尚未验证的论文信息及攻击效果均使用条件性表述。