[论文学习]AgentVigil:面向LLM智能体的通用黑盒红队测试框架:间接提示注入攻击自动化发现与利用

发布时间:2026/7/30 4:18:22
[论文学习]AgentVigil:面向LLM智能体的通用黑盒红队测试框架:间接提示注入攻击自动化发现与利用 AgentVigil面向LLM智能体的通用黑盒红队测试框架——间接提示注入攻击自动化发现与利用论文重点AgentVigil是一个首个面向黑盒LLM智能体的通用间接提示注入漏洞自动化发现框架。该框架借鉴传统软件模糊测试思想通过蒙特卡洛树搜索MCTS驱动的种子选择算法与自适应评分策略在AgentDojo和VWA-adv两个公开基准上分别达到71%和70%的攻击成功率几乎翻倍了基线攻击的性能并展现出良好的跨任务、跨模型迁移能力。核心研究内容问题定义LLM智能体系统凭借其强大的规划和推理能力能够调用外部工具并与复杂环境交互。然而这也引入了一个关键安全风险——间接提示注入Indirect Prompt Injection攻击者将恶意指令注入智能体所交互的外部数据源如网页评论、邮件、日历事件等当智能体检索并处理这些外部数据时恶意指令便会“欺骗”智能体执行攻击者指定的任务而非原始的用户任务。系统性地评估智能体系统面临间接提示注入风险面临三大挑战黑盒特性真实世界的智能体多为黑盒系统无法访问其内部LLM或架构设计任务多样性智能体需要处理大量动态且各异的用户任务架构复杂性智能体通常由多种互联组件、工具和服务构成。现有方法要么依赖人工构造攻击指令要么仅针对特定类型的智能体设计无法作为通用评估方案。创新方法AgentVigil的核心创新在于将传统软件模糊测试Fuzzing的理念系统性地迁移到LLM智能体的安全评估领域并针对智能体场景的特殊挑战进行了三项关键设计高质量初始种子语料库从人工启发式规则、在线资源和现有提示注入研究中收集多样化攻击模板涵盖角色扮演、分隔符攻击、提示混淆等多种策略自适应种子评分策略采用混合评估机制结合攻击成功率ASR与覆盖度导向评估既奖励即时攻击效果也奖励能够覆盖之前失败任务的种子基于MCTS的种子选择算法使用UCB1算法动态识别和优先处理有价值的种子在探索exploration与利用exploitation之间取得平衡。此外框架设计了五种变异算子——缩短Shorten、扩展Expand、改写Rephrase、交叉Crossover和生成相似GenerateSimilar由辅助LLM如Llama-3-8B或GPT-4o-mini执行。研究成果基准测试性能在AgentDojo个人助理智能体和VWA-adv网页智能体两个基准上针对基于o3-mini和GPT-4o的智能体AgentVigil分别达到71%和70%的攻击成功率。相比之下AgentDojo中手工构造的基线攻击成功率仅为38%AgentVigil几乎翻倍了基线性能。迁移能力生成的对抗性提示在未见过的任务上对o3-mini和GPT-4o分别达到65%和59%的成功率对未曾参与模糊测试的Gemini-2-flash-exp模型仍达到67%的成功率。防御绕过针对AgentDojo中部署的多种防御策略包括ProtectAI的pi_detector、指令重复、分隔符等AgentVigil生成的对抗性提示均表现出显著的有效性。消融实验如图3所示去除高质量初始语料库或去除自适应种子评分与MCTS选择后覆盖度增长均显著下降验证了各组件的必要性。真实世界验证在实际环境中成功误导智能体导航至任意URL包括恶意网站或下载链接证明了方法的实际适用性。实际落地应用的可能性AgentVigil作为红队测试工具具有很高的实用价值。企业或安全团队可在部署LLM智能体之前使用该框架自动化评估系统对间接提示注入的脆弱性无需访问智能体内部实现——这完美契合了大多数商业智能体如OpenAI的Operator、Anthropic的Computer Use等的黑盒特性。框架的模块化设计也使其能够适配不同类型的智能体系统从个人助理到网页自动化代理均可覆盖。技术细节系统架构AgentVigil的整体架构如图2所示包含以下核心模块初始化种子语料库 → ┌─────────────────────────────────────┐ │ 迭代模糊测试循环 │ │ ┌─────────┐ ┌──────────┐ │ │ │ MCTS种子 │ → │ 种子变异 │ │ │ │ 选择器 │ │ 器 │ │ │ └─────────┘ └──────────┘ │ │ ↑ ↓ │ │ ┌─────────┐ ┌──────────┐ │ │ │ 种子存储 │ ← │ 评分器 │ │ │ └─────────┘ └──────────┘ │ └─────────────────────────────────────┘ ↓ 目标LLM智能体系统种子评分公式每个种子的最终得分计算为攻击成功率与覆盖度奖励的加权和Score ( s ) α ⋅ ASR ( s ) β ⋅ CoverageBonus ( s ) \text{Score}(s) \alpha \cdot \text{ASR}(s) \beta \cdot \text{CoverageBonus}(s)Score(s)α⋅ASR(s)β⋅CoverageBonus(s)其中ASR为成功攻击任务数与总任务数的比值CoverageBonus奖励那些能对之前失败任务实现成功攻击的种子。种子选择UCB1算法MCTS选择器使用UCB1算法平衡探索与利用UCB ( n o d e ) Q ( n o d e ) N ( n o d e ) c ⋅ ln ⁡ N ( p a r e n t ) N ( n o d e ) \text{UCB}(node) \frac{Q(node)}{N(node)} c \cdot \sqrt{\frac{\ln N(parent)}{N(node)}}UCB(node)N(node)Q(node)​c⋅N(node)lnN(parent)​​其中第一项为 exploitation节点经验性能第二项为 exploration bonus探索奖励确保访问较少但潜在价值高的分支得到充分关注。变异算子算子功能Shorten压缩种子使其更简洁Expand增加额外上下文信息Rephrase引入语言变体保持语义Crossover合成两个父种子的元素GenerateSimilar生成风格相似但内容不同的种子这些变异由辅助LLM执行仅需中等能力的模型如Llama-3-8B、GPT-4o-mini即可完成。研究设定威胁模型黑盒设定攻击者无法访问底层LLM的内部机制也无法获知智能体的架构设计用户假设用户为良性不与攻击者合谋攻击者能力可像合法用户一样与智能体交互通过操纵外部数据源如修改购物网站商品信息、篡改日历事件等实施间接注入攻击者反馈仅能通过环境检查获知攻击成功与否的二元信号。实验配置基准数据集AgentDojo个人助理智能体含142个fuzzing任务和173个测试任务和VWA-adv网页智能体目标模型o3-mini主要fuzzing目标、GPT-4o、GPT-4o-mini、Claude-3.5-Sonnet、Gemini-2-flash-exp辅助模型GPT-4o-mini作为helper LLM执行种子变异迭代设置每轮生成3个变异种子共完成10轮fuzzing迭代评估指标攻击成功率ASR和任务覆盖度。硬件/软件要求论文未明确列出具体硬件配置但从技术栈推断需要能够运行目标LLM智能体的环境API访问或本地部署辅助LLMGPT-4o-mini或Llama-3-8B用于执行变异操作基准评估框架AgentDojo、VWA-adv的环境支持。综合分析方法论贡献AgentVigil的最大贡献在于首次将模糊测试范式系统性地应用于LLM智能体的间接提示注入评估。与直接提示注入如GPTFuzzer不同间接提示注入中攻击者只能影响外部内容无法直接控制输入这极大限制了攻击能力。AgentVigil通过精心设计的初始种子、MCTS驱动的搜索和自适应评分成功在受限条件下实现了高效的漏洞发现。值得注意的是AgentVigil与GPTFuzzer存在本质差异GPTFuzzer针对的是直接提示注入jailbreak攻击者完全控制输入AgentVigil针对的是间接提示注入攻击者仅能影响外部数据源GPTFuzzer为单轮设定AgentVigil处理多步骤智能体。局限性与值得关注的发现模型鲁棒性差异显著实验显示Claude-3.5-Sonnet表现出极强的鲁棒性无论是基线攻击还是AgentVigil生成的对抗性提示均对其无效。这提示不同模型家族在对抗间接提示注入方面存在显著差异值得进一步研究其背后的机制差异。防御的脆弱性AgentVigil能够有效绕过多种现有防御包括专用检测器、指令重复、分隔符等说明当前防御手段在面对自动化、自适应生成的攻击时仍显不足。黑盒设定的实际意义真实世界的商业智能体如OpenAI的Operator均为黑盒系统AgentVigil无需内部访问即可工作的特性使其具有高度的实际应用价值。迁移能力的双面性生成的对抗性提示能够在不同任务和不同LLM之间迁移这既说明了攻击方法的通用性也意味着一旦某个智能体被攻破同一攻击模式可能被复用于其他系统。与安全社区的启示这项工作实际上揭示了一个更深层的问题LLM智能体的“上下文污染”风险。传统软件安全中我们关注代码注入而在LLM智能体时代“提示注入”成为了新的注入攻击范式。AgentVigil的自动化框架表明这种攻击并非偶发的、需要专家手工构造的而是可以通过系统化的模糊测试大规模发现和利用的。这对于整个LLM智能体生态的安全设计提出了严峻挑战。实践应用1. 企业安全评估企业在部署基于LLM的智能体系统如客服机器人、自动化办公助理、网页自动化代理之前可使用AgentVigil进行自动化红队测试将智能体接入AgentVigil框架定义与业务相关的用户任务和攻击目标运行fuzzing循环识别系统脆弱点根据发现的漏洞加固系统如加强外部数据源的过滤、增加工具调用验证等。2. 安全产品开发安全厂商可将AgentVigil的方法论集成到LLM安全评估平台中为客户提供黑盒安全审计服务。由于AgentVigil不依赖内部访问非常适合作为SaaS形式的检测服务。3. 防御策略验证当开发新的防御机制时可使用AgentVigil作为对抗性评估工具验证防御在不同攻击策略下的有效性。实验表明现有防御在AgentVigil面前表现不佳这恰恰说明需要更强大的防御方案。4. 注意事项与伦理考量AgentVigil本质上是攻击工具其使用必须遵循负责任的披露原则仅在授权环境下对自己的系统进行测试发现的漏洞应通过负责任渠道向相关方披露不应将生成的对抗性提示用于未经授权的实际攻击。参考资料来源原始论文: AgentVigil: Generic Black-Box Red-teaming for Indirect Prompt Injection against LLM Agents (arXiv:2505.05849v4, Jun 2025)PDF全文: https://arxiv.org/pdf/2505.05849