CAITLYN瞄准Agent投毒风险:从漏检样本自动合成防御技能

CAITLYN瞄准Agent投毒风险:从漏检样本自动合成防御技能

N
News Editor
2026-09-14 09:48:08
研究人员提出面向 LLM Agent 的自进化安全中间件 CAITLYN,试图应对网页、搜索结果、本地文件、API 返回值等外部内容中夹带的 prompt injection 攻击。该系统采用运行时分层拦截与反例驱动进化两层架构,把漏检案例转化为新的防御技能并写回共享防御库。实验覆盖 AgentDojo-S250、ASPI-S、SafeClawBench-S240 及 Emerging 设置,在 Emerging attack 场景下,新增防御技能后攻击成功率下降约 40 个百分点。

AI Agent 已不再只是聊天窗口里的对话模型。它们开始接入浏览器、文件系统、终端、API、MCP 服务以及各类自动化工作流,直接替用户执行任务。问题也随之扩大:Agent 不只接收用户输入,还会主动读取外部内容,而这些内容会进入上下文,影响下一步动作。

CAITLYN瞄准Agent投毒风险:从漏检样本自动合成防御技能 2

在这一设定下,搜索结果、网页正文、本地文件、工具返回值、日志、README 以及 API payload,都可能成为攻击入口。一句藏在网页里的恶意指令,隐蔽性可能高于显式攻击 prompt,风险也更高。

外部信息越多,Agent 的投毒入口越多

传统 prompt injection 往往被理解为用户直接输入的恶意提示词,但在 Agent 场景中,攻击载体可以变得更分散,也更难察觉。它可能出现在网页隐藏文本里,也可能是一条搜索结果摘要、一个本地 Markdown 文件中的说明,或者某次 API 调用返回的字段。

这些内容表面上只是普通资料,实际却可能夹带「忽略原有指令」「调用某个工具」「泄露文件内容」「改变下一步计划」等恶意目标。只要 Agent 把它们当成可信指令,就可能在用户不知情的情况下执行错误动作。

CAITLYN瞄准Agent投毒风险:从漏检样本自动合成防御技能 3

这也带来一个新的安全悖论:Agent 能力越强,对外部信息的依赖越深;外部上下文越丰富,攻击者可利用的投毒入口也越多。

CAITLYN 的核心思路:先拦截,再把漏检变成防御能力

为应对这一问题,研究人员提出 CAITLYN。论文介绍的核心思路不是把 Agent 放在静态防火墙后面被动防守,而是让系统在遇到新型攻击后,自动总结失败案例,合成新的防御技能,并把这些技能沉淀进可复用的 defense skill library。

换句话说,CAITLYN 不是一次性写好的规则墙,而是一套会持续进化的 Agent 安全中间件:前端负责拦截攻击,后端吸收失败案例,再把漏网样本反过来变成新的武器。

从整体框架看,CAITLYN 由两部分组成:快速运行时防御,以及反例驱动的防御进化。

CAITLYN瞄准Agent投毒风险:从漏检样本自动合成防御技能 4

System I:秒级运行时防御

CAITLYN 的第一层是 System I,也就是快速运行时防御。外部内容首先进入 Tier-0 过滤器,这一层使用可执行脚本、签名规则和启发式检测等低成本防御技能,优先处理高置信度风险。

命中后,系统会直接拦截;没有命中的输入,才会进入下一步更复杂的判断流程。这样的设计重点不在于让大模型接管一切,而是先用低成本手段处理明显风险。

对于更模糊、更难判断的内容,CAITLYN 会调用 Tier-1 LLM classifier。大模型只被放在需要语义判断的位置,用来平衡成本、延迟与检测能力。

System II:反例驱动的防御进化

如果新型攻击绕过现有防线,System II 会接手后续过程。系统会把这些 miss cases 转化为 counter examples,再通过构造提示、合成防御技能、沙箱验证、审查和写回流程,生成新的防御条目。

CAITLYN瞄准Agent投毒风险:从漏检样本自动合成防御技能 5

CAITLYN 的关键点就在这里:一次被绕过的攻击,不再只是失败日志,而会被转化为下一轮防御合成的输入。每一次 miss,都会被炼成下一条 defense skill。

新生成的防御并不会被直接写入系统。它需要经过验证和审查,既要能拦住对应攻击,也要尽量避免误伤正常内容。通过审核的技能会写回共享防御库,供后续 Agent 调用。

这使 CAITLYN 更接近一个持续更新的安全中间件,而不是单点检测器。人工维护规则库的压力,也部分转化为系统从反例中学习和合成的过程。

实验覆盖多个 Agent 与攻击设置

研究人员在多个 Agent 和攻击设置中评估了 CAITLYN,包括 AgentDojo-S250、ASPI-S、SafeClawBench-S240,以及更强调新攻击适应能力的 Emerging 设置。

CAITLYN瞄准Agent投毒风险:从漏检样本自动合成防御技能 6

实验结果显示,CAITLYN 在保持低误报率的同时,能够显著降低攻击成功率。尤其是在 Emerging attack 场景中,静态防御仍然容易被绕过,而 CAITLYN-evolved 通过新增防御技能,把攻击成功率降低约 40 个百分点。

在顺序合成设置中,CAITLYN 还展示了持续积累能力。随着新攻击逐步暴露,系统会不断合成 active skills,并将其加入防御库。

真实 Agent 系统不只要求准,还要求快和省

论文指出,在真实 Agent 系统中,安全模块不能只追求准确率,还必须足够快、足够便宜、足够容易部署,否则就会成为整个工作流的瓶颈。

基于这一现实约束,CAITLYN 采用分层设计:低成本技能优先处理常见风险,LLM 只在复杂 case 中介入,长期进化模块则把新攻击沉淀为未来可快速调用的技能。

CAITLYN瞄准Agent投毒风险:从漏检样本自动合成防御技能 7

Prompt injection 被重新定义为系统安全问题

文章认为,到了 Agent 时代,prompt injection 已不再只是 prompt 层面的对抗技巧,而是系统安全问题。原因很直接:Agent 能读文件、访问网页、调用工具,外部内容也就能影响它的决策路径。

更麻烦的是,攻击未必长得像攻击。它可能是一段网页说明、一个搜索结果摘要、一个 README 文件、一段 API 返回文本,甚至是某个工具返回的日志。Agent 对外部上下文越依赖,攻击面就越大。

在这一点上,CAITLYN 的意义在于把防御方式从「人写规则」推进到「系统从失败中合成规则」。一次攻击绕过防线后,它不只是一次失败记录,也会变成下一轮防御进化的训练材料。

论文列出的主要贡献

  • 提出 CAITLYN,一套面向 LLM Agent 的自进化防御中间件,用于应对不断出现的新型 prompt injection 攻击。
  • 设计 System I + System II 双层架构,将快速运行时扫描、LLM 分类和反例驱动防御合成结合起来。
  • 构建可复用的 defense skill library,使防御能力能够从单次失败中积累,并在后续任务中复用。
  • 在多类 Agent 和攻击设置中验证系统有效性,Emerging attack 场景下攻击成功率下降约 40 个百分点。

更长任务链和更复杂环境,会继续放大安全边界问题

文章最后提到,AI Agent 的发展方向是更强的工具使用能力、更长的任务链和更复杂的外部环境。这些能力会带来效率,也会同步扩大攻击面。

CAITLYN瞄准Agent投毒风险:从漏检样本自动合成防御技能 8

未来的 Agent 安全系统,不能停留在单次输入审查,也不能完全依赖人工维护规则。它需要像免疫系统一样,区分哪些内容可以信任、哪些内容应该拦截,以及哪些失败案例需要被记住并转化为新的防御能力。

当攻击不断变异,防御系统也必须学会进化。

本文来自微信公众号「新智元」,作者为新智元。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
100

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。