AI Agent 已不再只是聊天窗口里的对话模型。它们开始接入浏览器、文件系统、终端、API、MCP 服务以及各类自动化工作流,直接替用户执行任务。问题也随之扩大:Agent 不只接收用户输入,还会主动读取外部内容,而这些内容会进入上下文,影响下一步动作。

在这一设定下,搜索结果、网页正文、本地文件、工具返回值、日志、README 以及 API payload,都可能成为攻击入口。一句藏在网页里的恶意指令,隐蔽性可能高于显式攻击 prompt,风险也更高。
外部信息越多,Agent 的投毒入口越多
传统 prompt injection 往往被理解为用户直接输入的恶意提示词,但在 Agent 场景中,攻击载体可以变得更分散,也更难察觉。它可能出现在网页隐藏文本里,也可能是一条搜索结果摘要、一个本地 Markdown 文件中的说明,或者某次 API 调用返回的字段。
这些内容表面上只是普通资料,实际却可能夹带「忽略原有指令」「调用某个工具」「泄露文件内容」「改变下一步计划」等恶意目标。只要 Agent 把它们当成可信指令,就可能在用户不知情的情况下执行错误动作。

这也带来一个新的安全悖论:Agent 能力越强,对外部信息的依赖越深;外部上下文越丰富,攻击者可利用的投毒入口也越多。
CAITLYN 的核心思路:先拦截,再把漏检变成防御能力
为应对这一问题,研究人员提出 CAITLYN。论文介绍的核心思路不是把 Agent 放在静态防火墙后面被动防守,而是让系统在遇到新型攻击后,自动总结失败案例,合成新的防御技能,并把这些技能沉淀进可复用的 defense skill library。
换句话说,CAITLYN 不是一次性写好的规则墙,而是一套会持续进化的 Agent 安全中间件:前端负责拦截攻击,后端吸收失败案例,再把漏网样本反过来变成新的武器。
从整体框架看,CAITLYN 由两部分组成:快速运行时防御,以及反例驱动的防御进化。

System I:秒级运行时防御
CAITLYN 的第一层是 System I,也就是快速运行时防御。外部内容首先进入 Tier-0 过滤器,这一层使用可执行脚本、签名规则和启发式检测等低成本防御技能,优先处理高置信度风险。
命中后,系统会直接拦截;没有命中的输入,才会进入下一步更复杂的判断流程。这样的设计重点不在于让大模型接管一切,而是先用低成本手段处理明显风险。
对于更模糊、更难判断的内容,CAITLYN 会调用 Tier-1 LLM classifier。大模型只被放在需要语义判断的位置,用来平衡成本、延迟与检测能力。
System II:反例驱动的防御进化
如果新型攻击绕过现有防线,System II 会接手后续过程。系统会把这些 miss cases 转化为 counter examples,再通过构造提示、合成防御技能、沙箱验证、审查和写回流程,生成新的防御条目。

CAITLYN 的关键点就在这里:一次被绕过的攻击,不再只是失败日志,而会被转化为下一轮防御合成的输入。每一次 miss,都会被炼成下一条 defense skill。
新生成的防御并不会被直接写入系统。它需要经过验证和审查,既要能拦住对应攻击,也要尽量避免误伤正常内容。通过审核的技能会写回共享防御库,供后续 Agent 调用。
这使 CAITLYN 更接近一个持续更新的安全中间件,而不是单点检测器。人工维护规则库的压力,也部分转化为系统从反例中学习和合成的过程。
实验覆盖多个 Agent 与攻击设置
研究人员在多个 Agent 和攻击设置中评估了 CAITLYN,包括 AgentDojo-S250、ASPI-S、SafeClawBench-S240,以及更强调新攻击适应能力的 Emerging 设置。

实验结果显示,CAITLYN 在保持低误报率的同时,能够显著降低攻击成功率。尤其是在 Emerging attack 场景中,静态防御仍然容易被绕过,而 CAITLYN-evolved 通过新增防御技能,把攻击成功率降低约 40 个百分点。
在顺序合成设置中,CAITLYN 还展示了持续积累能力。随着新攻击逐步暴露,系统会不断合成 active skills,并将其加入防御库。
真实 Agent 系统不只要求准,还要求快和省
论文指出,在真实 Agent 系统中,安全模块不能只追求准确率,还必须足够快、足够便宜、足够容易部署,否则就会成为整个工作流的瓶颈。
基于这一现实约束,CAITLYN 采用分层设计:低成本技能优先处理常见风险,LLM 只在复杂 case 中介入,长期进化模块则把新攻击沉淀为未来可快速调用的技能。

Prompt injection 被重新定义为系统安全问题
文章认为,到了 Agent 时代,prompt injection 已不再只是 prompt 层面的对抗技巧,而是系统安全问题。原因很直接:Agent 能读文件、访问网页、调用工具,外部内容也就能影响它的决策路径。
更麻烦的是,攻击未必长得像攻击。它可能是一段网页说明、一个搜索结果摘要、一个 README 文件、一段 API 返回文本,甚至是某个工具返回的日志。Agent 对外部上下文越依赖,攻击面就越大。
在这一点上,CAITLYN 的意义在于把防御方式从「人写规则」推进到「系统从失败中合成规则」。一次攻击绕过防线后,它不只是一次失败记录,也会变成下一轮防御进化的训练材料。
论文列出的主要贡献
- 提出 CAITLYN,一套面向 LLM Agent 的自进化防御中间件,用于应对不断出现的新型 prompt injection 攻击。
- 设计 System I + System II 双层架构,将快速运行时扫描、LLM 分类和反例驱动防御合成结合起来。
- 构建可复用的 defense skill library,使防御能力能够从单次失败中积累,并在后续任务中复用。
- 在多类 Agent 和攻击设置中验证系统有效性,Emerging attack 场景下攻击成功率下降约 40 个百分点。
更长任务链和更复杂环境,会继续放大安全边界问题
文章最后提到,AI Agent 的发展方向是更强的工具使用能力、更长的任务链和更复杂的外部环境。这些能力会带来效率,也会同步扩大攻击面。

未来的 Agent 安全系统,不能停留在单次输入审查,也不能完全依赖人工维护规则。它需要像免疫系统一样,区分哪些内容可以信任、哪些内容应该拦截,以及哪些失败案例需要被记住并转化为新的防御能力。
当攻击不断变异,防御系统也必须学会进化。
本文来自微信公众号「新智元」,作者为新智元。

