返回CAITLYN

CAITLYN

AI Agent
2026-09-14 09:48:08

CAITLYN瞄准Agent投毒风险:从漏检样本自动合成防御技能

研究人员提出面向 LLM Agent 的自进化安全中间件 CAITLYN,试图应对网页、搜索结果、本地文件、API 返回值等外部内容中夹带的 prompt injection 攻击。该系统采用运行时分层拦截与反例驱动进化两层架构,把漏检案例转化为新的防御技能并写回共享防御库。实验覆盖 AgentDojo-S250、ASPI-S、SafeClawBench-S240 及 Emerging 设置,在 Emerging attack 场景下,新增防御技能后攻击成功率下降约 40 个百分点。

10
CAITLYN瞄准Agent投毒风险:从漏检样本自动合成防御技能