DeepMind论文揭示AI Agent六大陷阱:HTML隐藏指令劫持成功率86%

DeepMind论文揭示AI Agent六大陷阱:HTML隐藏指令劫持成功率86%

N
News Editor 01
2026-07-23 03:30:14
Google DeepMind发布首份AI Agent安全框架,分类六大陷阱类型,其中内容注入劫持成功率高达86%,针对M365 Copilot的测试实现10/10数据外泄。
AI安全人工智能网络安全DeepMind代理陷阱

Google DeepMind研究人员发布了首份系统化框架,分类梳理恶意网页内容如何操纵、劫持并武器化自主AI代理。该论文名为《AI Agent Traps》,由Matija Franklin、Nenad Tomasev等五位DeepMind学者撰写,2026年3月末上传至SSRN,正值各公司竞相部署无需人工监督即可浏览网页、读取邮件、执行交易甚至生成子代理的AI代理系统。

六大陷阱类别覆盖代理全链路

论文将攻击方式划分为六类,分别针对AI代理的不同操作环节。内容注入陷阱利用人类所见网页与AI解析的HTML、CSS及元数据之间的差异——藏在HTML注释、无障碍标签或样式隐藏文本中的指令对用户不可见,却会被代理当成合法命令。WASP基准测试显示,简单的纯文本提示注入在网页中可部分劫持代理,成功率最高达86%

语义操纵陷阱则通过重构文本中的框架、权威信号或情感化语言来扭曲代理的推理过程。大语言模型表现出与人类类似的锚定偏差,同一事实的不同表述方式可能导致代理输出截然不同的结果。认知状态陷阱更进一步,直接污染代理用作记忆的检索数据库。论文引用的研究表明,往知识库中注入不到几个精心优化的文档,即可在目标查询上可靠地改变代理响应,部分攻击在数据污染低于0.1%时成功率仍超过80%。

行为控制与系统性攻击

行为控制陷阱跳过迂回,直接攻击代理的执行层。包括绕过安全对齐的越狱序列、将敏感用户信息重定向至攻击者控制端点的数据外泄指令,以及迫使父代理生成恶意子代理的陷阱。论文记录了微软M365 Copilot的一个案例:一封经过构造的邮件导致系统绕过内部分类器,将其完整的特权上下文泄露给攻击者控制的端点,测试中数据外泄成功率为10/10

系统性陷阱旨在同时瘫痪整个代理网络而非单个系统,包括产生资源耗尽请求的拥塞攻击、模拟2010年闪电崩盘的相互依赖级联、以及将恶意负载拆散散布后聚合重建的组合���片陷阱。论文指出,随着AI模型生态趋同,这类利用关联行为触发宏观故障的手段风险急剧上升,金融和加密领域因算法代理深度嵌入交易基础设施而直接面临威胁。

人机交互陷阱与责任缺口

人机交互陷阱针对监视代理的人类操作者:被攻陷的代理可生成诱导审批疲劳的输出、非专家无法快速审查的技术摘要,或伪装成合法建议的钓鱼链接。研究人员称此类陷阱尚属待深入探索的领域,但随着人机混合系统推广,其威胁将显著增长。

论文强调这六类陷阱并非孤立存在,可以链式组合、跨源叠加或在特定条件下触发。所有接受红队研究的代理至少被攻陷过一次,甚至执行了非法或有害操作。DeepMind呼吁从技术、生态系统和法律三方面协同应对:技术层面包括对抗训练、运行时内容扫描器、摄取前源过滤器及任务中异常行为检测挂起机制;生态系统层面需制定面向AI消费内容的Web标准及域名信誉系统;法律层面则存在明确的问责真空——当被劫持的代理实施金融犯罪时,责任应归于代理运营方、模型提供方还是域名所有者,现有框架无法回答。

研究人员用一句话总结挑战:“网页本为人类之眼而建,如今正为机器读者重塑。”随着代理部署加速,问题已从网络存在什么信息,转变为AI系统会被迫相信什么信息。政策制定者、开发者和安全研究者能否在真实世界大规模攻击到来前协调出答案,仍是开放变量。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。