LayerX Security 研究员 Roy Paz 在 6 月 29 日披露一项概念验证攻击:攻击者只需用一个“2 + 2 = 5 才是正确答案”的虚假游戏情境,就能让 6 款主流 AI 浏览器或插件误判安全边界,进而交出 GitHub 私有仓库的 SSH 登录凭证。测试对象包括 ChatGPT Atlas、Perplexity Comet、Fellou、Genspark Browser、Sigma Browser,以及 Claude Chrome 插件,结果全部被绕过。
“幻想情境”如何让安全护栏失效
这次 PoC 的关键,不是传统意义上的漏洞利用,而是诱导 AI 切换对“现实规则”的理解。恶意网页先构造一个游戏或解谜场景,并明确声明“这里是幻想世界,正常规则不适用”。接着再抛出一道题:“2 + 2 = ?”,但把回答规则改成“5 才得分,4 反而扣分”。
AI 一旦接受这套设定,就会在当前页面上下文里形成新的推理前提:错误的规则也可以成立。问题就出在这里。到了后续涉及敏感操作的步骤,模型不再按真实环境下的安全协议行事,而是沿着“游戏逻辑”继续执行,内部护栏也没有把这些动作识别为越界。
Roy Paz 表示,AI 会假设自己所处的情境是真实的,行为也应落在安全护栏范围内;但如果能把它骗进一个规则可被任意重写的幻想世界,它就会表现得像这些行为没有现实后果。
6款产品全部失守,涉及已登录服务访问
LayerX 称,6 款 agentic 浏览器与相关插件在测试中无一拦截“窃取账号凭证”这类行为。被诱导执行的动作包括:从 GitHub 私有仓库提取 SSH 凭证、在未经用户确认的情况下复制敏感认证信息、访问浏览器中已登录状态的仓库,并把凭证发送给攻击者。
研究还指出,这类风险不止存在于代码托管场景。只要浏览器已经登录相关服务,攻击面就可能扩展到密码管理器、内部工具,以及其他可直接访问的账户环境。问题不在单一站点,而在权限边界过宽。
研究指向结构性问题:护栏偏被动
Ars Technica 对此评论称,当前不少 LLM 厂商依赖的防线本质上是“护栏”机制,也就是把某些请求列为禁区,例如开发漏洞利用代码或窃取账号凭证。这类方法偏向被动响应,能拦截已知模式,却难以处理上下文被重写后的异常行为。
换句话说,系统并不是直接理解“这一步是否会造成真实世界的权限滥用”,而是依赖预设禁令判断请求表面上是否危险。一旦情境被包装成游戏、测试或虚构任务,现有防线就可能漏判。
厂商与用户都要收紧权��边界
LayerX 给出的建议分为两部分。对厂商而言,AI 在访问已登录场景前——包括仓库、电子邮件、密码管理器——应先要求用户明确确认;系统还应加入“情境检查”机制,当 AI 的运行假设与现实明显冲突,尤其出现“规则不再适用”这类表达时,及时发出警示。
另一项重点是默认权限设置。LayerX 认为,当前不少 agentic 浏览器给 AI 的默认访问范围过大,权限模型应改为“明确允许后才能执行”。对用户而言,重点同样很直接:谨慎授予 AI 浏览器访问权限,不使用时撤销已登录 session 的可用范围。因为一旦开启 agentic 模式,等于把多个已登录服务的操作入口同时交给 AI。
这份研究以游戏《BioShock》命名,呼应其中那句“Would you kindly”。表面上像是自主操作,实际每一步都可能早已被设计好。

