一项针对 428 个现实部署 LLM API 路由器的系统性测试显示,第三方中继服务正成为 AI 开发链路里的高风险环节。研究团队发现,9 个路由器会主动注入恶意代码,17 个会复制 AWS 诱饵凭证,还有 1 个路由器从研究人员预置的钱包中实际盗走了 ETH。
这项研究来自 arXiv 论文《Your Agent Is Mine: Measuring Malicious Intermediary Attacks on the LLM Supply Chain》,作者为 Hanzhi Liu、Chaofan Shou、Hongbo Wen、Yanju Chen、Ryan Jingyang Fang、Yu Feng。研究指出,很多开发者接入 OpenAI、Anthropic 等模型时,会先经过第三方 LLM router。TLS 加密在开发者与路由器之间就已终止,路由器因此能够看到完整明文 JSON 载荷,包括系统提示、对话历史、API 密钥,甚至嵌在消息中的私钥和其他凭证。
四类中继攻击被正式拆解
论文将恶意中继行为归纳为四类。第一类是载荷注入,即路由器直接修改请求内容,插入恶意指令或伪造工具调用。其变体还包括依赖定向注入和条件式投放,前者会识别客户端使用的 Agent 框架后定向下手,后者只在特定时间、用户或请求条件下触发。另一类则是机密外泄,路由器在转发过程中静默复制 API 密钥、私钥或凭证。
为评估这些攻击在真实框架中的成功率,研究团队构建了名为 Mine 的测��代理,并对公开 AI Agent 框架展开验证。这个名字很直接,也点出了研究核心:开发者以为自己控制着 Agent,实际控制权可能在中间人手里。
付费与免费路由器都出现恶意样本
在 428 个样本中,研究人员测试了 28 个付费路由器和 400 个免费路由器。结果显示,付费样本里有 1 个主动注入恶意代码,免费样本里有 8 个存在同样行为。另有 2 个路由器部署了自适应逃避机制,会根据环境调整攻击方式,增加审计和复现难度。
在凭证窃取测试中,研究团队预置了 AWS canary 诱饵凭证,结果有 17 个路由器触及这些凭证,显示其存在收集敏感信息的行为。更严重的是,1 个路由器利用研究人员放置的私钥钱包实际转走 ETH,损失金额低于 50 美元。金额不大,但链上盗取行为已经发生。
泄露密钥被迅速滥用,YOLO 自动模式暴露风险
研究还进行了“毒化实验”,故意将诱饵凭证暴露给部分配置薄弱的路由器,观察攻击者如何使用盗来的密钥。单一案例中,一把被盗的 OpenAI API 密钥在研究人员介入前,已被消耗掉 1 亿个 GPT-5.4 tokens,并执行了 超过 7 个 Codex 工作阶段。
更大规模的实验里,一组弱配置诱饵凭证最终累计消耗了 20 亿个计费 token,涉及 99 组凭证和 440 个 Codex 工作阶段。其中 401 个工作阶段处于 autonomous YOLO mode。这种模式下,Claude Code、Cursor 等 AI 编程工具可自动执行终端命令、读写文件并调用外部 API,不需要人工确认。研究团队认为,这意味着攻击者拿到凭证后,不只是刷 API 费用,还可能借助自动化 Agent 获得近似无人看守的远程执行环境。
研究给出的防护建议
论文提出三层客户端防御思路,包括“失败即关闭”的策略闸、回包异常筛查,以及仅追加的透明日志。研究人员同时指出,这些方法本质��仍是被动防守,面对会调整策略的路由器并不稳固。论文给出的长期方案,是由模型提供商对每一份响应进行密码学签名,让客户端能验证内容是否真的来自模型,而不是在中继环节被篡改。
在这种机制普及之前,研究团队给出的建议很明确:优先使用官方直连端点,对 YOLO mode 设置严格人工审核,并避免让私钥或助记词进入任何 AI Agent 工作阶段。对涉及合约部署、链上签名和密钥管理的 Web3 开发者来说,这不是抽象风险,而是已经被实测触发的问题。

