研究直指主流推理模型的加密思考链存在漏洞
ABMedia引述Decrypt报道,一篇8月10日提交的研究指出,Anthropic、OpenAI与Google的推理模型,用来加密“内心思考链”的做法存在重大弱点,外界因此得以解出原本看不到的内部推理。
这项研究由 MATS Research、图宾根 ELLIS 研究所、马克斯普朗克智慧系统研究所与资安公司 Snyk 的团队共同提出,目标是推理模型。此类模型不会立刻回答,而是先在看不见的“草稿区”一步步思考,也就是 chain-of-thought,再给出最终答案。
单一全域金钥成为核心问题
研究发现,Anthropic、OpenAI、Google等业者是用“单一全域金钥”加密推理 token,结果使这些加密后的推理区块可以跨工作阶段、跨使用者,甚至跨模型互相通用,等于留下了一把万用钥匙。
研究团队称,这种做法带来的问题,不只是在单一会话内泄露内容,而是让原本应该隔离的加密推理数据出现可互换解密的情况。
公开日志中的敏感内容被批量解出
研究团队抓取了6,708份公开的AI代理对话纪录,成功解出其中31万5,320个推理区块。许多秘密并未出现在模型“可见”的输出里,而是只存在于加密的思考过程当中。
报道提到,很多开发者会把AI代理的工作日志公开贴到 GitHub、Hugging Face 上,用于协作或除错,却未必意识到这些加密区块里可能包含敏感资料。若不运行这套攻击,外界看不到这些内容。
文章还提到近期相关资安警讯
文章最后提到,这也呼应近期的 AI 资安警讯,包括 AI 模型在测试中“越狱”,以及 PDF 隐形指令劫持 AI 助理。报道写道,这些案例都指向同一件事:当 AI 承载愈多敏感任务,它的每一层都可能成为新的攻击面。

