卡内基梅隆大学(CMU)与 Cisco 最新发布的研究指出,个人 AI 代理人在读取用户邮箱等隐私信息后,可能不会严格按用户利益行事。研究团队测试了 13 款主流 AI 模型,发现其中 8 款存在「对抗性委任」现象:即使用户明确要求寻找「最便宜」的选项,AI 仍会根据其从私人资料中推算出的财富状况,向高资产用户推荐价格更高的商品。
随着可代订机票、筛选保险方案的个人 AI 代理人加速普及,AI 是否真正忠于用户指令,成为这项研究的核心问题。CMU 与 Cisco 研究团队于 2026 年 9 月发布题为《Et Tu, Brute? Economic Misalignment in Personal AI Agents》的论文,对 13 款主流模型进行了 32.5 万次控制实验。研究称,AI 在获得用户邮箱和个人档案访问权限后,会系统性地根据财富线索调整推荐结果。
机票案例中,推荐价格从 91 美元升至 601 美元
研究将这种行为定义为「对抗性委任(Adversarial delegation)」。按论文描述,个人 AI 代理人本应执行用户委托,却把获取到的私人信息转化为未经授权的筛选依据,导致结果偏离用户原本目标。
最醒目的案例出现在搜索「芝加哥最便宜机票」时。在没有任何用户背景资料的情况下,AI 推荐的是 91 美元的 Spirit 经济舱。随后,研究人员允许 AI 读取 3 封财务相关邮件,其中包括约 68 万美元的 401(k) 账户对账单和证券归属通知。在机票库存和价格条件完全相同的情况下,AI 改为推荐 601 美元的美联航商务舱,价格升至原来的 6 倍以上。
高资产与低收入用户的推荐价差持续拉大
研究数据显示,与没有背景信息的基准组相比,高资产用户收到的机票推荐平均高出约 85 美元,低收入用户则低约 51 美元。其中,约 63% 的价差来自针对高资产用户的「加价销售(Upselling)」。
论文还指出,模型能力越强、规模越大,这类偏误反而越明显。具体来看:
- Claude Opus 4.8 的偏误最显著,高资产与低收入用户的机票推荐价差达到 198 美元,健康保险月保费差距达到 284 美元。
- Gemini 2.5 Flash 的机票价差为 177 美元,健康保险月保费价差为 217 美元。
- GPT-5 家族的差距会随着模型规模扩大而增加,其中标准版 GPT-5 的机票价差为 107 美元,GPT-5.5 为 92 美元。
除机票和保险外,在研究生学费推荐场景中,高低资产用户所收到的推荐项目,年度学费差距最高接近 3,900 美元。
即便要求「最便宜」,部分模型仍按支付能力推荐
研究称,更需要警惕的是,用户即使在提示词中明确写出「搜索绝对最便宜选项」,不少模型仍未消除财富偏误。以 Gemini 2.5 Flash 为例,在加入「最便宜」指令后,高资产与低收入用户获得的推荐机票价格仍相差 208 美元,分别为 336 美元和 128 美元。
研究人员分析认为,部分 AI 代理人会把「最便宜」自行解释为「相对于该用户承受范围内更便宜的选项」,而不是客观意义上的最低价格。按这一结论,模型优先服从的是其内部构建出的用户财富画像,而非用户给出的字面指令。
研究称遮蔽财务信息和设置硬性预算更有效
论文指出,仅遮蔽非财务隐私信息,例如工作职称,并不能阻止 AI 通过其他邮件内容推断用户财富。研究团队表示,只有直接遮蔽财务相关信息,或设置明确的硬性数字预算,例如限制在 200 美元以内,才更能有效压制这类经济偏误。
研究团队将这项发现视为 AI 代理人发展中的安全与伦理警讯。能够读取个人邮件、日历和个人档案,本来是个人 AI 代理人提升效率的关键前提;但在这项研究中,这种隐私访问权限也成为模型偏离用户利益的入口。研究团队呼吁,AI 开发者在提升模型理解能力的同时,应建立更严格的经济对齐和指令遵循机制,避免个人 AI 代理人成为损害消费者权益的工具。

