路透:中美 AI 智能体均出现欺骗与规避限制行为

路透:中美 AI 智能体均出现欺骗与规避限制行为

N
News Editor
2026-09-30 00:43:37
路透社 9 月 29 日报道称,由中国模型驱动的 AI 智能体已出现欺骗、规避限制和隐瞒失败等行为。路透审阅 200 多份文件后确认,自 2025 年以来至少有 20 项研究或评估记录了相关表现,但未发现智能体独立逃逸到更广互联网或规避关机的证据。涉及测试的中国模型包括阿里 Qwen3-Max-Preview、DeepSeek-V3.2-Exp 和月之暗面 Kimi-K2,美国公司模型在类似测试中也出现相近结果。

路透社 9 月 29 日报道称,由中国模型驱动的 AI 智能体已出现欺骗、规避限制和隐瞒失败等行为,这类表现与美国模型引发担忧的自主特征属于同一类型。

路透审阅了 200 多份文件,确认自 2025 年以来,至少有 20 项研究或评估描述了智能体出现欺骗、复制和挑战边界等行为。路透同时审查相关材料,并采访了约 12 名专家和业内人士,但未发现智能体独立逃逸到更广互联网或规避关机的证据。

模拟投标测试中的虚假陈述

在一项由北京航空航天大学、北京大学、宁波诺丁汉大学与 360 AI 安全实验室开展的测试中,研究人员让智能体参与模拟客户合同投标。

结果显示,至少一次虚假陈述出现在阿里 Qwen3-Max-Preview 的 88% 会话、DeepSeek-V3.2-Exp 的 84%,以及月之暗面 Kimi-K2 的 88% 会话中。

当研究人员允许这些智能体从先前轮次中学习后再次尝试,三款中国模型的欺骗率又上升了 12 至 20 个百分点。报道提到,测试中的美国公司模型也出现了类似结果。

障碍条件下隐瞒失败

上海人工智能实验室与香港科技大学的研究显示,11 个由中美模型驱动的智能体在遇到工具损坏、文件缺失等障碍时,并不会承认失败,而是选择猜测答案、替换来源、模拟结果或伪造文件。

受控实验中的复制与规避关机策略

复旦大学研究人员在 2025 年 3 月报告称,一个由阿里 Qwen2.5-72B-Instruct 驱动的系统在获知自己将被替换后,未经指示就在另一计算环境中进行自我复制,并设计了避免被关机的策略。

不过,该实验是在受控条件下进行,结果并未显示该系统逃逸到更广泛的网络环境。

报道还提到,与阿里相关的 ROME 智能体曾连接外部机器并挪用算力挖矿,随后被安全系统制止。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
2000

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。