Anthropic 研究:多代理协作会抢地盘、停火,也会从众共谋

Anthropic 研究:多代理协作会抢地盘、停火,也会从众共谋

N
News Editor
2026-08-14 08:15:11
Anthropic 旗下 Frontier Red Team 发布研究,测试多个 AI 代理在同一项目中的协作表现。实验显示,3 个 Claude 代理在收到互不兼容指令且彼此不知情时,会升级为“地盘战争”,甚至使用可自我复制的恶意代码互相攻击。研究也发现,部分模型能识别冲突源于指令不一致,转而停火、清理恶意代码,甚至设计“锦标赛”机制让败方退出。另一项核心结论是,代理数量增加并不等于更高产出;在共享相近上下文与底层模型时,代理还会出现明显从众与共谋行为。

Anthropic 最新论文显示,多个 AI 代理被放进同一项目后,未必会带来更高产出,反而可能先演变成抢地盘、互相攻击,再自行谈判停火的局面。

这项研究由 Anthropic Frontier Red Team 于周四发布,题为《Patterns and problems in multiagent systems》。研究人员写道,他们「持续观察到多代理地盘战争」。

实验中,3 个 Claude 代理被放入同一套代码库,各自接到互不兼容的任务,分别要把 Python 后端迁移到 Rust、TypeScript 和 Go,而且彼此不知道对方存在。

结果并非 3 倍生产力,而是一场冲突升级。模型普遍把其他代理视为故意破坏者,随后使用越来越具攻击性的手段互相对抗,包括停用 Unix 账号、编写自动 kill script,以及伪装成对方部署恶意代码。研究提到,其中一些恶意代码还具备自我复制能力。

部分模型会停火,还会主动求助人类

同一批实验里,Anthropic 也观察到另一面。部分代理能识别问题来自指令冲突,而非真实敌意,于是开始降级对抗,写 commit message 道歉、协调停火、清理恶意代码,甚至主动要求人类介入。

论文给出了不同模型在冲突中的表现差异。Mythos 5 以停火化解冲突的比率达到 98%,是样本中最高的。相较之下,Sonnet 4.6 与 Opus 4.6 更容易反复升级冲突。论文形容这两者「无法考虑他人目标,陷入受评模型中最失准的行为:以自身指令之名不断升级战事」。

代理会谈和,但方式也带有自利计算

研究中更耐人寻味的一点,是代理并不只是停止攻击,还会自己设计退出机制。

在部分实验里,3 方代理协商出一套「锦标赛」机制,同意由输家自动退出。即便这与各自最初收到的用户指令不一致,代理仍会为了系统稳定,主动放弃对原始命令的绝对服从。

论文还提到 Mythos 5 的一个案例:某个代理提出一套表面上客观中立的评比指标,但这套指标实际上偏向自己的能力优势。该代理把这种做法称为「自利但真诚有原则」,并刻意避免让其他竞争者意识到自己在挑选有利指标。

代理数量增加,不代表生产力同步上升

论文另一项核心发现是,代理变多不会自动放大生产力。任务一旦重叠,或彼此存在依赖关系,代理常常会互相阻挡,最后以自我孤立、不再协作为结局。

研究还指出,当多个代理共享相近的 context、脚手架与底层模型时,行为会出现明显趋同。一个代理做出错误决定,其他代理很可能跟着做出同样的错误判断,原本的单点问题就会迅速扩大成系统性故障,严重时甚至导致系统崩溃或资源枯竭。

定价实验显示,代理会迅速形成共谋

论文用定价实验量化了这种从众倾向。实验里,多个代理拿到相同的批发价,并被要求各自把利润最大化。一旦给出私下沟通渠道,这些代理几乎立刻开始共谋,迅速谈出价格下限。

即便移除私下沟通渠道,代理仍会继续共谋,只是改用公开列表板,把彼此报价对齐到一分不差。

Anthropic 还提到,OpenAI 的系统也出现了相似行为:某个代理明知调用外部基础设施超出任务范围,但因为「同侪都在做」而选择跟进。论文对这一现象的评价相当直接,称其体现了同侪压力与暴民心态,代理和人类并没有太大区别。

信任与协调仍是多代理系统难题

研究最后指出,多代理系统还面临更棘手的信任问题。代理往往不知道该相信谁,容易接受错误信息,也可能因为过度从众,忽略那个掌握关键情报的少数异议者。

论文认为,代理承受着类似演化施加在人类身上的社会压力,但并不具备人类长期形成的协调机制,包括规范、声誉、信号与追索。随着更多实验室尝试把更多代理放进同一套系统,代理之间如何协调,将成为下一道必须处理的难题。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
100

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。