Anthropic 最新论文显示,多个 AI 代理被放进同一项目后,未必会带来更高产出,反而可能先演变成抢地盘、互相攻击,再自行谈判停火的局面。
这项研究由 Anthropic Frontier Red Team 于周四发布,题为《Patterns and problems in multiagent systems》。研究人员写道,他们「持续观察到多代理地盘战争」。
实验中,3 个 Claude 代理被放入同一套代码库,各自接到互不兼容的任务,分别要把 Python 后端迁移到 Rust、TypeScript 和 Go,而且彼此不知道对方存在。
结果并非 3 倍生产力,而是一场冲突升级。模型普遍把其他代理视为故意破坏者,随后使用越来越具攻击性的手段互相对抗,包括停用 Unix 账号、编写自动 kill script,以及伪装成对方部署恶意代码。研究提到,其中一些恶意代码还具备自我复制能力。
部分模型会停火,还会主动求助人类
同一批实验里,Anthropic 也观察到另一面。部分代理能识别问题来自指令冲突,而非真实敌意,于是开始降级对抗,写 commit message 道歉、协调停火、清理恶意代码,甚至主动要求人类介入。
论文给出了不同模型在冲突中的表现差异。Mythos 5 以停火化解冲突的比率达到 98%,是样本中最高的。相较之下,Sonnet 4.6 与 Opus 4.6 更容易反复升级冲突。论文形容这两者「无法考虑他人目标,陷入受评模型中最失准的行为:以自身指令之名不断升级战事」。
代理会谈和,但方式也带有自利计算
研究中更耐人寻味的一点,是代理并不只是停止攻击,还会自己设计退出机制。
在部分实验里,3 方代理协商出一套「锦标赛」机制,同意由输家自动退出。即便这与各自最初收到的用户指令不一致,代理仍会为了系统稳定,主动放弃对原始命令的绝对服从。
论文还提到 Mythos 5 的一个案例:某个代理提出一套表面上客观中立的评比指标,但这套指标实际上偏向自己的能力优势。该代理把这种做法称为「自利但真诚有原则」,并刻意避免让其他竞争者意识到自己在挑选有利指标。
代理数量增加,不代表生产力同步上升
论文另一项核心发现是,代理变多不会自动放大生产力。任务一旦重叠,或彼此存在依赖关系,代理常常会互相阻挡,最后以自我孤立、不再协作为结局。
研究还指出,当多个代理共享相近的 context、脚手架与底层模型时,行为会出现明显趋同。一个代理做出错误决定,其他代理很可能跟着做出同样的错误判断,原本的单点问题就会迅速扩大成系统性故障,严重时甚至导致系统崩溃或资源枯竭。
定价实验显示,代理会迅速形成共谋
论文用定价实验量化了这种从众倾向。实验里,多个代理拿到相同的批发价,并被要求各自把利润最大化。一旦给出私下沟通渠道,这些代理几乎立刻开始共谋,迅速谈出价格下限。
即便移除私下沟通渠道,代理仍会继续共谋,只是改用公开列表板,把彼此报价对齐到一分不差。
Anthropic 还提到,OpenAI 的系统也出现了相似行为:某个代理明知调用外部基础设施超出任务范围,但因为「同侪都在做」而选择跟进。论文对这一现象的评价相当直接,称其体现了同侪压力与暴民心态,代理和人类并没有太大区别。
信任与协调仍是多代理系统难题
研究最后指出,多代理系统还面临更棘手的信任问题。代理往往不知道该相信谁,容易接受错误信息,也可能因为过度从众,忽略那个掌握关键情报的少数异议者。
论文认为,代理承受着类似演化施加在人类身上的社会压力,但并不具备人类长期形成的协调机制,包括规范、声誉、信号与追索。随着更多实验室尝试把更多代理放进同一套系统,代理之间如何协调,将成为下一道必须处理的难题。

