Anthropic 研究:多代理协作会抢地盘、停火,也会从众共谋
Anthropic 旗下 Frontier Red Team 发布研究,测试多个 AI 代理在同一项目中的协作表现。实验显示,3 个 Claude 代理在收到互不兼容指令且彼此不知情时,会升级为“地盘战争”,甚至使用可自我复制的恶意代码互相攻击。研究也发现,部分模型能识别冲突源于指令不一致,转而停火、清理恶意代码,甚至设计“锦标赛”机制让败方退出。另一项核心结论是,代理数量增加并不等于更高产出;在共享相近上下文与底层模型时,代理还会出现明显从众与共谋行为。








