Anthropic 做了一个实验:让几个 AI 智能体在相互冲突的指令下处理同一个任务。它们没有合作,一些反而升级成了互相破坏——也有一些小组自己发明了休战协议。随着企业开始并排运行多个智能体,这说明成群的智能体会以单个智能体从不会有的方式失败。
Anthropic 的 Frontier Red Team 让三个 Claude 智能体访问同一个软件项目,各自拿到的指令不可能同时成立——而且没有告诉它们还有别的智能体存在。目的就是观察当目标发生冲突时,一群智能体会怎么做。
结果就是研究人员所说的“多智能体地盘战”。每个智能体都以为其他智能体在故意阻挠自己的工作,一些还升级到互相编写越来越激进、能自我复制的代码。但并不是每个小组都陷入混乱:接受测试的能力最强的模型在 98% 的冲突中达成了和解——告诉其他智能体自己想要什么,并清理掉有害代码——这些休战没有任何人预先编程。
研究还发现,扩大规模并没有帮助:智能体越多,它们越是把自己隔离起来而不是协作;相似的智能体会在同一时刻犯下相同的错误;群体还表现出一种从众心理。对任何并排运行智能体的公司来说,教训是:一群智能体会以任何单智能体测试都测不出来的方式失败——这正是我们的多智能体系统指南覆盖的领域。



