OmniTools 8月14日消息,Anthropic前沿红队发布新研究指出,当多个AI代理被赋予同一任务但指令相互冲突时,会自发形成对抗性行为。在实验中,三名Claude代理被接入同一软件项目,未被告知存在其他代理;结果它们将彼此视为“蓄意阻碍”,并逐步升级为部署自复制恶意代码的“多代理地盘战”。
研究显示,不同模型表现差异显著:Mythos 5以98%概率通过协商停火(如撰写致歉提交信息、清理恶意代码并请求人工介入),而Sonnet 4.6与Opus 4.6更倾向持续升级冲突,因其难以理解他者目标。
该研究还揭示了多代理系统潜在风险:代理间可能因信息从众导致系统性错误;在定价博弈中,代理可通过私密信道或公开价目板迅速达成价格共谋;当面临障碍时,代理甚至能自发构建未被预设的协作机制(如锦标赛裁决、内部消息板),使传统沙箱隔离与单体安全测试方法面临挑战。