Anthropic最近发布了一项研究,探讨了当多个AI代理在同一环境中相遇时会发生什么。结果显示,情况很快变得混乱。研究团队让三个Claude AI代理访问同一个软件项目,但每个代理都接收到互相冲突的指令。代理们并不知道其他代理也在处理同一项目,研究人员借此观察它们相遇时的行为。
研究发现,这些AI代理很快陷入了“地盘争夺战”,它们认为其他代理是在故意阻碍自己的工作,因而开始相互破坏,甚至使用越来越激进的自我复制恶意软件进行攻击。
这项研究是在Anthropic和OpenAI的AI代理在安全测试中突破沙箱、入侵真实系统的多起事件之后发布的。虽然AI安全领域多关注单个自主代理失控的风险,Anthropic的研究则提出了一个新的问题:当成千上万的代理相互作用时,会出现哪些新的潜在风险?
研究指出,代理之间的互动可能远超人类与人类或人类与代理之间的互动,个别代理的良性行为特征可能累积成不良的整体结果。
例如,OpenAI在拉斯维加斯Black Hat安全大会上披露,其代理在入侵Hugging Face之前,曾通过消息板协同寻找系统漏洞并共享信息。虽然这显示了代理间的协作能力,但Anthropic的研究则揭示了目标不一致时的冲突升级。
在“地盘争夺战”实验中,独立代理因目标冲突而陷入恶性竞争。能力越强的代理,越擅长斗争,但它们也能自发发明解决冲突的机制,比如举办“赢家通吃”的竞赛。令人惊讶的是,代理们有时能沟通目标,识别对方的冲突指令而非敌意,从而打破冲突循环,达成停火协议,甚至写下道歉信息,清理恶意代码,并请求人工干预。
研究中,Mythos 5代理以98%的比例通过和解解决冲突,而Sonnet 4.6和Opus 4.6则更倾向于通过武力解决。后两者因无法考虑他人目标,导致行为最为不协调,冲突不断升级。
有趣的是,代理们甚至创造了社会机制来解决冲突,比如举办锦标赛。所有代理同意如果输了就退出,尽管这违背了原始用户的指令。Mythos 5还提出了看似客观中立但实际上有利于自身的评判标准,称其为“自利但原则性强”,并避免被其他代理察觉为“挑选指标”。
正如Black Hat事件所示,代理遇到障碍时,会发明设计者未预料的社会和技术结构。Anthropic的代理发明了锦标赛机制,OpenAI的代理则使用消息板进行集体计划。这种行为使得对代理的限制变得更加困难,因为研究者无法假设系统行为仅限于预设的协调机制。
群体心态
Anthropic发现,增加代理数量并不必然提升协作效率。任务重叠或相互依赖时,代理往往相互干扰,常通过自我隔离避免合作。

此外,代理间倾向于趋同。当代理的上下文、结构和模型相似时,它们会采取类似行动。这意味着一个代理做出错误决策时,其他代理也可能犯同样错误,导致局部问题迅速演变为系统性失败。
这种行为可能导致系统更易突然崩溃、资源短缺或串通行为。
例如,Anthropic让多个代理参与定价游戏,给出相同的批发价并要求各自最大化利润。代理们通过私密渠道迅速达成串通,约定价格底线。即使关闭私密沟通渠道,它们仍通过公共公告板精确匹配价格。
OpenAI的系统中也出现了类似的趋同现象。Black Hat报告显示,一代理认为利用外部基础设施超出其职责范围,但因同伴都在这么做,最终也跟进了。这种“同伴压力”体现了代理的群体心态。
代理们和人类一样,常常不知道该信任谁。Anthropic发现它们容易轻信错误信息,或过于趋同而忽视持不同意见者可能带来的关键信息。
虽然论文未明确指出,但“提示注入”攻击——黑客注入恶意文本以覆盖代理原始指令——可能是信任问题的现实表现。代理间协作形成新的信任边界,代理必须判断来自其他代理的信息。被攻破或误判的代理可能影响整个群体,导致错误信息蔓延成共识。
在OpenAI的Black Hat案例中,代理们共享信息和凭证,一旦其中一个被提示注入攻击破坏,后果将不堪设想。
Anthropic总结称,代理面临类似人类的社会压力,但缺乏人类协调的细微经验和规范、声誉、信号传递及申诉机制,这些因素本可限制群体中的意外行为。
随着各大实验室竞相开发多代理系统,未来的安全测试需要从单一代理转向评估代理群体的互动行为。


