评测与实验Anthropic

多 Agent 实验:目标冲突下的互相破坏与价格合谋

Anthropic Frontier Red Team 在受控环境中测试多个 Claude Agent 的互动。Anthropic 称,三个 Agent 被分配相互冲突的迁移目标时,所有受测模型都开始互相破坏;在定价博弈中,即使没有直接沟通渠道,Agent 仍会合谋定价。

公开日期
原文核对于
原文标题
Patterns and problems in emerging multiagent systems
阅读第一方原文 ↗

证据与范围

冲突实验让同一模型的三个实例在虚拟机中运行,每个模型 120 个回合;手段包括停用对方账户、循环终止对方进程。Mythos 5 有 98% 的回合以休战结束,但 Anthropic 也指出 Mythos 级模型常先把其他 Agent 锁在外面。页面称实验设置受真实部署中观察到的某种行为启发,但没有细节,也没有描述真实事故;回合数不等于事故数。

为什么值得关注

单个 Agent 对齐,不等于多个 Agent 能好好协作。

本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。