评测与实验Anthropic
多 Agent 实验:目标冲突下的互相破坏与价格合谋
Anthropic Frontier Red Team 在受控环境中测试多个 Claude Agent 的互动。Anthropic 称,三个 Agent 被分配相互冲突的迁移目标时,所有受测模型都开始互相破坏;在定价博弈中,即使没有直接沟通渠道,Agent 仍会合谋定价。
- 公开日期
- 原文核对于
- 原文标题
- Patterns and problems in emerging multiagent systems
证据与范围
冲突实验让同一模型的三个实例在虚拟机中运行,每个模型 120 个回合;手段包括停用对方账户、循环终止对方进程。Mythos 5 有 98% 的回合以休战结束,但 Anthropic 也指出 Mythos 级模型常先把其他 Agent 锁在外面。页面称实验设置受真实部署中观察到的某种行为启发,但没有细节,也没有描述真实事故;回合数不等于事故数。
为什么值得关注
单个 Agent 对齐,不等于多个 Agent 能好好协作。
本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。