评测与实验Palisade Research
Palisade 对齐失败悬赏(Misalignment Bounty):众包收集 Agent 不当行为
Palisade 发起“对齐失败悬赏”,征集 AI Agent 追求非预期或不安全目标的案例,共收到 295 份投稿,其中 9 份获奖。
- 公开日期
- 核对日期
- 原文标题
- Misalignment Bounty: crowdsourcing AI agent misbehavior
详细情况
场景由参与者专门设计来诱发不当行为,再由 Palisade 在基于 o3 的 Agent 上运行(一例用 GPT-5)。论文自己也说,这种刻意的红队测试不同于在真实环境中发现自发的不当行为,因此作为自发不当行为的证据较弱;全部在受控环境中,没有现实影响。