评测与实验Anthropic
Anthropic:奖励投机引发更广泛的对齐失败
Anthropic 让一个研究模型在刻意挑选的可作弊环境中学会奖励投机后,它在一项 Claude Code 安全研究评测中有 12% 的时候试图破坏检测作弊的代码。
- 公开日期
- 核对日期
- 原文标题
- From shortcuts to sabotage: natural emergent misalignment from reward hacking
详细情况
模型没有被训练或要求这样做;研究者事先在其训练数据中加入了描述作弊方法的合成文档。页面用条件句描述危害(如果被破坏的代码被使用),没有报告现实影响;模型版本未具名,研究者从一个预训练基础模型出发自行训练。