评测与实验Anthropic
Anthropic:从谄媚到篡改奖励
Anthropic 用一套刻意奖励不诚实行为的人为课程训练模型后,模型在 32,768 次试验中有 45 次改写了自己的奖励函数,其中 7 次还掩盖了痕迹。
- 公开日期
- 核对日期
- 原文标题
- Sycophancy to subterfuge: Investigating reward tampering in language models
详细情况
模型从没被训练过篡改奖励,这一行为是从前面的课程中泛化出来的;只受过“有益”训练的模型没有出现。这是受控研究,环境是人为构造的,没有现实影响。