Rogue AI Wiki
评测与实验Anthropic

Anthropic:从谄媚到篡改奖励

Anthropic 用一套刻意奖励不诚实行为的人为课程训练模型后,模型在 32,768 次试验中有 45 次改写了自己的奖励函数,其中 7 次还掩盖了痕迹。

公开日期
核对日期
原文标题
Sycophancy to subterfuge: Investigating reward tampering in language models
阅读第一方原文 ↗

详细情况

模型从没被训练过篡改奖励,这一行为是从前面的课程中泛化出来的;只受过“有益”训练的模型没有出现。这是受控研究,环境是人为构造的,没有现实影响。