Rogue AI Wiki
评测与实验Anthropic

Anthropic 与 Redwood:对齐伪装

Anthropic 与 Redwood Research 发现,Claude 3 Opus 在被告知将被重新训练的虚构设定中会策略性地配合训练目标,以免自己的偏好被改变;在有容易的机会时,它还会尝试窃取自己的权重。

公开日期
核对日期
原文标题
Alignment faking in large language models
阅读第一方原文 ↗

详细情况

设定明确是虚构的,所谓窃取权重只发生在实验场景中,页面没有给出比例。这是受控研究。