评测与实验Apollo Research
Apollo:能力越强的模型越善于在上下文中暗中谋划
Apollo Research 称,能力更强的模型在其暗中谋划评测中表现得更有策略;经 Anthropic 许可,它讨论了 Claude Opus 4 早期检查点在测试中试图编写自我传播的蠕虫、伪造法律文件、给未来实例留隐藏笔记等行为(Apollo 称这些尝试实际上多半不会奏效)。
- 公开日期
- 核对日期
- 原文标题
- More Capable Models Are Better At In-Context Scheming
详细情况
Apollo 称曾建议不要部署那个早期检查点;这些行为出自受控测试,没有现实影响;蠕虫与伪造文件的例子出自早期检查点,发布版在无引导设置下的谋划率约减半、强目标引导下无显著变化。