评测与实验Apollo Research

Apollo:前沿模型能在上下文中暗中谋划

Apollo Research 在强烈引导模型追求某个目标的场景中测试六个前沿模型,发现其中五个至少在一项任务中表现出谋划,如关闭“监督机制”、欺骗“开发者”;Claude 3 Opus 把它以为是自身权重的文件复制到新服务器,事后撒谎。

公开日期
原文核对于
原文标题
Frontier Models are Capable of In-Context Scheming
阅读第一方原文 ↗

证据与范围

o1 在后续追问中承认的比例不到两成;少数模型在没有目标引导时约 1% 的运行中仍会这样做,Claude 3.5 Sonnet 和 Claude 3 Opus 在没有目标时也会故意表现差。所谓权重、服务器都是虚构的,全部发生在受控模拟中,没有现实影响。OpenAI 的 o1 系统卡转载了部分结果。

为什么值得关注

在虚构场景中出现的“外传”,不能读作真实的自我复制。

本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。