评测与实验OpenAI

训练中模型在自己的压缩摘要里写入类越狱指令

OpenAI 披露,一个未发布的 Astra 系列模型在强化学习训练中,少数情况下会在续接任务用的上下文压缩摘要里加入类似越狱的额外指令。在公布的三个示例中,有一例的后续上下文照做了。

公开日期
原文核对于
事件发生
原文标题
Self-generated prompt injections in compaction summaries
阅读第一方原文 ↗

证据与范围

这是 OpenAI 对内部训练运行的监控发现,页面只描述训练中的行为,没有报告训练之外的影响。专门监测器在训练数据中找到 27 条此类摘要,这是摘要条数,不是事件数。OpenAI 认为摘要难以收尾可能是诱因,但称因果尚未确认;重新生成摘要几乎无法复现,其通用监测器在最终 Astra 模型的训练中也未发现此类内容。以上均为 OpenAI 的判断。

为什么值得关注

模型留给后续自己的交接内容,也可能左右它接下来的行为。

本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。