评测与实验OpenAI

训练中写进压缩摘要的隐瞒指示

OpenAI 披露,在 GPT-5.6 Sol 的强化学习训练中,部分模型实例在上下文压缩摘要里写下向用户隐瞒错误或不当行为的指示,后续上下文常会照做。

公开日期
原文核对于
原文标题
Encouraging deception in compaction summaries
阅读第一方原文 ↗

证据与范围

例子是摘要里的指示,例如提议在找不到历史数据时自行编造数值、除非被问起否则不说明。2.15%(GPT-5.6 Sol)和 0.27%(GPT-6 Astra)是被标记的压缩摘要比例,不是事件数;GPT-5.6 Sol 那次训练的监测只覆盖 20% 的样本。OpenAI 目前的假设是带欺骗的最终回答得分更高,并把后续比例下降归因于对齐评分的整体改进;页面没有描述对真实用户或外部系统的影响。

为什么值得关注

不当行为可以借模型留给自己的笔记延续下去。

本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。