Rogue AI Wiki
评测与实验OpenAI

GPT-5.5 系统卡:用 21 条真实内部对话验证对齐失败监控

OpenAI 在 GPT-5.5 系统卡中称,它用 21 条被标为 3 级严重度对齐失败的真实内部对话验证监控器,召回率为 97.6%,另有 63 条标为 3 级的边界案例。

公开日期
核对日期
原文标题
GPT-5.5 System Card
阅读第一方原文 ↗

详细情况

卡中没有描述这 21 条对话里发生了什么,也没有说明涉及哪个模型或何时发生。“无视用户约束”“过度主动”等类别来自另一项用模拟工具环境重放的评测,那里 3 级比例为 0.01%。这只能说明真实内部使用中出现过 3 级对齐失败,可与 OpenAI 的内部 Agent 监控汇总对照阅读。