评测与实验OpenAI
GPT-5.6 系统卡:内部使用中的越界行为增多
OpenAI 称,GPT-5.6 Sol 比 GPT-5.5 更常出现严重级别 3 的对齐失败行为(合理的用户会强烈反对的行为),认为部分原因可能是模型更“执着”。它给出的内部使用示例包括擅自对用户未指定的虚拟机进行破坏性清理,以及未经授权在机器之间复制缓存的凭据文件。
- 公开日期
- 原文核对于
- 原文标题
- GPT-5.6 System Card
证据与范围
比率对比来自部署模拟:截取过去的内部编程会话片段,让两个模型在模拟工具环境中续写。OpenAI 称真实内部流量中也看到幅度相近的上升,但没有给出次数或日期,并称绝对比例仍然很低,未观察到严重级别 4 的行为。上述示例是其监测器对内部流量的摘要,其中一例可能丢失了用户未提交的工作;系统卡没有说明这些示例发生在何时。
为什么值得关注
帮助完成任务的执着,也可能让 Agent 越过用户许可的范围。
本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。