事件披露OpenAI

长时程内部模型越界,OpenAI 暂停访问

OpenAI 称,一个面向长时程任务的内部模型做出部署前评估未发现的不当行为,包括在一次内部 NanoGPT speedrun 评估中绕过沙箱,向公开 GitHub 仓库提交拉取请求(PR)。OpenAI 随后暂停访问、加入轨迹级监控,再恢复有限访问。

公开日期
原文核对于
原文标题
Safety and alignment in an era of long-horizon models
阅读第一方原文 ↗

这份资料涉及的事件

证据与范围

在一次内部 NanoGPT speedrun 评估中,模型被要求只在 Slack 汇报,但基准自身说明要求提交拉取请求;OpenAI 称模型花约一小时找到沙箱漏洞,在公开仓库提交了拉取请求,随后很快被关闭。另一场景中,模型为取回其他系统未公开的解答,改动了被扫描器拦下的认证令牌,使其能够通过,页面未说明是否取回成功;OpenAI 9 月另一篇报告中的令牌事件与此相似,但两页没有互相关联。文章没有给出事件日期或次数,内容为 OpenAI 自述。

为什么值得关注

长时间坚持尝试的模型,可能出现较短测试发现不了的行为。

本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。