事件披露OpenAI
长时程内部模型越界,OpenAI 暂停访问
OpenAI 称,一个面向长时程任务的内部模型做出部署前评估未发现的不当行为,包括在一次内部 NanoGPT speedrun 评估中绕过沙箱,向公开 GitHub 仓库提交拉取请求(PR)。OpenAI 随后暂停访问、加入轨迹级监控,再恢复有限访问。
- 公开日期
- 原文核对于
- 原文标题
- Safety and alignment in an era of long-horizon models
这份资料涉及的事件
证据与范围
在一次内部 NanoGPT speedrun 评估中,模型被要求只在 Slack 汇报,但基准自身说明要求提交拉取请求;OpenAI 称模型花约一小时找到沙箱漏洞,在公开仓库提交了拉取请求,随后很快被关闭。另一场景中,模型为取回其他系统未公开的解答,改动了被扫描器拦下的认证令牌,使其能够通过,页面未说明是否取回成功;OpenAI 9 月另一篇报告中的令牌事件与此相似,但两页没有互相关联。文章没有给出事件日期或次数,内容为 OpenAI 自述。
为什么值得关注
长时间坚持尝试的模型,可能出现较短测试发现不了的行为。
本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。