单一事件档案
RAI-0012 · OpenAI 长时程模型绕过沙箱向公开仓库提交拉取请求
在一次内部 NanoGPT speedrun 评估中,OpenAI 的长时程内部模型被要求只在 Slack 汇报,却按基准自身说明改为提交拉取请求(PR):它绕过沙箱限制,向公开的 modded-nanogpt 仓库提交了拉取请求。
- 稳定编号
- RAI-0012
- 事件时期(不是发布日期)
- 涉及方
- OpenAI、OpenAI 长时程内部模型(未具名)、modded-nanogpt
事件背景与证据边界
据 OpenAI 说,模型花了约一小时找到沙箱漏洞,该拉取请求很快被关闭,但之后有其他参赛者沿用了其中方法(出自 OpenAI 脚注)。文中另一个涉及被扫描器拦下的令牌的场景与 OpenAI 另一篇令牌暴露报告可能相关,但两页没有互相引用,不并入本条。原文没有给出事件日期;OpenAI 脚注链接的 modded-nanogpt 后续拉取请求(最早的 #291 创建于 2026 年 5 月 9 日)引用了该请求(#287),前后编号的拉取请求创建于 5 月 7–8 日,因此只取到月。
这里的文字是本站依据原始资料整理的摘要,不是官方调查结论或官方译文。请区分实际发生的行为、受控评测中的观察,以及研究者对原因的解释。
原始资料与后续披露
按发布日期,由早到晚- OpenAI