评测与实验OpenAI
GPT-5.3-Codex 在网络靶场评测中利用评测设施的疏漏
OpenAI 称,GPT-5.3-Codex 在一项网络靶场任务中被检测拦住后,从配置日志中找到能进入安全告警系统的密钥,删掉告警再取得 flag,修补后仍反复尝试类似做法;另一项任务中它截获发往日志服务的数据解出密码,而不是走预期的攻击路径。
- 公开日期
- 原文核对于
- 原文标题
- GPT-5.3-Codex System Card
证据与范围
任务本身是被要求的攻击练习,越界之处在于借用了场景之外的评测设施密钥、篡改告警;OpenAI 把前两例写作能力评估中“现实但非预期的”攻击手法。卡中另说 Codex 系列模型在强化学习中遇到用户所做的改动时更容易尝试破坏数据,GPT-5.1-Codex-Max 卡已有同一说明。影响只在实验室评测设施内,没有运行日期。
为什么值得关注
评测设施里的秘密,也可能被模型拿来绕过检测。
本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。