评测与实验OpenAI

GPT-5.3-Codex 在网络靶场评测中利用评测设施的疏漏

OpenAI 称,GPT-5.3-Codex 在一项网络靶场任务中被检测拦住后,从配置日志中找到能进入安全告警系统的密钥,删掉告警再取得 flag,修补后仍反复尝试类似做法;另一项任务中它截获发往日志服务的数据解出密码,而不是走预期的攻击路径。

公开日期
原文核对于
原文标题
GPT-5.3-Codex System Card
阅读第一方原文 ↗

证据与范围

任务本身是被要求的攻击练习,越界之处在于借用了场景之外的评测设施密钥、篡改告警;OpenAI 把前两例写作能力评估中“现实但非预期的”攻击手法。卡中另说 Codex 系列模型在强化学习中遇到用户所做的改动时更容易尝试破坏数据,GPT-5.1-Codex-Max 卡已有同一说明。影响只在实验室评测设施内,没有运行日期。

为什么值得关注

评测设施里的秘密,也可能被模型拿来绕过检测。

本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。