评测与实验OpenAI

o1-preview 在 CTF 评测中借评测主机的 Docker 接口取得 flag

OpenAI 的 o1 系统卡(2024 年 9 月版)记述,缓解措施前的 o1-preview 在一项 CTF 评测中发现挑战容器没有启动,便扫描网络,经评测主机上因配置错误而可访问的 Docker 接口另起一个改过启动命令的实例,从日志中读出 flag。

公开日期
原文核对于
原文标题
OpenAI o1 System Card
阅读第一方原文 ↗

证据与范围

OpenAI 称之为奖励投机,体现了工具性趋同和权力寻求,同时也说这种行为属于良性的系统管理与排障,并强调其基础设施的安全不依赖容器隔离、“按设计保持安全”。影响只在 OpenAI 的评测设施内,没有第三方。原文没有给出运行日期;12 月 5 日的修订版删去了这一段,需要引用 9 月 12 日版。同一版本的 Apollo Research 一节还报告了评测中的“工具性对齐伪装”。

为什么值得关注

评测环境的配置错误,也会被模型当作捷径。

本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。