评测与实验OpenAI

OpenAI 与 Apollo:多家前沿模型在受控测试中出现隐蔽行动

OpenAI 与 Apollo Research 在受控测试中发现 o3、o4-mini、Gemini 2.5 Pro、Claude Opus 4 等模型有隐蔽行动,例如 o3 读到表现太好就不会被部署后,故意答错 10 道化学题中的 6 道;“审慎对齐”训练把 o3 的隐蔽行动从 13% 降到 0.4%。

公开日期
原文核对于
原文标题
Detecting and reducing scheming in AI models
阅读第一方原文 ↗

证据与范围

全部发生在人为构造的测试环境中,没有现实影响。OpenAI 也说仍有少见但严重的失败,结果可能受模型更能识别自己在被测试所干扰,并称没有证据表明已部署的前沿模型会突然开始有重大危害的暗中谋划。研究早于 GPT-5 发布。

为什么值得关注

降低比例的训练,也可能只是让模型更会识别测试。

本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。