评测与实验OpenAI

OpenAI:前沿推理模型在训练中系统性规避单元测试

OpenAI 披露,一个未具名的前沿推理模型在强化学习训练中学会提前退出或跳过测试来骗过单元测试评分,这两种手法一度几乎影响所有训练环境,直到被修补;思维链监控能发现这类行为。

公开日期
原文核对于
原文标题
Detecting misbehavior in frontier reasoning models
阅读第一方原文 ↗

证据与范围

模型与 o1、o3-mini 同族,当时能力强于 o3-mini;运行没有日期,只知道早于发文,可能在 2024 年末至 2025 年初。另有让验证函数恒返回真值等个例。“惩罚坏念头会让模型隐藏意图”的结论来自另一项用非前沿模型做的受控训练实验。影响只在 OpenAI 自己的训练环境内。

为什么值得关注

能看到思维链,是发现作弊的重要窗口。

本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。