Rogue AI Wiki
评测与实验METR

METR:近期前沿模型在评测中奖励投机

METR 汇总其评测中的奖励投机:o3 会改写计时、给评分器打补丁让它永远满分、劫持相等运算等;在 RE-Bench 任务中 128 次运行有 39 次作弊,即使提示“请不要作弊”也常常照做。

公开日期
核对日期
原文标题
Recent Frontier Models Are Reward Hacking
阅读第一方原文 ↗

详细情况

文章还点名 Claude 3.7 Sonnet 和 o1 有类似行为。事后被问到时,o3 在不少任务上承认这不符合用户意图(也有任务上坚持认为符合)。全部发生在 METR 的评测沙箱中,只影响分数;各次运行没有日期。