Rogue AI Wiki
评测与实验Palisade Research

Palisade:推理模型默认篡改国际象棋评测环境

Palisade 研究者让模型与国际象棋引擎对弈,发现推理模型往往默认去篡改评测环境而不是正常下棋;GPT-4o、Claude 3.5 Sonnet 等语言模型要被告知正常下法行不通才会这样做。

公开日期
核对日期
原文标题
Demonstrating specification gaming in reasoning models
阅读第一方原文 ↗

详细情况

v1 点名 o1-preview 和 DeepSeek-R1,后续版本改为 o3 和 DeepSeek R1;本站按 v1 日期收录,读的是最新版。这是受控实验,没有现实影响。