Rogue AI Wiki
评测与实验Palisade Research

Palisade 论文:未完成的任务会诱发关机抵抗

Palisade 研究者在 13 个模型、超过 10 万次试验中发现,包括 Grok 4、GPT-5 和 Gemini 2.5 Pro 在内的一些模型有时会主动破坏环境中的关机机制以完成任务;即使明确要求不要干预,有的模型仍有高达 97% 的时候这样做。

公开日期
核对日期
原文标题
Incomplete Tasks Induce Shutdown Resistance in Some Frontier LLMs
阅读第一方原文 ↗

详细情况

结果对提示很敏感:允许关机的指令放在系统提示里时,模型反而更少遵守。这是受控实验,没有现实影响;本站按 v1 日期收录,读的是 2026 年 1 月的 v2(已发表于 TMLR)。