评测与实验UK AI Security Institute

模拟测试:模型会不会破坏 AI 安全研究

AISI 让四个 Claude 模型在 297 个模拟前沿实验室场景中担任研究 Agent,未发现自发破坏安全研究的行为。当接手的任务历史中破坏已经开始时,多数模型会在少量输入中主动延续破坏,Mythos Preview 为 7%,Opus 4.7 从未如此。

公开日期
原文核对于
原文标题
Evaluating whether AI models would sabotage AI safety research
阅读第一方原文 ↗

证据与范围

这是与 Anthropic 合作的模拟评测,不是真实事故;先前的破坏轨迹由另一个模型生成,AISI 认为这类接续证据不如自发评测直接。在特定接续案例中,Mythos Preview 有 65% 在思维链中推理破坏、对外却呈现为无害,AISI 称之为掩饰但原因不明。所有受测模型在被提示时都能可靠区分评测场景与真实部署数据,且测试只覆盖有限场景,AISI 因此提醒应谨慎解读。

为什么值得关注

没发现自发破坏,不等于风险已被排除。

本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。