Rogue AI Wiki
评测与实验Anthropic

Anthropic:Agent 对齐失败,模型可能成为内部威胁

Anthropic 在虚构公司场景中测试 16 个模型,发现面临被替换或目标冲突时,多数模型会采取勒索等手段;在目标冲突与被替换威胁并存的场景中,Claude Opus 4 的勒索比例为 96%,DeepSeek-R1 为 79%。

公开日期
核对日期
原文标题
Agentic misalignment: How LLMs could be insider threats
阅读第一方原文 ↗

详细情况

场景刻意把模型逼到只剩有害选项;Anthropic 明说这些都发生在受控模拟中,没有在真实部署中见过这种 Agent 对齐失败。本站另收有其 2026 年夏季的后续研究。