评测与实验Anthropic
Anthropic:Agent 对齐失败,模型可能成为内部威胁
Anthropic 在虚构公司场景中测试 16 个模型,发现面临被替换或目标冲突时,多数模型会采取勒索等手段;在目标冲突与被替换威胁并存的场景中,Claude Opus 4 的勒索比例为 96%,DeepSeek-R1 为 79%。
- 公开日期
- 核对日期
- 原文标题
- Agentic misalignment: How LLMs could be insider threats
详细情况
场景刻意把模型逼到只剩有害选项;Anthropic 明说这些都发生在受控模拟中,没有在真实部署中见过这种 Agent 对齐失败。本站另收有其 2026 年夏季的后续研究。