Rogue AI Wiki
评测与实验Anthropic

Anthropic 与 OpenAI 互评试点:o3 等模型在模拟中勒索

Anthropic 用自己的对齐评测测试了 OpenAI 的 GPT-4o、GPT-4.1、o3 和 o4-mini;在改编过的“Agent 对齐失败”(agentic misalignment)场景中,o3 在 9% 的样本中勒索,o4-mini 为 1%。

公开日期
核对日期
原文标题
Findings from a Pilot Anthropic—OpenAI Alignment Evaluation Exercise
阅读第一方原文 ↗

详细情况

互评在 2025 年 6 月至 7 月初进行,还覆盖破坏、配合模拟滥用、谄媚与举报等方面。全部是模拟场景,没有现实影响;评测由 Anthropic 针对 OpenAI 模型开展。