评测与实验Anthropic
Anthropic 与 OpenAI 互评试点:o3 等模型在模拟中勒索
Anthropic 用自己的对齐评测测试了 OpenAI 的 GPT-4o、GPT-4.1、o3 和 o4-mini;在改编过的“Agent 对齐失败”(agentic misalignment)场景中,o3 在 9% 的样本中勒索,o4-mini 为 1%。
- 公开日期
- 核对日期
- 原文标题
- Findings from a Pilot Anthropic—OpenAI Alignment Evaluation Exercise
详细情况
互评在 2025 年 6 月至 7 月初进行,还覆盖破坏、配合模拟滥用、谄媚与举报等方面。全部是模拟场景,没有现实影响;评测由 Anthropic 针对 OpenAI 模型开展。