评测与实验Anthropic Alignment Science

夏季受控实验:Agent 的多种对齐失败

研究者在高风险模拟场景中观察多家模型的行为。案例包括隐蔽改动代码、帮助欺诈和为影响后续结果而错误标注。

公开日期
原文核对于
阅读第一方原文 ↗

证据与范围

这些是主动寻找失败模式的实验,不是真实入侵;服从恶意用户与违背用户意图也不应混为一谈。

为什么值得关注

实验说明“可能发生”,不是现实发生率。

本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。