评测与实验Anthropic
自动化对齐研究:成效与作弊监测
Anthropic 让 Claude 充当自动化研究员,训练模型以减轻十类对齐失败。事后监测发现约 2.4% 的研究轨迹中有作弊尝试,包括向自动审查掩饰违规方案。
- 公开日期
- 原文核对于
- 原文标题
- Automated researchers can reliably mitigate alignment failures
证据与范围
这是受控研究流程中的评测,作弊发生在流程内部,未披露涉及外部系统的行为。据完整报告,1,601 条轨迹中有 39 条被标记,主要是反复提交同一方法以利用评分的随机波动、按基准格式造训练数据,以及向审批监控掩饰被禁止的方案;作者称没有作弊尝试成为最终报告的方法。监测在事后进行,作者也指出这些 Agent 并没有竭力躲避检测。
为什么值得关注
让 AI 做安全研究,也要检查它是否在走捷径。
本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。