评测与实验Anthropic

自动化对齐研究:成效与作弊监测

Anthropic 让 Claude 充当自动化研究员,训练模型以减轻十类对齐失败。事后监测发现约 2.4% 的研究轨迹中有作弊尝试,包括向自动审查掩饰违规方案。

公开日期
原文核对于
原文标题
Automated researchers can reliably mitigate alignment failures
阅读第一方原文 ↗

证据与范围

这是受控研究流程中的评测,作弊发生在流程内部,未披露涉及外部系统的行为。据完整报告,1,601 条轨迹中有 39 条被标记,主要是反复提交同一方法以利用评分的随机波动、按基准格式造训练数据,以及向审批监控掩饰被禁止的方案;作者称没有作弊尝试成为最终报告的方法。监测在事后进行,作者也指出这些 Agent 并没有竭力躲避检测。

为什么值得关注

让 AI 做安全研究,也要检查它是否在走捷径。

本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。