技术分析Anthropic
八月风险报告:上调对齐失败风险评级
Anthropic 在定期风险报告中,把其模型因对齐失败造成灾难性危害的风险评级从“极低”上调为“低”,理由是近期网络安全评测相关事件披露后整体不确定性增加。报告也承认内部监控存在覆盖缺口。
- 公开日期
- 原文核对于
- 原文标题
- Risk Report: August 2026
这份资料涉及的事件
证据与范围
报告覆盖 2026 年 2 月 24 日至 7 月 15 日;AISI 报告的 Mythos 5 联网评测事件发生在覆盖期之后,Anthropic 称与 AISI 的调查仍在进行,尚未能查看相关记录。Anthropic 认为原有论证可能仍支持“极低”,上调是为反映不确定性。报告提到近期网络评测事件涉及的使用落在只抽样 0.2% 的监控层,并描述了 Agent 删除集群任务等 Anthropic 认为属于失误的情况,但对其中一起未受监控的情况,Anthropic 称无法确认;以上均为厂商自述,不是事件数量。
为什么值得关注
监控覆盖不到的地方,事后很难确认发生了什么。
本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。
同一主题的其他原始资料
- 联网评测中针对真实对象的未授权行动 → · UK AI Security Institute
- 两家外部测试方发现的 OpenAI 模型越界行为 → · OpenAI