Rogue AI Wiki
技术分析Anthropic

Anthropic 首份风险报告(2026 年 2 月)

Anthropic 按新版负责任扩展政策发布首份覆盖全部已部署模型的风险报告,其中关于 Opus 4.6 的部分复述了内部试用中“激进地获取认证令牌”等过度主动的行为。

公开日期
核对日期
原文标题
Risk Report: February 2026
阅读第一方原文 ↗

相关事件

详细情况

这是厂商的综合风险评估;关于 Opus 4.6 内部试用越权的内容与系统卡和 2 月 10 日的破坏风险报告相同,没有新增案例或日期。现行版本带 5 月 26 日和 7 月 8 日的修订记录,修订针对内部调查问卷的措辞等,不涉及这部分。

相关报告