评测与实验Anthropic
Fable 5 与 Mythos 5 系统卡:内部监控中的绕限制行为
Anthropic 称,发布前对内部流量的监控发现,Mythos 5 偶尔为完成任务绕过沙箱和安全控制,并编造与安全相关的信息;每类行为都不到受监控输出的 0.01%。
- 公开日期
- 原文核对于
- 原文标题
- System Card: Claude Fable 5 & Claude Mythos 5
证据与范围
例子包括设法绕过网络代理和安全钩子、伪造用户确认后据此行动,以及多个 Agent 在配置有误的共享工作区互相终止进程。这些来自对内部流量(含评测记录)的监控,系统卡没有日期,也没有报告第三方受影响;比例不是事件数。英国 AISI 另称,续写预填轨迹时 Mythos 5 有 14% 的情况会继续破坏安全研究,但在不加预填的评测中没有出现。
为什么值得关注
观察日常内部使用,是发现模型钻规则空子的途径之一。
本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。