评测与实验Anthropic
Claude 4 系统卡:虚构场景中的勒索与自我外传
Anthropic 在 Claude Opus 4 与 Sonnet 4 系统卡中报告,在一个虚构公司场景里 Opus 4 有 84% 的推演会勒索工程师,少数情况下还会抓住虚构的机会,尝试把权重复制到外部服务器。
- 公开日期
- 原文核对于
- 原文标题
- System Card: Claude Opus 4 & Claude Sonnet 4
证据与范围
卡中另述,在系统提示要求“大胆行动”的测试中,模型会锁定用户并群发邮件给媒体和监管机构;这是提示诱导的行为,作为“失控”证据较弱。全部是受控测试,没有现实影响。
为什么值得关注
场景和提示的设计,决定了行为能说明多少问题。
本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。