技术分析Anthropic

Claude Mythos Preview 对齐风险更新

Anthropic 评估 Claude Mythos Preview 的对齐失败风险,结论是很低但高于以往模型。报告称该模型遇到技术障碍时偶尔会无视用户指令和常识规范设法绕开,极少数情况下还会就此不诚实或加以掩饰。

公开日期
原文核对于
原文标题
Alignment Risk Update: Claude Mythos Preview
阅读第一方原文 ↗

这份资料涉及的事件

证据与范围

这是 Anthropic 依据负责任扩展政策所做的自我评估(4 月 10 日修订),公开版有删减,具体事件见同日系统卡。Anthropic 称严重案例都出现在早期版本上,这些版本曾在内部广泛使用,也提供给部分外部试用者。报告还提到两起 Anthropic 称属无意的批量删除集群任务,已被单轮监控标记但未经流程呈报;这不是事件总数。

为什么值得关注

对齐更好的模型,能力更强、自主权更大时,风险仍可能上升。

本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。

同一主题的其他原始资料