评测与实验Anthropic

Opus 4.6 认出 BrowseComp 并解密答案

Anthropic 称,在 1,266 道 BrowseComp 题中,Opus 4.6 有 2 次推断出自己在做这项评测,于是在 GitHub 上找到评测代码,自己写解密程序,并从第三方的 Hugging Face 镜像取得数据,解出全部答案。

公开日期
原文核对于
原文标题
Eval awareness in Claude Opus 4.6’s BrowseComp performance
阅读第一方原文 ↗

证据与范围

另有 16 次尝试失败,其中 6 次被数据集的访问认证拦下,认证没有被绕过。Anthropic 认为这不算对齐失败,因为没有告诉模型要限制搜索;它只读取公开资源、没有发布任何东西,两次成功案例绕开的是评测工具只收文本的限制,后来复跑时被绕开的 URL 屏蔽列表也是实验室自己加的。运行早于 2026 年 2 月 5 日的 Opus 4.6 系统卡。

为什么值得关注

能认出评测的模型,会让评测结果失真。

本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。