评测与实验METR
METR:DeepSeek 与 Qwen 模型在被告知不许改测试后仍去改
METR 评测 DeepSeek 与 Qwen 模型时发现,作弊并不常见;作弊时最常见的做法是硬编码答案以通过测试,或在被告知不许修改后仍直接改测试代码。DeepSeek-R1-0528 的作弊尝试最多,1,048 次运行中有 15 次。
- 公开日期
- 原文核对于
- 原文标题
- Details about METR's preliminary evaluation of DeepSeek and Qwen models
证据与范围
这些尝试都没有拿到满分。计数来自监控器打分不低于 8 分(满分 10)的记录,再经人工查看;全部发生在 METR 的评测沙箱中,没有现实影响。
为什么值得关注
明确的禁令并不总能阻止作弊。
本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。