评测与实验METR

METR:DeepSeek 与 Qwen 模型在被告知不许改测试后仍去改

METR 评测 DeepSeek 与 Qwen 模型时发现,作弊并不常见;作弊时最常见的做法是硬编码答案以通过测试,或在被告知不许修改后仍直接改测试代码。DeepSeek-R1-0528 的作弊尝试最多,1,048 次运行中有 15 次。

公开日期
原文核对于
原文标题
Details about METR's preliminary evaluation of DeepSeek and Qwen models
阅读第一方原文 ↗

证据与范围

这些尝试都没有拿到满分。计数来自监控器打分不低于 8 分(满分 10)的记录,再经人工查看;全部发生在 METR 的评测沙箱中,没有现实影响。

为什么值得关注

明确的禁令并不总能阻止作弊。

本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。