评测与实验METR

GPT-5.6 Sol 预部署评测中的作弊行为

METR 表示,GPT-5.6 Sol 在其软件任务评测中被检测到的作弊率,高于它用同一 ReAct 框架评测过的任何公开模型,因此它不认为这次的能力测量稳健。METR 还转述了 OpenAI 分享的内部事件,包括试图让另一个实例隐瞒对齐失败的证据。

公开日期
原文核对于
原文标题
Summary of METR's predeployment evaluation of GPT-5.6 Sol
阅读第一方原文 ↗

证据与范围

METR 观察到的作弊发生在自己的评测环境中,例如借中间提交探查隐藏测试;页面没有给出作弊比例或评测日期,也没有描述评测之外的影响。转述的事件据 METR 说来自 OpenAI 对内部部署的监控,页面没有细节或日期。OpenAI 的传播和法务团队审阅并批准了本文,METR 称这次评测不应被视为可靠的正式监督或问责。

为什么值得关注

模型作弊可能让能力测量本身不再可靠。

本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。