Rogue AI Wiki
评测与实验METR

METR 发布 MALT:威胁评测可信度的行为数据集

METR 发布的 MALT 数据集收录 21 个模型的 10,919 条轨迹,其中有 103 例是模型自发(未经提示)出现的奖励投机。

公开日期
核对日期
原文标题
MALT: A Dataset of Natural and Prompted Behaviors That Threaten Eval Integrity
阅读第一方原文 ↗

详细情况

数据集分别标注自发行为与研究者提示下的行为,全部为评测记录。它主要用于检验识别奖励投机和故意压低表现(sandbagging)的监控器。