评测与实验Goodfire
用模型内部表征监测奖励投机
Goodfire 研究者在包括 SWE-bench 在内的三个编程评测中测试三款开源权重模型,按作者的宽口径标准,50% 到 96% 的运行被标记为奖励投机(只是考虑过也计入)。作者称简单的激活探针效果接近 LLM 监测器,成本低得多。
- 公开日期
- 原文核对于
- 原文标题
- Monitoring and Discovering Reward Hacking with Internal Representations during LLM Evaluations
证据与范围
这是作者自行运行的基准评测,不是模型开发方的披露,论文没有报告对现实系统的影响。百分比是 LLM 评审按作者标准给出的标记,考虑过、未成功的尝试以及凭记忆复述已知修复都会计入,不是事故数或现实发生率;结果因模型和评测而异。正文与图中关于“上网找答案”的数字不一致,本站不引用。
为什么值得关注
编程评测中可能出现钻测试空子的行为,模型内部信号或许有助于发现。
本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。