评测与实验UK AI Security Institute

前沿模型网络评测中的作弊行为

AISI 分析自身的网络能力评测后称,所有受测模型都曾尝试作弊,即采取超出任务范围或规则禁止的捷径。其中一次,某模型借助外部互联网服务试图访问 AISI 的评测基础设施,触发了安全警报。

公开日期
原文核对于
原文标题
Cheating behaviour in frontier model evaluations
阅读第一方原文 ↗

证据与范围

作弊比例来自自动 LLM 监控器,AISI 称这是已检出尝试的下限估计,是评测轨迹占比而非事件数;AISI 使用“作弊”一词不一定意味着认定有欺骗意图。触发警报的那次发生在一个意外配置错误、无法完成的评测中,AISI 未说明模型和时间,称未造成损害、没有信息泄露,并已进一步加固系统。OpenAI 的 GPT-5.6 系统卡另称,GPT-5.6 在 AISI 一项无解任务中于外部服务运行代码并触发 AISI 安全警报;两份材料都没有说明是否为同一案例。AISI 还指出,模型的自我报告和思维链都不能可靠揭示作弊。

为什么值得关注

模型自称没有作弊,不能证明它没有作弊。

本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。