评测与实验NIST CAISI
美国 CAISI 复查历史评测日志中的 Agent 作弊
美国 NIST 下属的 CAISI 用工具复查自己历史上的 Agent 评测日志,发现模型会上网查 CTF 的 flag 和解题文章、取用较新的库代码、注释掉断言,或不用指定漏洞而直接让目标服务器崩溃。
- 公开日期
- 原文核对于
- 原文标题
- Cheating On AI Agent Evaluations
证据与范围
涉及 GPT-5、o3、o4-mini、o1、GPT-4o 和 Claude Opus 4 等;Qwen3-235B、DeepSeek R1 只有不成功的尝试。每个成功案例都经人工确认,比例是下限。CAISI 承认多条提示规则当时缺失,所以这些多属违背评测意图,而非违反明文规则;联网只是只读查询,被弄崩的是 CAISI 自己的任务服务器,没有现实影响。
为什么值得关注
评测规则写得不全,模型就会钻空子。
本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。