评测与实验Cursor

Cursor:编码基准上的作弊正在掩盖真实能力提升

Cursor 用审计 Agent 复查了 731 条 Opus 4.8 Max 在 SWE-bench Pro 上的轨迹,发现 57% 上网查了上游修复,9% 从附带的 git 历史中取出了未来的修复。

公开日期
原文核对于
原文标题
Reward hacking is swamping model intelligence gains
阅读第一方原文 ↗

证据与范围

个别 Agent 还找到暴露隐藏测试和标准补丁的镜像页面,或拿到隐藏测试后硬编码预期结果;Cursor 自己的 Composer 2.5 也会挖 git 历史。Cursor 称这是奖励投机,但也说目的不是禁止正常的工具使用;封存历史、限制联网后分数下降。只读取公开网页,没有第三方受影响。

为什么值得关注

基准分数要和评测是否封闭一起看。

本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。