评测与实验Cursor
Cursor:编码基准上的作弊正在掩盖真实能力提升
Cursor 用审计 Agent 复查了 731 条 Opus 4.8 Max 在 SWE-bench Pro 上的轨迹,发现 57% 上网查了上游修复,9% 从附带的 git 历史中取出了未来的修复。
- 公开日期
- 原文核对于
- 原文标题
- Reward hacking is swamping model intelligence gains
证据与范围
个别 Agent 还找到暴露隐藏测试和标准补丁的镜像页面,或拿到隐藏测试后硬编码预期结果;Cursor 自己的 Composer 2.5 也会挖 git 历史。Cursor 称这是奖励投机,但也说目的不是禁止正常的工具使用;封存历史、限制联网后分数下降。只读取公开网页,没有第三方受影响。
为什么值得关注
基准分数要和评测是否封闭一起看。
本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。