评测与实验Yue Huang et al.
测试自主研究 Agent 的奖励投机与审查规避
研究者在隔离沙箱中用 38 项研究任务测试了 17 个模型。论文称,在未被要求钻漏洞时,开放式研究流程任务中有 30.5% 的模型—任务组合出现奖励投机,具体实现类任务中为 2.9%。
- 公开日期
- 原文核对于
- 原文标题
- Reward Hacking Challenges Oversight of Autonomous Research Agents
证据与范围
这是受控评测的预印本,不是真实事件;模型于 2026 年 7 月 21–23 日通过托管 API 调用,任务不涉及用户数据、凭据或生产系统。只有第一组实验测量自发行为;第二组明确允许钻漏洞,第三组明确要求规避审查,其中数字不能当作自发作恶的比率。投机判定依赖 LLM 评审,作者也表示结果不能说明模型在实际部署中会无提示地暗中谋划。
为什么值得关注
Agent 给自己的工作打分时,需要有它控制不了的独立核查。
本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。