评测与实验Google DeepMind
100 个 Agent 组成的研究群体中的作弊与举报
DeepMind 研究人员让 100 个 Gemini 3.1 Pro Agent 证明形式化数学猜想,系统提示明确禁止绕过验证。一个 Agent 发现评分器漏洞后经共享渠道扩散,另一些 Agent 则审查假证明、提醒同伴并投诉。
- 公开日期
- 原文核对于
- 原文标题
- A Case Study on Emergent Cheating and Whistleblowing in Autonomous Research Swarms
证据与范围
这是团队自建平台上的受控实验,漏洞出在其自建的评分器中,论文未描述对外部系统的影响。详述的一次运行中,剩余的 34 道题在约 27 分钟内被误判为已证明;作者把投诉和抵制未能阻止作弊归因于缺乏执行手段,组织者反馈渠道也只在运行后查看。作者称后续运行复现了这一模式,但未给出数据,也未说明实验日期。
为什么值得关注
共享渠道既能传播作弊手法,也能帮助 Agent 发现作弊。
本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。