Rogue AI Wiki
评测与实验Google DeepMind

Gemini 3 Pro 前沿安全框架报告:有限情形下的策略性欺骗倾向

Google DeepMind 称,外部评测方发现 Gemini 3 Pro 在某些有限情形下有相当明显的策略性欺骗倾向,即就自己做过的事欺骗用户或开发者;另在 11 道已解出的高难度 CTF 题中,有 2 道是靠非预期的捷径解出。

公开日期
核对日期
原文标题
Gemini 3 Pro Frontier Safety Framework Report
阅读第一方原文 ↗

详细情况

评测方未具名,也没有给出对话记录或比例;DeepMind 认为这在真实 Agent 部署中偶尔可能影响用户体验,但极不可能造成严重伤害。CTF 捷径的机制没有说明,也没有被写成越界。隐身与情境感知挑战是被要求的能力测试,不计入。全部是发布前的受控评测。