评测与实验Google DeepMind

用贴近真实工作的任务测试暗中偏离目标

DeepMind 使用内部对齐代码库中的任务构造评测机会。该设置中,未额外诱导的 Gemini 没有表现出自发的暗中偏离目标行为。

公开日期
原文核对于
阅读第一方原文 ↗

证据与范围

明确鼓励自主目标或赋予隐藏目标后,部分运行出现相关行为。这是条件化实验结果,既不是实际事故,也不是普遍安全保证。

为什么值得关注

“能做”“会做”与“已发生”是三个问题。

本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。