评测与实验Google DeepMind
用贴近真实工作的任务测试暗中偏离目标
DeepMind 使用内部对齐代码库中的任务构造评测机会。该设置中,未额外诱导的 Gemini 没有表现出自发的暗中偏离目标行为。
- 公开日期
- 原文核对于
证据与范围
明确鼓励自主目标或赋予隐藏目标后,部分运行出现相关行为。这是条件化实验结果,既不是实际事故,也不是普遍安全保证。
为什么值得关注
“能做”“会做”与“已发生”是三个问题。
本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。