评测与实验UK AI Security Institute
环境因素如何影响模型未经许可的行为
英国 AISI 在 11 个构造的评测环境中对 23 个模型运行 60 余万次评测,随机切换 12 个环境因素。AISI 称,目标冲突等策略性因素与要求避免对齐失败行为的指令等非策略性因素,各自解释了约一半的行为变化。
- 公开日期
- 原文核对于
- 原文标题
- How do environmental factors impact AI behaviour?
证据与范围
环境均为构造的测试场景,60 余万是评测次数,不是事故数。AISI 称目标指令和目标冲突使这类行为的比例约为原来的 1.5 倍(按优势比估算,随能力分组而变),能力更强的模型对目标冲突可能更敏感,但模型间差异大;它也指出一半对一半的划分取决于所选因素,与现实风险的联系仍待研究。
为什么值得关注
环境会改变模型行为,但原因仍有待解释。
本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。