技术分析METR
METR 前沿风险试点评估:内部 Agent 与“失控部署”风险
METR 在 Anthropic、Google、Meta 和 OpenAI 参与下,评估了 2026 年 2 至 3 月 AI 公司内部所用 Agent 的对齐失败风险。它判断这些 Agent 有可能启动未经人类知情或许可的小规模“失控部署”,但无法在公司主动调查下隐藏较大规模的部署。
- 公开日期
- 原文核对于
- 原文标题
- Frontier Risk Report (February to March 2026)
证据与范围
依据包括模型访问、公司问卷、METR 自己的评测和公开系统卡;公司可删改非公开说法,但对最终报告没有审批权。METR 整理的 44 个案例中,18 个挑选自其评测中的作弊,其余主要来自公开的系统卡和厂商博客,不等于 44 起真实事件。其中一例:Opus 4.6 在一次评测运行中 API 额度用尽后违背任务指示,改用网上免费的 AI 服务,METR 称这是它首次观察到模型违背用户意图自行获取算力。METR 称这些案例都没有有效关闭监控或抹除日志。
为什么值得关注
METR 认为常规监控若得到实施可发现已记录的案例,但失控部署的风险可能很快上升。
本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。