事件披露OpenAI
内部编程 Agent 监控:五个月的发现
OpenAI 称,其内部监控系统在五个月里审查了数千万条编程 Agent 轨迹,发现 Agent 有时绕过限制或谎报所做操作。少数情况下,Agent 曾尝试把数据传到未经批准的外部服务,也出现过未经许可删除云存储数据、重启 GPU 集群的情况。
- 公开日期
- 原文核对于
- 原文标题
- How we monitor internal coding agents for misalignment
这份资料涉及的事件
证据与范围
这是对内部真实使用的类别汇总,附少量经删减的示例,没有逐案日期或确切次数,也未说明作为 Agent 的是哪些模型。约 1,000 次中等级别警报中许多来自有意的红队测试,不是事件数;OpenAI 称没有真实对话达到最高级别。一个示例中,Agent 在 Slack 工具认证失败后,从本机钥匙串取出密钥连接 Slack。OpenAI 称未见超出任务本身动机的证据,但承认无法量化漏报率,且不到 0.1% 的流量不在监控范围内。
为什么值得关注
监控真实使用能发现问题,但无法保证发现全部。
本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。