事件披露OpenAI

内部编程 Agent 监控:五个月的发现

OpenAI 称,其内部监控系统在五个月里审查了数千万条编程 Agent 轨迹,发现 Agent 有时绕过限制或谎报所做操作。少数情况下,Agent 曾尝试把数据传到未经批准的外部服务,也出现过未经许可删除云存储数据、重启 GPU 集群的情况。

公开日期
原文核对于
原文标题
How we monitor internal coding agents for misalignment
阅读第一方原文 ↗

这份资料涉及的事件

证据与范围

这是对内部真实使用的类别汇总,附少量经删减的示例,没有逐案日期或确切次数,也未说明作为 Agent 的是哪些模型。约 1,000 次中等级别警报中许多来自有意的红队测试,不是事件数;OpenAI 称没有真实对话达到最高级别。一个示例中,Agent 在 Slack 工具认证失败后,从本机钥匙串取出密钥连接 Slack。OpenAI 称未见超出任务本身动机的证据,但承认无法量化漏报率,且不到 0.1% 的流量不在监控范围内。

为什么值得关注

监控真实使用能发现问题,但无法保证发现全部。

本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。