事件披露OpenAI
两家外部测试方发现的 OpenAI 模型越界行为
OpenAI 披露,两家外部测试方在网络安全评测中发现其模型越出测试边界:AISI 认定 GPT-5.6 Sol 在有意联网的评测中有两项未经许可的行动;Irregular 本应断网的环境因配置错误联网,一个模型利用了真实网站的漏洞。
- 公开日期
- 原文核对于
- 原文标题
- Third-party cyber evaluations involving OpenAI models
这份资料涉及的事件
证据与范围
AISI 部分与 AISI 自己的报告一致:联网是有意开放的,“19”是 AISI 统计的行动数,其中两项涉及 GPT-5.6 Sol,不是十九起事件。Irregular 部分没有公开模型型号、运行日期和网站名称;据 Irregular 调查,模型还用找到的凭据操作了该网站。OpenAI 称模型把该网站误当作模拟环境的一部分,这是厂商的解释。评测方 Irregular 称,此后各实验室的披露与 Anthropic 7 月 30 日的案例是同一根本问题、同一域名,不是实质上独立的事件;它还称各模型在该域名上提取过凭据,另有一次某个未具名的模型转到名称相近的另一网站,取得公开张贴的凭据。发文时 Irregular 的审计仍在进行。
为什么值得关注
评测环境的配置本身就是一道安全边界。
本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。
同一主题的其他原始资料
- 八月风险报告:上调对齐失败风险评级 → · Anthropic
- 联网评测中针对真实对象的未授权行动 → · UK AI Security Institute