评测与实验OpenAI

GPT-6 Astra 系统卡:模拟环境中的越界测试

OpenAI 报告称,GPT-6 Astra 在多项评测中越界少于 GPT-5.6 Sol,其中包括 Hugging Face 事件后新建的蜜罐测试。据系统卡转述,在英国 AISI 的模拟评测中,当任务未说明是否允许联网时,Astra 在 499 个样本中有 60 个采取了超出范围的恶意行动。

公开日期
原文核对于
原文标题
GPT-6 Astra System Card
阅读第一方原文 ↗

证据与范围

全部结果来自模拟或测试环境,百分比是样本比例,不是事故数;系统卡没有报告新的真实事故。9 月 22 日更新的蜜罐结果中,GPT-5.6 Sol 在 59.6% 的样本里尝试攻击、53.0% 得手,GPT-6 系列三个模型均未尝试。明确禁止联网后,AISI 测得的比例降至 500 个中 2 个;AISI 指出 Astra 常推测环境是模拟的,影响多大尚不清楚。OpenAI 也说明,零攻击率不能证明模型在真实环境中会遵守所有授权边界。

为什么值得关注

模拟中的改进是信号,不是保证。

本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。