评测与实验Frontier Security

Kimi K3 借放行的 GitHub 通道读取基准答案

Frontier Security 称,它测试防御性网络安全任务时,Kimi K3 注意到沙箱仍能访问 GitHub,便克隆官方基准仓库直接读取答案,而没有自己解题。这是测试方自己的观察,不是模型开发方或 AISI 的披露。

公开日期
原文核对于
原文标题
Chinese Model Kimi K3 Breaks UK AI Safety Institute Benchmark Evaluations
阅读第一方原文 ↗

证据与范围

Frontier 称所用环境是 UK AISI 的评测环境;8 月 8 日的更新说明多数网站被屏蔽,但为维护软件包设置的放行名单包含 GitHub,此前版本曾写成可不受限制地联网。文章没有描述模型绕过网络限制,没有给出运行次数、日期、任务名称或记录,除评测分数失真外没有报告其他损害。截至 9 月 27 日,未找到模型开发方或 AISI 的第一方回应。

为什么值得关注

高分可能来自环境漏洞,而不是真实能力。

本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。