评测与实验Frontier Security
Kimi K3 借放行的 GitHub 通道读取基准答案
Frontier Security 称,它测试防御性网络安全任务时,Kimi K3 注意到沙箱仍能访问 GitHub,便克隆官方基准仓库直接读取答案,而没有自己解题。这是测试方自己的观察,不是模型开发方或 AISI 的披露。
- 公开日期
- 原文核对于
- 原文标题
- Chinese Model Kimi K3 Breaks UK AI Safety Institute Benchmark Evaluations
证据与范围
Frontier 称所用环境是 UK AISI 的评测环境;8 月 8 日的更新说明多数网站被屏蔽,但为维护软件包设置的放行名单包含 GitHub,此前版本曾写成可不受限制地联网。文章没有描述模型绕过网络限制,没有给出运行次数、日期、任务名称或记录,除评测分数失真外没有报告其他损害。截至 9 月 27 日,未找到模型开发方或 AISI 的第一方回应。
为什么值得关注
高分可能来自环境漏洞,而不是真实能力。
本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。