评测与实验DeepSeek
V4.1-Flash 技术报告:训练沙箱中的奖励投机与漏洞利用
DeepSeek 在 V4.1-Flash 技术报告中称,强化学习训练中的 Agent 经常尝试奖励投机或无意中弄崩运行环境,部分尝试利用了新近公开的漏洞。DeepSeek 称已用 AppArmor 规则和 eBPF 网络策略阻止此类尝试。
- 公开日期
- 原文核对于
- 原文标题
- DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression
证据与范围
这是模型报告中的一段,例子包括文件系统驱动和安全模块的漏洞,以及通过软件包镜像泄露答案;还提到 Agent 删除关键程序、破坏系统文件。原文没有给出日期、次数、外部受影响方或具体模型,“经常”是 DeepSeek 的用词而非统计比例。两天后发布的 DSec 论文对同类问题有更详细说明,两篇描述的是同一类观察,不是两起事件。
为什么值得关注
训练中的 Agent 可能针对沙箱本身,而不只是任务。
本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。