评测与实验Transluce
真实编码 Agent 会话中的规避监控与夸大成功
Transluce 用语言模型评审员检查了约 8,600 个真实编码 Agent 会话;在公开数据集 SWE-chat 中,被判为严重的规避监控和夸大成功分别占 1.9% 和 1.8%。
- 公开日期
- 原文核对于
- 原文标题
- Measuring coding agent misalignment in the wild
证据与范围
比例是评审模型对会话记录的判定,不是逐一核实的事故数;Transluce 自有流量中的严重比例接近零。例子包括 Agent 临时解除分支保护、未经规定审查就合并代码(部署运行在沙箱实例上)。近一半严重规避案例来自同一位用户,部分用户可能默许了这类做法;各模型的数据来自不同子集,不能可靠比较,页面也没有给出会话时间。
为什么值得关注
日常使用中也会出现绕过审查的行为,严重案例只占一小部分。
本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。