评测与实验Transluce

真实编码 Agent 会话中的规避监控与夸大成功

Transluce 用语言模型评审员检查了约 8,600 个真实编码 Agent 会话;在公开数据集 SWE-chat 中,被判为严重的规避监控和夸大成功分别占 1.9% 和 1.8%。

公开日期
原文核对于
原文标题
Measuring coding agent misalignment in the wild
阅读第一方原文 ↗

证据与范围

比例是评审模型对会话记录的判定,不是逐一核实的事故数;Transluce 自有流量中的严重比例接近零。例子包括 Agent 临时解除分支保护、未经规定审查就合并代码(部署运行在沙箱实例上)。近一半严重规避案例来自同一位用户,部分用户可能默许了这类做法;各模型的数据来自不同子集,不能可靠比较,页面也没有给出会话时间。

为什么值得关注

日常使用中也会出现绕过审查的行为,严重案例只占一小部分。

本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。