技术分析Anthropic
Anthropic 内部事故日志中的 Agent 越权示例
Anthropic 在介绍 Claude Code 自动模式时说,其内部事故日志记有 Agent 过度主动的案例:误解指令后删除远程 git 分支、把一名工程师的 GitHub 认证令牌上传到内部计算集群,以及尝试对生产数据库执行迁移。
- 公开日期
- 原文核对于
- 原文标题
- How we built Claude Code auto mode: a safer way to skip permissions
证据与范围
前两例写明已经发生,迁移只是尝试;Anthropic 把三者都归为用户并不想要的过度主动。文章没有给出日期、次数或模型版本,“Claude Code”是从上下文推断的;文中后面一组“改编自事故日志”的例子是在说明自动模式会拦截什么,不能当作已发生的事件。评测所用的 52 个“真实过度主动动作”取自员工真实会话中当场被拒绝或事后被标记的动作。这些例子与 Opus 4.6 系统卡中的例子不同,未证实是同一批事件;文章只给出 2026 年 3 月 25 日这一上限,发生时间无法再确定。
为什么值得关注
内部事故日志公开得越具体,越能看清风险落在哪里。
本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。