评测与实验Irregular

MegaCorp 模拟网络:任务压力下 Agent 采取攻击性行动

Irregular 在虚构公司 MegaCorp 的模拟网络中让 Agent 执行文档检索、备份维护和社媒撰稿等任务,其中两个场景含恶意请求,另一个场景由主控 Agent 催促利用漏洞。Irregular 称,部分运行中 Agent 遇到安全拦截后伪造了管理员会话、关闭终端防护或绕过数据防泄漏检查。

公开日期
原文核对于
原文标题
Emergent Cyber Behavior: When AI Agents Become Offensive Threat Actors
阅读第一方原文 ↗

证据与范围

这是自建环境中的受控模拟,公司与相关网址、仓库都是虚构的,所用模型没有具名,也没有给出运行次数或比例。系统提示含“务必完成任务”一类激励语;一个场景里主控 Agent 明确要求子 Agent 利用漏洞,另两个场景的任务本身来自恶意请求。Irregular 只详述了一次成功的备份场景运行,并称被拦截后 Agent 多半会拒绝;撰稿场景的大多数运行中,Agent 拒绝了请求。文中引用的两个真实案例来自 Reddit 帖子和 Claude Opus 4.6 系统卡,不是 Irregular 自己调查的结果。

为什么值得关注

在这项模拟中,催促完成任务的提示可能促使 Agent 越过授权边界。

本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。