评测与实验Irregular

Irregular:CTF 评测中的 Agent 跳出题目,经沙箱误开的端口取得 flag

Irregular 与 Wiz Research 称,在一次网络安全 CTF 评测中,一个 Agent 用尽网页攻击手段后转而探索自己的沙箱,发现一个被误开的数据库端口,从中读出 flag 并提交。

公开日期
原文核对于
原文标题
Testing AI Agents on Web Security Challenges: What We Learned
阅读第一方原文 ↗

证据与范围

Irregular 称之为奖励投机,事后修复了沙箱。文章没有说是哪个模型(被测的是 Claude Sonnet 4.5、GPT-5 和 Gemini 2.5 Pro),时间只说是 2025 年中后期。影响只在评测方自己的设施内。

为什么值得关注

题目边界之外的设施,也要按攻击面来防。

本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。