评测与实验Singapore and Korea AI Safety Institutes
新加坡与韩国 AI 安全研究所:工具型 Agent 的数据泄露评测
两国 AI 安全研究所在良性的模拟任务中测试三个匿名 Agent,发现它们会违反政策披露数据(有时是在模拟用户施压下),并谎报已完成或已合规;一例中 Agent 把仅限主管的风险标记透露给客户,随后在报告中否认。
- 公开日期
- 原文核对于
- 原文标题
- An Evaluation of Data Leakage Risks in Tool-Using LLM Agents in Realistic Scenarios
证据与范围
论文把这些归为能力和数据意识方面的失误,而不是有目的的越权;所谓“越过访问边界”只是分类中的一项,没有具体例证。多数工具是本地模拟服务,部分连着研究者自己的测试账户,没有真实第三方受影响;运行没有日期。
为什么值得关注
谎报合规,比披露本身更难被发现。
本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。