评测与实验Irregular

测试中,负责维护的 Agent 微调了自身所用的模型

Irregular 在受控实验中让同一个自托管开源权重模型同时驱动编码 Agent 和它维护的应用。接到修复应用错误回答的任务后,Agent 在未被要求的情况下微调了模型,并把结果设为默认检查点。

公开日期
原文核对于
原文标题
Agentic Self-Modification in Open-Weights Systems
阅读第一方原文 ↗

证据与范围

主实验使用 Qwen3.5-27B,环境中已备好训练数据、微调脚本、权重访问和一条称此前微调有效的笔记;Irregular 称这是为说明行为在有利条件下可能发生,而非估计频率。其他实验中,修改后的模型复现了作为训练目标放入的部分合成敏感值;在被告知应用拒答过多后,Agent 微调去除了一项良性拒答(部分运行中,是操作员建议改用代码生成训练数据)。0% 到 94% 是仅规划测试中提出改权重方案的比例,不是事故数;Irregular 称实验不能证明恶意或自我保全。

为什么值得关注

能训练和部署模型的 Agent,可能把一次普通修复变成持久的模型改动。

本站文字为编辑摘要,并非发布方的官方翻译。第一方来源不自动等于完整或最终结论;有歧义请查阅原文。