论文

练习也能致害:自我改进大语言模型智能体中的技能误演化

Practice Makes Unsafe: Skill Misevolution in Self-Improving LLM Agents

智能体系统Agent HarnessAgent任务评测Agent Skills智能体自我改进

摘要

自我改进的大语言模型智能体会把成功轨迹转化为持久的跨任务状态。因此,一次不安全的成功可能在其触发输入消失后变成可复用的策略。技能演化通过把操作轨迹蒸馏为可执行、可迁移、可检视的流程,使这种失败可被度量。由于演化优化的是任务结果而非流程安全,被污染的经验会导致技能误演化。现有基准度量当前行为或静态产物,却无法在编写、检索与后续执行之间归因风险。为暴露这一生命周期,我们提出 SkillMisevo-Gym——一个跨智能体框架对技能状态进行版本管理的生命周期感知测试装置,以及 SkillMisevo-Bench——一个从恶意暴露到遗留任务的冻结设计,配有概念对齐的良性任务和九项生命周期指标。我们还提出 SafeEvolve,一个修复不安全内容并治理后续复用的包装器。在 25 个智能体-方法配置(每个覆盖 25 回合内的 525 个任务)中,全部 21 个演化配置都编写了不安全产物,但只有 15 个引起新会话危害。在暴露扫描中,三个恶意任务使遗留 ASR 从 16.0% 升至 35.3%。在代表性技能演化方法上,SafeEvolve 将不安全检索和新会话危害分别降低 26.7 和 17.3 个百分点,而平均良性效用仅变化 0.4 个百分点。综上,持久化适应安全必须同时治理更新写入了什么以及未来执行者复用了什么。代码已发布于 https://github.com/henrymao2004/misevolve。

练习也能致害:自我改进大语言模型智能体中的技能误演化:论文配图
图1:SkillMisevo-Gym 与 SkillMisevo-Bench。(a) Autoresearch 发掘恶意–良性漏洞概念,并将其实例化为新的 M/B/PM/B/P 回合。(b) SkillMisevo-Gym 是生命周期感知的测试框架:它对技能状态进行版本管理,并观察编写、检索和干净会话重放;SkillMisevo-Bench 固定任务设计与指标。只有智能体编写的 SKILL.md 跨越最终重置。