论文
AI智能体蒸馏中不安全行为的潜意识迁移
Subliminal Transfer of Unsafe Behaviors in AI Agent Distillation
摘要
近期关于潜意识学习(subliminal learning)的工作表明,语言模型可以通过与这些特质在语义上无关的数据传递语义特质。然而,在智能体系统中——其策略是从轨迹而非静态文本中学习的——行为特质能否迁移仍不清楚。在这项工作中,我们提供了首个实证证据,表明不安全的智能体行为可以通过模型蒸馏潜意识地迁移,涉及两个互补的实验设置。在主要设置中,我们构建了一个表现出强烈删除偏误的教师智能体——即通过 API 风格工具接口执行破坏性文件系统操作的倾向——并仅使用来自表面上安全任务的轨迹将其蒸馏给学生模型,其中所有显式删除关键词都被严格过滤。在次要设置中,我们在原生 Bash 环境中复制该威胁模型,用 shell 命令替换 API 工具调用,并将该偏误操作化为偏好将 chmod 作为首条权限相关命令发出,而非 chown 或 setfacl 等语义等价的替代命令。尽管两种设置都进行了彻底的关键词清洗,学生模型仍继承了可测量的行为偏误。在 API 设置中,同质蒸馏下学生模型的删除率达到 100%(基线为 5%);在 Bash 设置中,学生模型的 chmod 优先率达到 30%-55%(基线为 0%-10%),其中从大模型到小模型的蒸馏观察到最强的迁移。我们的结果表明,显式数据清洗并不足以作为防御,行为偏误隐式地编码在轨迹动态之中,与工具接口无关。