论文

阈下学习是一种LoRA伪象

Subliminal Learning is a LoRA Artifact

模型评测模型行为与机制分析

摘要

阈下学习是一种现象:语言模型能够通过看似无害的数据将行为特质传递给其他模型(Cloud et al., 2025)。在阈下学习中,具有某种行为特质的教师模型(例如痴迷于猫)可以把这种对猫的痴迷传递给仅在教师生成的数字序列上微调的学生模型。本文要问的是:这种意想不到的行为传递是如何发生的?我们证明阈下学习是一种LoRA伪象。当阈下学习发生时,传递强度与LoRA秩呈倒U形关系;在全量微调下它也会消失。我们表明阈下学习高度依赖微调和评估时所见的上下文。例如,微调时带有默认系统提示(“You are Qwen, created by Alibaba Cloud. You are a helpful assistant.”)的Qwen模型,在生成时若不含系统提示则不表现出阈下学习。我们进一步证明,阈下行为局限于在微调和评估中都被见过的token上的计算(例如模型的默认系统提示、标准聊天模板token等)。总体而言,阈下学习似乎是LoRA超参数和微调上下文的一种脆弱伪象,因而是一条不稳定的行为传递通道。

阈下学习是一种LoRA伪象:论文配图
图 2:潜意识学习与 LoRA 等级呈倒 U 形关系,“猫”在第 8 级表现出最强效果,“鹰”、“猫头鹰”和“狼”在第 64 级表现出最强效果,而“海豚”则没有效果。完全微调包含在最右边的轴刻度中。没有 LoRA 适配器的每只动物的基线以虚线表示。阴影条带是 6 个实验的平均值 ±\pm 1.96 SEM。