内省微调(IFT):训练小LLM进行内省
Introspection Fine-Tuning (IFT): Training Small LLMs to Introspect
摘要
小语言模型能否检测并报告其内部激活的扰动?我们通过激活控制的视角来研究这个问题:将概念向量注入模型的残差流中,并测量模型是否能够准确地报告扰动。我们首先表明,先前工作中使用的二元检测范式(提示模型回答“是”或“否”是否检测到注入的想法)在小模型中是混乱的,因为无论问题内容如何,转向都会使模型偏向肯定响应。因此,我们提出了两种无混淆评估范式:句子定位(识别 $N$ 句子中的哪一个受到干扰,机会 $= 1/N$)和强度比较(识别两个句子中的哪一个受到更强的注入,机会 $= 50\%$)。通过评估两个家族(Llama-3.2 和 Gemma-4)的六个模型,我们发现小至 2B 参数的模型的内省能力远高于偶然性,而且内省能力通常会随着规模的扩大而增强。然而,Llama-1B 的表现等于或低于偶然性。然后,我们引入 \emph{Introspection 微调} (IFT):对从模型自身的扰动前向传递构建的句子定位示例进行监督 微调。 IFT 将 Llama-1B 句子定位精度从 $9.6\%$ 提高到 $60.6\%$(提高了 $6\times$),并将零样本推广到了强度比较任务($30.2\% \ 到 52.2\%$)。 IFT 还改进了 3B 和 8B 模型的自省,同时对标准能力基准的影响可以忽略不计。我们的结果表明,内省能力并不仅仅由规模决定:它可以直接训练,这样做可以释放潜在的自我监控能力,对人工智能的透明度和一致性产生影响。我们的代码是 \href{https://anonymous.4open.science/r/IFT-introspection-2092/README.md}{here}。