论文
基于多层SAE层间转换的领域限制
Domain Restriction via Multi SAE Layer Transitions
摘要
大语言模型(LLM)的通用性给领域专用应用带来重大挑战,常常导致偏离领域(OOD)的交互,破坏提供方的意图。现有的此类场景检测方法把LLM当作不可解释的黑箱,忽视了输入的内部处理过程。在本工作中,我们表明层间转换为提取领域特定特征提供了一条有前景的途径。具体而言,我们提出了几种对用稀疏自编码器(SAE)编码的内部动态进行学习的轻量方法,它们在区分OOD文本方面展现出强大能力。在SAE表示转换之上进行构建,使我们能够更好地解释LLM处理输入的内部演化,并揭示其决策。我们对方法进行了全面分析,并在gemma-2 2B和9B模型上进行了基准测试。我们的结果凸显了内部过程在捕捉与输入相关的细粒度细节方面的效力。
