论文
处于理解的边缘:稀疏自动编码器追踪 Transformer 泛化的极限
At the Edge of Understanding: Sparse Autoencoders Trace The Limits of Transformer Generalization
摘要
预训练的 Transformer 表现出了卓越的泛化能力,有时超出了训练数据的范围。然而,现实世界的部署经常面临与训练数据分布不同的意外或对抗性数据。如果没有明确的机制来处理此类转变,模型的可靠性和安全性就会降低,因此需要对 Transformer 的分布外 (OOD) 设置进行更严格的研究。通过系统实验,我们提出了一个机械框架来描绘 Transformer 模型鲁棒性的精确轮廓。我们发现 OOD 输入(包括微妙的拼写错误和越狱提示)会导致语言模型在其内部运行越来越多的错误概念。我们利用该设备来量化和理解提示中的分布变化程度,从而实现基于机械的 微调 策略来增强 LLM。将 OOD 的概念从输入数据扩展到模型的私有计算过程,推理时的新 Transformer 诊断是使 AI 系统在科学、商业和政府领域安全部署的关键一步。