论文
大语言模型 的分布式可解释性和控制
Distributed Interpretability and Control for Large Language Models
摘要
需要多个 GPU 卡来托管的 大语言模型 通常是功能最强大的型号。有必要理解和引导这些模型,但当前的技术不支持这些模型在多 GPU 设置和单 GPU 设置中的可解释性和引导。我们提出了激活级可解释性(logits 镜头)和转向(转向向量)的实际实现,可扩展到多 GPU 语言模型。与相同硬件的基准相比,我们的系统实现的设计选择可将激活内存减少多达 7 倍,并将吞吐量提高多达 41 倍。我们在 LLaMA-3.1(8B、70B)和 Qwen-3(4B、14B、32B)上演示了该方法,维持 20-100 个词元/秒,同时收集 1,500 个词元序列的完整分层激活轨迹。使用在 LayerNorm 后注入的标签位置转向向量,我们在模型输出中显示了可控的单调变化,在评估的数据集中平均转向斜率为 0.702,无需 微调 或额外的前向传递。我们在 https://github.com/Devdesai1901/LogitLense 上发布了详细的基准、消融和可重复的仪器配方,以实现前沿 LLM 的实际可解释性和实时行为控制。