论文

扰动:一种简单高效的对抗性追踪器,用于语言模型中的表示学习

Perturbation: A simple and efficient adversarial tracer for representation learning in language models

模型评测模型行为与机制分析

摘要

深度神经语言模型 (LM) 中的语言表示学习已经研究了数十年,但在 LM 中寻找表示仍然是一个未解决的问题。一方面,不受约束的对齐可能会使表示的概念变得微不足道(Sutter et al., 2025);另一方面,即使是最近流行的线性方法也可能并不总是忠实于自然模型行为(Arora 等人,2024)。在这里,我们通过将表示重新概念化为学习的渠道而不是激活模式来摆脱这种困境。我们的方法很简单:我们在单个对抗性示例上通过 微调 扰动 LM,并测量这种扰动如何“感染”其他示例。扰动不做任何几何假设,并且与其他方法不同,它不会找到不应该的表示(例如,在未经训练的 LM 中)。但在训练有素的语言模型中,扰动揭示了多种语言粒度的结构化迁移,这表明语言模型既可以沿着表征路线进行概括,又可以仅从经验中获得语言抽象。