论文
通过残余流动力学揭示不受控制的重复
Uncovering Uncontrolled Repetition through Residual Stream Dynamics
摘要
不受控制的重复会延长大语言模型 (LLM) 中的自回归生成时间,并引发资源消耗攻击。先前对重复生成的分析已经识别出中间层和后期层中强烈激活的特征。然而,不受控制的重复活动在这些层中变得突出之前是如何出现和发展的,仍然没有得到充分的了解。在本文中,我们主要在大型视觉语言模型(LVLM)中研究这个问题,该模型通过视觉和文本输入支持更丰富的不受控制的重复。我们提出了 Tokenwise Residual Comparison (TRC),这是一种识别和定位与生成过程中残差动态重复相关的异常的方法。 TRC 比较注意力和多层感知器对生成标记的剩余流的写入,以识别与重复相关的模式。然后,它有选择地抑制已识别层的残余流中的坐标。实验表明,TRC 有效缓解了不受控制的重复,平均降低了 57% 的循环率。我们的分析进一步表明,重复语义出现在浅层中并通过残余流传播,破坏了正常的表示。 TRC 还推广到大语言模型 (LLM) 和大型推理模型 (LRM),它能够一致地捕获类似的重复动态并实现有效的缓解。我们的工作将重复生成的研究范围从其突出的内部表征扩展到早期的干预机会,为减轻资源消耗攻击提供了见解。