论文
持久视觉记忆:维持 LVLM 深度生成的感知
Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs
摘要
虽然自回归大型视觉语言模型(LVLM)在多模态任务中表现出出色的熟练程度,但它们面临着“视觉信号稀释”现象,即文本历史的积累扩大了注意力分配函数,导致视觉注意力与生成的序列长度成反比衰减。为了解决这个问题,我们提出了持久视觉记忆(PVM),这是一个轻量级的可学习模块,旨在加强对视觉证据的持续、按需访问。 PVM 作为并行分支与 LVLM 中的前馈网络 (FFN) 集成,建立了一个与距离无关的检索路径,直接提供视觉嵌入以增强视觉感知,从而从结构上减轻深度生成固有的信号抑制。对 Qwen3-VL 模型的大量实验表明,PVM 在参数开销可忽略不计的情况下带来了显着的改进,在 4B 和 8B 尺度上提供一致的平均准确度增益,特别是在需要持续视觉感知的复杂推理任务中。此外,深入分析表明,PVM 在较长代中表现出更高的鲁棒性,并加速内部预测收敛。