论文

线性多时间尺度保留作为高效记忆的视觉语言桥梁

Linear Multi-Timescale Retention as a Memory-Efficient Vision-Language Bridge

模型架构Transformer

摘要

由于 Softmax 多头注意力 (MHA) 的 $O(N^2)$ 内存复杂性,视觉语言模型 (VLM) 在处理高分辨率图像时面临关键的计算瓶颈。虽然用独立的多层感知器 (MLP) 替代 MHA 实现了 $O(N)$ 缩放,但它剥离了空间序列路由的架构,严重降低了全局场景理解和对象持久性。在本文中,我们提出了线性多时间尺度保留(LIA-MTR)模块,这是一种内存高效的跨模式桥梁。通过将基于 ELU 的正特征映射与自适应写门控和对数线性分布循环衰减相集成,LIA-MTR 在数学上将连续视觉序列压缩为有界记忆状态。理论分析证明该架构具有严格的 $O(N)$ 序列交互复杂度。根据经验,综合检索评估表明,LIA-MTR 完美地跨 16,000 个标记路由上下文,消除了朴素线性注意力典型的“迷失在中间”退化。硬件基准测试揭示了无限上下文扩展功能,在 11.2 GB VRAM 占用空间内本机处理 262,144 个视觉补丁,而标准 MHA 在处理 16,384 个补丁时会出现内存不足故障。此外,在对 665K 会话样本进行指令调整后,LIA-MTR 的性能显着优于 MME 基准上的行业标准 MLP 基线(71.00% 对比 68.11%),这得益于对象持久性 10% 的绝对改进和卓越的全局语义提取。这项工作为无限上下文视觉语言集成建立了数学上严格的、计算上平坦的基础。