论文
FreqCache:通过自适应频率引导词元缓存加速体现 VLN 模型
FreqCache: Accelerating Embodied VLN Models with Adaptive Frequency-Guided Token Caching
摘要
视觉语言导航(VLN)模型表现出出色的导航精度,但会产生较高的计算开销。词元缓存已成为一种有前景的 无需训练 策略,通过重用词元计算结果来降低成本;然而,现有的词元缓存方法依赖于视觉域方法来进行可缓存词元选择,这在适应 VLN 模型时会带来挑战。 1)当存在视点迁移时,视域方法失效。 2)视觉域方法忽略关键边缘信息,无需额外算法的帮助。 3)视觉域方法忽略了场景的时间变化并且缺乏缓存预算的可调整性。在本文中,我们进行了详细的分析,发现这些挑战的影响在频域中表现出不变性和可分析性。基于这些,我们提出了一个频率引导的词元缓存框架,称为FreqCache。 FreqCache利用频域的固有特性,实现最优的词元缓存建立、刷新和自适应调整。实验表明,FreqCache 在可忽略的开销下实现了 1.59 倍的加速,展示了在 VLN 词元缓存中集成频域方法的效果。