论文
TRAM:利用轨迹衍生辅助存储器增强多模态推理
TRAM: Enhancing Multimodal Reasoning with Trajectory-Derived Auxiliary Memory
摘要
多模态大型推理模型 (MLRM) 在需要视觉理解和多步推理的任务上取得了出色的性能。然而,随着推理轨迹的增长,模型在使用先前在上下文中建立的信息方面可能会变得不太有效,从而增加了推理错误的风险。现有的方法主要通过在整个推理过程中维持视觉基础来解决这个问题。然而,推理还将视觉观察转化为特定于任务的关系、约束和中间结论,其影响可能会随着长期轨迹而减弱。我们的归因分析表明,正确性并不总是仅通过图像归因来区分,而是与轨迹是否保留和整合跨阶段的推理衍生信息密切相关。受此启发,我们引入了 TRAM(TRajectory 衍生辅助记忆),这是一种 无需训练 方法,它通过从模型自身推理轨迹衍生的辅助记忆路径来增强标准解码。 TRAM 将完整的推理整合到紧凑的潜在内存中,通过快速和慢速循环流在线更新它,并通过轻量级剩余路径将其反馈到选定的解码器层。在八个基准测试上对四种 MLRM 变体进行的实验表明,在数学、科学和一般视觉推理任务上,TRAM 比普通解码提高了性能,无需额外训练。