论文

OmniRoute:将时态语义证据映射到视听词元预算,以实现高效的全模态大语言模型

OmniRoute: Mapping Temporal Semantic Evidence to Audio-Visual Token Budgets for Efficient Omnimodal Large Language Models

上下文与知识上下文工程

摘要

全模态大语言模型 (Omni-LLM) 将音频和视觉流编码为时间交错的标记序列,以进行多模态推理。然而,处理长视听词元序列会产生大量的预填充成本。现有的压缩方法已经取得了进步,但常常忽视视听语义相关性的时间变化。受时间变化和局部连续性的推动,我们提出了 OmniRoute,一种免训练的两阶段压缩框架。首先,时间证据引导预算(TEGB)从语义相关性和本地内容变化中导出分块模态偏好和初始主导模态预算。其次,预算约束语义压缩 (BCSC) 压缩主导模态,然后使用实际保留分数来校准追随者的保留目标。对于视频,它将时空分组与查询引导选择相结合;对于音频,它根据编码器注意力和查询相关性选择标记,然后在视觉引导下将剩余标记合并到上下文锚中。对四个代表性基准的实验表明,与竞争基准相比,推理效率和性能之间有更好的权衡。代码和接口将被发布以方便进一步研究。