论文
POINTS-Long:MLLM 中的自适应双模式视觉推理
POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs
摘要
多模态 大语言模型 (MLLM) 最近在跨模态理解和生成方面表现出了卓越的能力。然而,视觉词元序列的快速增长——尤其是在长视频和流媒体场景中——对其可扩展性和实际部署提出了重大挑战。因此,我们引入了 POINTS-Long,这是一种本机双模式 MLLM,具有受人类视觉系统启发的动态视觉词元缩放功能。该模型支持两种互补的感知模式:聚焦模式和待机模式,使用户能够在推理过程中动态权衡效率和准确性。在细粒度的视觉任务上,聚焦模式保留了最佳性能,而在长篇一般视觉理解上,待机模式仅使用 1/40-1/10 的视觉标记就保留了原始准确度的 97.7-99.7%。此外,POINTS-Long通过动态可拆卸的KV缓存设计原生支持流式视觉理解,从而实现超长视觉内存的高效维护。我们的工作为未来 MLLM 的设计提供了新的见解,并为自适应和高效的长格式视觉理解奠定了基础。