论文

高效多模态推理的潜在视觉状态

Latent Visual States for Efficient Multimodal Reasoning

模型推理推理策略与问题分解

摘要

视觉证据的整合显着增强了大型多模态模型的能力。然而,这种集成主要依赖于生成离散输出(等,代码或框坐标)来调用外部工具,这个过程引入了严格的依赖性和大量的延迟。为了克服这些限制,我们提出了 {EVA}(LatEnt Visual StAtes),这是一种原生生成连续潜在视觉表示的新颖框架。这些内部表示表现为潜在槽标记的自适应序列,在推理过程中充当中间视觉思想。然后使用离散文本标记对这些 Latent\_slot 标记进行端到端训练。值得注意的是,这种协同优化会导致潜在时隙词元之后的“转换窗口”出现极端的策略偏差。我们开发了 D-GSPO(解耦-GSPO),通过解耦潜在组件和分立组件的优化来解决这一根本原因。为了支持 SFT,我们构建了 EVA-230K,这是一个高质量的文本图像交错 CoT 数据集,包含各种现实世界场景、文档、图表和 OCR 任务。跨多个基准的大量实验证实,EVA 在提高推理效率的同时实现了显着的性能提升。