论文

通过预测嵌入进行多模态潜在推理

Multimodal Latent Reasoning via Predictive Embeddings

模型训练监督微调与指令调优

摘要

工具增强的多模态推理使视觉语言模型(VLM)能够通过与外部工具(例如裁剪、深度估计)交互来改善感知。然而,此类方法会产生大量推理开销,需要专门的监督,并且容易出现错误的工具调用。我们提出了 Pearl(潜在空间推理的预测嵌入对齐),这是一个受 JEPA 启发的框架,它完全在潜在空间中从专家工具使用轨迹中学习,从而消除了在推理时显式调用工具的需要。基于重建的潜在推理方法会自动生成潜在标记,并受到训练推理不匹配和对多步骤工具使用的有限支持的影响,与基于重建的潜在推理方法不同,Pearl 直接从多模态轨迹中学习预测嵌入,同时保留标准视觉语言生成管道:它与模型无关,易于训练,并且自然支持具有多个工具调用的轨迹。跨多个感知基准的实验表明,Pearl 匹配或优于标准监督 微调 和基于重建的潜在推理方法。此外,我们提供的经验证据表明,基于重建的方法主要学习潜在空间中的嵌入而不是图像编辑,从而激励预测嵌入学习作为一种更有原则的替代方案。