论文
Uni-LaDiR:潜在扩散统一多模态推理
Uni-LaDiR: Latent Diffusion Unifies Multimodal Reasoning
摘要
多模态推理要求模型在整个推理过程中利用多种模态的信息。然而,现有的方法通常将特定于模态的思维标记连接在一个序列中,使模型在跨模态推理时弥合表征差异。我们引入了 Uni-LaDiR(统一潜在扩散推理器),这是一个将这些想法带入共享潜在空间进行推理的框架。统一的编码器将教师的推理步骤从不同的模式映射到共享的思想标记中,经过训练以保留后续推理步骤和最终答案或行动所需的信息。由于相同的上下文可以支持多个有效的后续步骤,因此我们使用扩散来根据输入和先前的块来预测下一个思想标记块。使用共享模型权重联合训练编码器和扩散推理器可以鼓励思想标记既对任务有用,又可以根据可用上下文进行预测。在推理时,模型在没有教师观察的情况下生成这些标记。在 11 个视觉语言模型 (VLM) 基准测试和两个视觉语言动作 (VLA) 套件中,Uni-LaDiR 在视觉推理任务上实现了 7.3% 的相对增益,在机器人操作任务上实现了 6.1% 的相对增益,超过了最强的评估基线。