论文
OPLD:同策略 用于多模态推理的潜在 蒸馏
OPLD: On-Policy Latent Distillation for Multimodal Reasoning
摘要
交错多模态思维链 (CoT) 通过将辅助视觉证据纳入中间推理来改善视觉推理。然而,现有的方法仍然受到外部定义的推理轨迹和视觉操作的限制,限制了它们发展灵活和抽象视觉思维的能力。最近,通过将中间计算内部化为连续表示,潜在推理提供了一个有希望的方向。然而,现有的视觉潜在方法主要通过与压缩的辅助视觉特征对齐来监督潜在状态,将它们视为视觉观察的代理而不是主动推理状态。因此,他们捕获了所提供的证据,但未能完全内化多模态 CoT 引发的抽象推理过程。在本文中,我们提出了 OPLD(同策略 Latent 蒸馏),这是一个简单的框架,它将特权多模态 CoT 引发的推理能力转移到潜在推理表示中。对各种多模态基准的大量实验表明,OPLD 始终优于现有的潜在推理方法,并在多个基准上实现了最先进的性能。结果表明,在推理过程级别监督潜在表示为多模态潜在推理提供了比传统特征级别对齐更有效的范例。