论文

Visual-OPSD:跨模态 同策略 自 蒸馏 用于高效统一多模态推理

Visual-OPSD: Cross-Modal On-Policy Self-Distillation for Efficient Unified Multimodal Reasoning

摘要

统一多模态模型 (UMM) 将生成的“视觉思维”(VT) 与文本推理交织在一起,以改进空间任务。这会因多步扩散而产生大约一个数量级的推理成本。我们发现这种成本产生的直接收益有限。在 ThinkMorph 上,移除 VT 或添加噪声几乎不会改变九个基准测试的准确性。一旦呈现,无论内容如何,​​注意力都会集中在 VT 上。然而 KL 诊断表明,对特权 VT 轨迹的调节会改变模型的完成分布。这表明生成路径编码了渲染像素之外的有用推理。受此差距的启发,我们提出了 Visual 同策略 Self-蒸馏(Visual-OPSD)。教师和学生具有相同的权重,但上下文不同:教师看到特权 VT,而学生仅看到问题。 词元级 同策略 学生轨迹上的 JSD 蒸馏 将教师的推理转移给纯文本学生。在九个基准测试中,Visual-OPSD 比其生成教师提高了 $+3.40$pp,加速率为 $+14.3\times$(每个样本 10.0 秒 vs. 142.8 秒),并且在 VSP 上比相同规模的 VLM 性能高出 $+63.83$pp。高斯噪声控制(真实 VT 的 $+0.40$pp 与 $+10.28$pp 相比)和 KL 间隙的 $58.4\%$ 闭合确认收益来自生成路径的语义内容。