论文

MCPO:多模态思想链压缩的模态对比偏好优化

MCPO: Modality-Contrastive Preference Optimization for Multimodal Chain-of-Thought Compression

模型训练偏好优化

摘要

最近,多模态大规模推理模型在通过长思维链(M-CoT)解决复杂任务方面表现出了卓越的能力。然而,过长的推理轨迹会带来大量的计算成本和巨大的 KV 缓存压力。现有的CoT压缩和对齐范式主要依赖于静态规则或单维偏好,缺乏细粒度的跨模态约束;因此,他们很容易诱发视觉懒惰和幻觉推理。为了解决这些问题,我们提出了模态对比偏好优化(MCPO),这是一种样本效率高的两阶段长度压缩方法,需要少于 900 个训练样本。在压缩阶段,我们引入了一种步骤级归一化跨模态互信息(NCMI)修剪算法,该算法通过比较有图像和无图像上下文之间的推理差异来自动识别和删除与视觉无关的推理步骤。这显着减少了推理链中的冗余和幻觉内容。在对齐阶段,模型首先经过有监督的 微调 以实现域自适应初始化,然后使用非对称多模态长度控制的偏好损失进行优化。该目标采用高度非线性的优势比公式,在有图像环境中提供陡峭梯度,以加强首选轨迹的长度约束,同时在无图像环境中应用缩放的平坦梯度线性差异以保持模态一致性,从而实现稳定的跨模态偏好对齐。对 Qwen3-VL-Thinking 等主流基础模型的大量实验表明,我们的方法可以将 CoT 长度减少高达 69.5%,并在保持原始精度的同时实现高达 3.34 倍的端到端推理加速。