论文

脚手架思维:优化多模态推理的潜在视觉目标表示

Scaffolding Minds: Optimizing Latent Visual Target Representations for Multimodal Reasoning

模型训练监督微调与指令调优

摘要

潜在推理通过两阶段训练范例推进了多模态推理:(1) 将辅助图像编码为潜在标记,以在监督 微调 (SFT) 阶段教授视觉思维链;(2) 在强化学习 (RL) 阶段,通过奖励反馈进一步细化这些潜在标记。在本文中,我们确定了该框架的两个关键限制,每个阶段都有一个。首先,SFT 阶段通常依赖于现成的视觉编码器来对辅助图像进行编码,从而产生可能与下游推理任务不太一致的次优潜在表示。其次,现有的强化学习方法仅通过确定性正则化来处理潜在成分,这会限制策略漂移,但不会为探索创建替代的潜在轨迹。为了解决这些限制,我们提出了脚手架思维。我们的方法学习一个专用的脚手架编码器,该编码器在潜在空间中提供优化的目标,并学习 RL 采样器的均值和方差。我们进一步表明,这两项改进是相辅相成的,共同产生了超过强大基线的巨大收益。根据经验,我们的方法在 FrozenLake 空间规划上比最强的潜在推理基线提高了 +9.5 点,在 32x32 网格上增益扩大到 +19 点,在九个以视觉为中心的推理基准上平均提高了 +5.6 点。