论文

在沉默中利用潜在的视觉推理

Leveraging Latent Visual Reasoning in Silence

模型训练强化学习

摘要

潜在视觉推理通过在文本生成之前插入连续的潜在标记,在多模态推理中更直接地涉及视觉证据。然而,这些潜在标记在推理中的必要性仍然不明确。我们表明,用随机噪声替换潜在标记或完全删除它们不会导致整个空间推理基准的性能下降。强化学习进一步减少了 后训练 之后的潜在生成行为。这些观察提出了一个核心问题:\textit{潜在的视觉推理仍然有意义}吗?我们认为,其价值应该通过潜在标记指导学习的有效程度来衡量,而不是通过它们是否持续作为推理时间格式来衡量。我们的分析表明,潜在推理在不同问题类型中的优势并不均衡,但应用潜在生成的硬任务级路由却很脆弱。受这些发现的启发,我们提出了一种基于注意力的奖励,鼓励生成的潜在标记在强化学习期间与后来的文本标记进行交互。当潜在模式被激活时,这种奖励会促进潜在利用率,同时保留使用纯文本推理的灵活性。实验表明,即使在 后训练 之后很少生成潜在标记,我们的方法也可以提高感知和视觉推理基准的性能。我们的结果强调,如果推理时没有明确的表达,潜在的视觉推理可以塑造更好的视觉基础和更准确的文本推理\textbf{沉默}。代码&模型:\href{https://github.com/ddydyd32/silent-lvr/tree/master}{\faGithub}。