论文

UniVLR:在多模态视觉潜在推理中统一文本和视觉 LLM

UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs

模型推理推理策略与问题分解

摘要

人们越来越期望多模态 大语言模型 通过图像进行思维,但现有的视觉潜在推理方法仍然依赖于与视觉潜在标记交织的显式文本思维链。这种交错的设计限制了效率,并使推理在不同的文本和视觉通道上变得支离破碎。我们提出了 UniVLR,一个统一的视觉潜在推理框架,它将文本推理和辅助视觉证据视为共享的视觉工作空间。 UniVLR 没有将文本 CoT 保留为独立的推理时间路径,而是将推理轨迹与辅助图像一起渲染,并学习将这种统一表示压缩为紧凑的视觉潜在标记。在推理时,模型仅通过视觉潜在因素进行推理并直接解码最终答案,避免了外部工具调用和冗长的文本推理。对现实世界感知和视觉推理任务的实验表明,UniVLR 优于先前的视觉潜在推理方法,同时使用更少的生成推理标记,这表明 MLLM 中的视觉思维有一个更统一、更高效的范式。