论文

面向视觉语义算术的LLM多模态推理

Multi-modal Reasoning with LLMs for Visual Semantic Arithmetic

模型训练强化学习RLVR

摘要

强化学习(RL)作为后训练手段,对增强大语言模型(LLM)在编码和数学方面的推理能力至关重要。然而,它们在视觉语义算术——即从图像中推断关系——方面的能力仍未被充分探索。经典的文本类比“king”-“man”+“woman”=“queen”展示了关系推理,然而用“king”和“man”的图像替代文本会显著降低性能,因为这需要常识知识以及从无关视觉细节中提取简洁概念。这种能力对于非结构化环境中的服务和家用机器人十分重要,机器人必须推断物体、主体和动作之间的语义关系。在厨房中,从图像中识别出“powder”与“cake”通过“is made of”相关联,将符号关系扎根于感知,从而实现工具替代、任务泛化和更好的语义推理。已有工作通过对图像特征做向量算术后再解码来处理语义算术,但存在模态鸿沟问题且缺乏系统评估。本文提出两个新任务——两项减法和三项运算,并构建了Image-Relation-Pair Dataset(IRPD)用于基准测试。我们进一步提出Semantic Arithmetic Reinforcement Fine-Tuning(SAri-RFT),使用可验证函数和Group Relative Policy Optimization(GRPO)对大型视觉语言模型(LVLM)进行后训练。我们的方法在IRPD和真实场景的Visual7W-Telling数据集上取得了最先进的结果。通过为LVLM配备稳健的跨模态关系推理能力,这项工作提升了家用机器人将符号推理扎根于感知的能力,增强了复杂环境中的决策、工具适应性和人机交互。数据集和源代码见补充材料。

面向视觉语义算术的LLM多模态推理:论文配图
图 1:IRPD 数据集生成流程。首先,我们从 ConceptNet 中提取三元组(r​e​l​a​t​i​o​n:s​u​b​j​e​c​t→o​b​j​e​c​trelation:subject\rightarrow object)(Speer et al. 2017)。其次,我们使用文本到图像的扩散模型生成图像,例如 Flux (Labs 2024)。此外,应用LLM验证、基于 CLIP 的选择标准和人工评估来分别确保文本和图像模态中主客体对的质量。