论文
面向视觉语义算术的LLM多模态推理
Multi-modal Reasoning with LLMs for Visual Semantic Arithmetic
摘要
强化学习(RL)作为后训练手段,对增强大语言模型(LLM)在编码和数学方面的推理能力至关重要。然而,它们在视觉语义算术——即从图像中推断关系——方面的能力仍未被充分探索。经典的文本类比“king”-“man”+“woman”=“queen”展示了关系推理,然而用“king”和“man”的图像替代文本会显著降低性能,因为这需要常识知识以及从无关视觉细节中提取简洁概念。这种能力对于非结构化环境中的服务和家用机器人十分重要,机器人必须推断物体、主体和动作之间的语义关系。在厨房中,从图像中识别出“powder”与“cake”通过“is made of”相关联,将符号关系扎根于感知,从而实现工具替代、任务泛化和更好的语义推理。已有工作通过对图像特征做向量算术后再解码来处理语义算术,但存在模态鸿沟问题且缺乏系统评估。本文提出两个新任务——两项减法和三项运算,并构建了Image-Relation-Pair Dataset(IRPD)用于基准测试。我们进一步提出Semantic Arithmetic Reinforcement Fine-Tuning(SAri-RFT),使用可验证函数和Group Relative Policy Optimization(GRPO)对大型视觉语言模型(LVLM)进行后训练。我们的方法在IRPD和真实场景的Visual7W-Telling数据集上取得了最先进的结果。通过为LVLM配备稳健的跨模态关系推理能力,这项工作提升了家用机器人将符号推理扎根于感知的能力,增强了复杂环境中的决策、工具适应性和人机交互。数据集和源代码见补充材料。
