论文

文本中的反偏见,相信你的眼睛:用于视觉反常识推理的文本锚定跨模态迁移

Debias in Text, Believe Your Eyes: Text-Anchored Cross-Modal Transfer for Visual Counter-Commonsense Reasoning

模型训练监督微调与指令调优

摘要

多模态 大语言模型 (MLLM) 的视觉推理能力对于下游应用至关重要,特别是反常识推理,这需要模型进行超出常见假设的推理。最近的研究主要通过增强视觉输入来改善视觉反常识推理,假设失败源于视觉基础不足。然而,我们的实证分析表明,瓶颈不是视觉感知。 MLLM 已经捕获了相关的视觉证据,并且正确的答案存在于其解码空间中。相反,共享语言解码器通过支持主导语言先验来解决先验证据冲突,特别是对于低频事实场景。受此启发,我们首先提出了一种文本锚定数据构建管道,其核心组件事实频率蒸馏(FFD)估计常识事实的先验强度,并将经过验证的反常识场景提炼成高质量的文本语料库。在此语料库的基础上,我们引入了 TACT,这是一种文本锚定的 后训练 框架,无需任何视觉训练数据即可消除共享语言解码器的偏差。 TACT 将证据跟踪和先验驱动的推理轨迹路由到不同的优化阶段,使解码器能够解决先验证据冲突。在反常识的视觉基准中,TACT 显着改善了视觉推理,同时保留了一般功能,展示了有效的文本到视觉的跨模式传输。