论文
通过生成器在环对齐弥补多模态 RAG 中的语义与效用差距
Bridging the Semantic-Utility Gap in Multimodal RAG via Generator-in-the-Loop Alignment
摘要
通过检索增强生成(RAG)增强的视觉语言模型(VLM)受益于外部证据的访问。然而,标准检索器和重新排序器针对语义相似性而不是答案实用性进行优化,从而产生了偏好差距:看起来相关的文档可能无法帮助生成器产生正确的答案。受此启发,我们提出了一个两阶段生成器在环对齐框架,该框架无需人工文档级相关性注释即可弥补这一差距。我们的框架由两个阶段组成:在第 1 阶段,VLM 从图像查询对生成假设的文本段落,用作密集文本搜索的检索查询,弥合图像到文本模态的差距。在第 2 阶段,使用从冻结的 VLM 中挖掘的答案监督偏好对对适应低秩适应 (LoRA) 的交叉编码器重排序器进行微调:给定数据集答案标签,如果 VLM 在给定文档作为上下文时生成正确答案,则候选文档被标记为正,否则为负。这种生成器引导的信号与多种对齐损失函数兼容,包括对比(三元组)损失、成对直接偏好优化(DPO)和监督微调(SFT),并支持定期重新挖掘以随着重新排名器的改进而刷新偏好对。使用 Qwen3.5-2B 和 Qwen3-VL-4B-Instruct 在 VQA-X 和 A-OKVQA 上进行的实验表明,我们提出的框架在各种对齐损失和池大小设置下始终优于排序、随机和 REPLUG 式似然基线,这表明答案级别生成器反馈是偏好对齐的有效监督信号。