论文

通过硬视觉证据关联偏好监督减少多模式 大语言模型 中的幻觉

Reducing Hallucination in Multimodal Large Language Models through Hard Grounding Preference Supervision

模型训练偏好优化

摘要

幻觉仍然是视觉语言模型(VLM)中的一个主要挑战,特别是当语言上合理的反应没有视觉证据支持时。我们研究是否可以通过将 后训练 监督集中在硬基础边界上来减少多模态幻觉,其中首选和拒绝的响应在语义上接近,但与可观察的视觉证据的支持不同。在冻结的视觉编码器和跨模态对齐路径下,我们首先使用有监督的 微调 (SFT) 建立广泛的解码器端多模态行为,然后构建直接偏好优化 (DPO) 的硬基础偏好对。这些对的目标是证据利用、校准和细粒度识别、空间推理、OCR、模糊或不充分的证据以及错误前提查询的基础一致性。生成的 DPO 模型持续改进了 DocVQA、TextVQA、MMBench 和 VQAv2 上的 SFT 初始化。在大约 839 个额外的多模式示例中,在三名独立的 LLM 评判下,它进一步实现了 6.2--8.2 个百分点的成对胜率提高。我们还发布了 HardVQA-DPO,这是一个精心策划且不断增长的资源,包含超过 3K 硬视觉证据关联 SFT 示例和一组初始 DPO 偏好对。 https://huggingface.co/datasets/vlmgrounding/hardvqa-sft-dpo 这些结果表明,仅解码器端自适应就可以在固定多模态表示下改善有意义的视觉证据关联故障子集,同时保留更广泛的多模态功能。