论文

Groc-PO:真实多模态的有视觉证据的上下文偏好优化 LLM

Groc-PO: Grounded Context Preference Optimization for Truthful Multimodal LLMs

模型训练偏好优化

摘要

尽管多模态 大语言模型 (MLLM) 取得了快速进展,但它们仍然存在不真实问题,例如视幻觉、内容捏造和不忠实推理,这严重损害了它们的 忠实性 和实用性。基于人类偏好的对齐方法,例如直接偏好优化(DPO),已被广泛采用来解决这些问题。然而,多模态推理错误通常会跨阶段传播,最终答案错误通常可以追溯到早期视觉定位阶段的错误,而标准 DPO 通常在最终答案级别应用偏好优化。这种信用分配挑战意味着对早期视觉定位阶段的监督是间接的,而不是特定于阶段的,因此很难抑制因视觉定位漂移和上下文不一致而引起的错误传播。为了解决这个问题,我们提出了基于证据的上下文偏好优化(Groc-PO),这是一种针对 MLLM 的基于证据的偏好优化框架。我们进一步构建了有证据依据的上下文偏好数据集(GCPD),围绕对象扎根、情境扎根和扎根推理三个阶段组织多阶段偏好样本,以捕获有证据依据的上下文的形成、整合和利用。通过在多个视觉定位阶段引入更明确的偏好监督,Groc-PO 增强了上下文相关推理并减轻了跨阶段错误传播。大量实验表明,与标准 DPO 和其他强基线相比,Groc-PO 在幻觉缓解、忠实推理和整体可靠性方面取得了改进的性能,支持更明确的扎根监督对于可信多模态推理的价值。