论文

多模式大容量中可靠性优先的细粒度生成

Reliability-Prioritized Fine-Grained Generation in Multimodal Large

模型训练偏好优化

摘要

人们越来越期望多模态 大语言模型 (MLLM) 能够生成视觉内容的细粒度描述。然而,我们观察并从理论上表明,生成细粒度响应提出了可靠性挑战,\textit{即},细粒度生成比粗粒度生成更容易出错。这种现象表明模型应该生成仍然可靠的最佳描述,而不是简单地产生更具体的输出。为了研究这个问题,我们开发了 \textsc{GranFact},这是一个粒度感知基准,由经过专家验证的多对象图像和从粗到细的类别注释组成。然后,我们设计了一种层次感知评估算法,该算法评估模型预测在视觉上是否正确以及正确预测的具体程度。我们还提出了一种基于直接偏好优化的可靠性优先偏好优化方法,该方法惩罚不可靠的细粒度声明,同时奖励可靠的特异性。 \textsc{GranFact} 上的实验表明,我们的方法在保持可靠性的同时改进了细粒度生成。代码和数据可在 \href{https://github.com/WeiWu2025/GranFact}{here} 获取。