论文

扩散视觉语言模型的可靠性挑战

Reliability Challenges in Diffusion Vision-Language Models

模型评测鲁棒性、公平性与可信度评测

摘要

基于扩散的大型视觉语言模型 (dLVLM) 最近已成为自回归 (AR) LVLM 的引人注目的替代方案,在并行解码、双向上下文和可控生成方面具有优势。尽管取得了快速进展,但它们的可靠性特性在很大程度上仍未得到表征。我们首次对 dLVLM 中的幻觉和偏差进行了系统可靠性评估,将六个扩散模型与四个维度的竞争性 AR 基线进行了基准测试。我们的主要发现是:(1)dLVLM 逆转了二进制视觉查询中 AR 模型的“是”偏差; (2)他们的幻觉率达到了有竞争力的水平,但语言质量却下降了; (3) 对于具有相反极性性别偏见的代表性不足的种族群体,它们的准确度几乎为零; (4)当正确选项短于其干扰项时,它们在多项选择设置中表现出准确性崩溃,这与第一个去噪步骤中出现的长度先验相关。在后期去噪步骤中以低置信度提交的词元进一步与幻觉内容相关,指出了扩散生成所特有的机械信号。这些模式因模型系列而异,表明可靠性是由生成范式和训练数据共同决定的。