论文
上下文感知集群解码:dMLLM 中语义锚驱动的一致性
Context-Aware Cluster Decoding: Semantic Anchor-Driven Coherence in dMLLMs
摘要
扩散多模态 大语言模型 (dMLLM) 经常产生因语义漂移和重复而受到损害的长格式输出,随着输出长度的增加,质量通常会下降。我们确定现有解码方法中的两个结构性缺陷是这些失败的主要驱动因素:基于置信度的评分忽略了解码的邻居支持,块分区阻止了对高就绪语义锚的访问,共同导致词元在本地上下文充分建立之前就被提交。我们提出了 \ours{} (\textbf{C}ontext-\textbf{A}ware \textbf{C}luster \textbf{D}ecoding),这是一种 无需训练 解码方法,通过 softmax 置信度和邻居邻近度的乘法组合对每个屏蔽位置进行评分,在孤立候选者之上提升上下文就绪标记,同时抑制低置信度位置噪声,无块操作以保持高就绪锚点全局可访问。 \ours{} 进一步应用架构感知校准来处理由不同视觉集成策略引起的置信异质性。跨四个基准测试的三个 dMLLM 的实验表明,与原始版本相比,质量增益一致,幻觉减少,在几个较长的生成设置中具有更大的增益,突出了邻居支持和视觉集成策略对于未来 dMLLM 解码方法设计的重要性。我们的代码可在 https://github.com/zhaoyk-sysu/CACD-dMLLM 上公开获取。