论文
信息引导的前沿解码:dMLLM 中的上下文效用驱动承诺
Information-Guided Frontier Decoding: Contextual Utility-Driven Commitment in dMLLMs
摘要
扩散多模态语言模型 (dMLLM) 中的解码质量在很大程度上取决于屏蔽词元的提交顺序。现有的基于置信度的策略优先考虑局部简单的标记,但置信度并不一定反映上下文的有用性。因此,结构上简单的标记(例如标点符号)可能会在信息丰富的语义锚之前提交,从而削弱上下文传播并增加错误累积。我们提出了信息引导前沿解码(IGFD),这是一种 无需训练 解码策略,它使用词元置信度、邻域不确定性和结构承诺风险对候选者进行排名。 IGFD 鼓励早期承诺可靠的语义锚,同时延迟脆弱的结构标记,从而改善解码过程中的上下文支持。动态候选边界进一步将标记选择限制在相同解码预算下的局部可扩展区域。该方法不需要额外的训练、辅助模型或额外的前向传递。跨多模态理解、推理、基础和幻觉基准的实验表明,在相同的解码预算下,IGFD 在大多数基准和扩散 MLLM 主干中始终优于现有的解码策略。