论文
按推理需求进行路由:扩散视觉语言模型的轨迹感知解码控制
Routing by Reasoning Need: Trajectory-Aware Decoding Control for Diffusion Vision-Language Models
摘要
扩散视觉语言模型通过迭代细化生成答案,公开可以在推理时检查和控制的中间答案轨迹。然而,这种可控性造成了推理需求的不匹配,即通用生成长度应用于具有不同推理需求的问题。视觉上封闭的问题可能会因在形成稳定答案后继续细化而受到损害,而推理敏感的问题可能会因过早的承诺而受到损害。我们将这个问题表述为推理-预算不匹配并在 LLaDA-V 中进行研究。我们的免训练控制器没有选择通用的生成长度,而是使用来自答案闭合、承诺证据和表示修订压力的轨迹信号将每个示例路由到早期承诺、基线保留或推理支持解码,而不使用地面真相答案。在以答案为中心、混合推理和 CoT 敏感的基准中,路由控制提高了固定长解码、纯短解码和单规则干预的鲁棒性。这些收益并不能仅用较短的产出来解释。答案封闭的例子通常受益于承诺,而 CoT 敏感的例子需要保留或支持中间推理。总而言之,这些结果表明扩散 VLM 解码应根据观察到的轨迹所建议的状态来路由推理时间控制,而不是依赖于通用解码长度。