论文

DRIFT:用于解码视觉语言模型中的连续输出的残余流适配器

DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models

模型推理解码与生成控制

摘要

许多现代视觉语言模型 (VLM) 都建立在离散标记的自回归解码之上。虽然基于文本的输出接口可以在不同的任务中实现可扩展的预训练和强大的零样本泛化,但它们不太适合需要精确连续输出的问题,例如定位事件的时间边界或生成机器人控制动作。为了应对这一挑战,我们提出了 DRIFT,这是一种使预训练的 VLM 适应连续解码任务的通用框架。 DRIFT 将提供目标输出粗略估计的基本预测器与基于流匹配的生成细化模块相结合,迭代地改进预测。这种残差公式将生成建模问题从学习全局输出分布转变为围绕强先验、大大简化的优化对局部残差分布进行建模。我们在感知和规划任务上评估 DRIFT,包括视觉定位和机器人控制。在跨越 MLLM、VLA 和 WAM 的多个任务和架构中,DRIFT 始终优于一组强大的基于回归和生成的解决方案。