论文

在测试时对齐大型视觉语言模型:轨迹引导的结构化采样方法

Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach

模型推理推理搜索与路径规划

摘要

后训练 强化学习 (RL) 算法通常用于使大型视觉语言模型 (LVLM) 与人类意图和视觉推理任务的要求保持一致。然而,现有的基于强化学习的对齐方法通常是资源密集型的,并且会遇到训练目标和推理时间分布之间的不匹配问题。为了弥补这一差距,我们提出了一种新颖的测试时间对齐方法,该方法利用轨迹引导的结构化采样进行动态推理时间细化,实现与视觉基础更好的对齐并确保逻辑一致性。我们的方法首先通过轨迹学习算法构建推理记忆库,该算法将复杂的问题解决分解为预定义推理模式的有序序列。随后,它首先从推理记忆库中收集轨迹以建立全局结构推理先验,然后使用迭代马尔可夫链蒙特卡罗(MCMC)算法对推理轨迹进行局部多目标细化,从而完成推理时间对齐。跨多个多模态推理数据集的实验表明,我们的方法显着提高了准确性,而不会产生过高的推理开销。这些结果将轨迹引导的测试时间采样确立为传统​​ 后训练 对齐的可扩展且有效的替代方案,特别是对于复杂的视觉推理任务。