论文

少思考,早行动:视觉-语言-行动模型中尽早退出强化潜在推理

Think Less, Act Early: Reinforced Latent Reasoning with Early Exit in Vision-Language-Action Models

模型推理推理策略与问题分解

摘要

现有的视觉-语言-行动(VLA)模型主要依赖于明确的思想链(CoT)推理来连接感知和行动。虽然有效,但这种范例在多步骤任务中存在高计算成本和错误传播的问题。在本文中,我们提出了自适应变量对齐 VLA(AVA-VLA),这是一种新颖的潜在推理 VLA 框架,它将推理建模为一系列不可观察的潜在变量的序列,从而绕过了显式文本生成的需要。然而,潜在轨迹本质上容易受到噪声干扰以及与下游目标不一致的影响。为了解决这个问题,我们引入了一种基于强化学习的去噪机制,将潜在状态生成视为一个顺序决策过程,通过任务级奖励优化推理轨迹。此外,我们还采用了一种提前退出策略,该策略根据状态信心自适应地终止推理,从而实现深度和效率之间的动态权衡。对具体决策基准的大量实验表明,AVA-VLA 的推理速度比显式 CoT 方法提高了 6 倍,同时在 LIBERO 上实现了 98.3% 的平均成功率,相对于完整推理基线提高了效率和长期稳定性。