论文
LoopVLA:在视觉-语言-动作模型的循环精炼中学习充分性
LoopVLA: Learning Sufficiency in Recurrent Refinement for Vision-Language-Action Models
摘要
当前的视觉-语言-动作(VLA)模型通常将视觉-语言骨干的最深层表示视为动作预测的普适最优选择。然而,机器人操作由大量频繁的闭环空间调整构成,对它们而言,过度抽象可能浪费计算并削弱对精确控制至关重要的低层几何线索。现有早退策略试图通过在预定义层停止或应用动作一致性等启发式规则来减少计算,但并未直接回答表示何时对动作而言真正充分。本文提出LoopVLA,一个循环式VLA架构,联合学习表示精炼、动作预测与充分性估计。LoopVLA迭代地应用共享的Transformer块来精炼多模态token,并在每次迭代中同时产生候选动作和估计是否需要进一步精炼的充分性分数。通过跨迭代共享参数,LoopVLA将精炼与绝对层索引解耦,并将充分性估计锚定在演化中的表示本身之上。由于充分性缺乏直接监督,我们引入自监督分布对齐目标,训练中间置信度分数去匹配各精炼步骤间的相对动作质量,从而将充分性学习与策略优化信号关联起来。在LIBERO、LIBERO-Plus和VLA-Arena上的实验表明,LoopVLA推动了VLA策略的效率-性能前沿,参数减少45%,推理吞吐量最高提升1.7倍,同时在任务成功率上持平或超越强基线。
