论文

PhaseLoRA:连续动作视觉语言动作策略的控制机制条件低秩适应

PhaseLoRA: Control-Regime-Conditioned Low-Rank Adaptation for Continuous-Action Vision-Language-Action Policies

模型训练参数高效训练

摘要

参数高效的 微调 (PEFT) 是适应预训练视觉语言动作 (VLA) 策略的自然方式,但大多数适配器设计在整个控制执行轨迹过程中应用在时间上固定更新,忽略了连续动作操作的阶段依赖性质。这些策略跨越不同的机制,包括接近、接触转换、抓取、运输和放置,每个机制都需要不同的适应行为。我们提出 \textbf{PhaseLoRA},一种轻量级的 LoRA 参数化,它使用两个弱监督描述符:精细控制趋势和事件/边界强度来调节每个动作块预测步骤的适应。 PhaseLoRA 调节动作专家中的 LoRA 左因子,允许有效的低秩更新方向随时间变化,同时保持骨干网很大程度上冻结。在 LIBERO 上,PhaseLoRA 比匹配参数的高阶 LoRA 基线平均成功率提高了 12.2 个百分点,并且性能优于更强的 LoRA 变体。消融表明随机时间调制和标量门控不能再现完整模型的性能,而更新方向分析揭示了与预测控制描述符相关的结构化时间变化。这些结果将轨迹内调节确立为连续行动 VLA 策略的有效轻量级 PEFT 轴。