论文
TEMPO:用于视觉-语言-动作模型的语义-动作解耦 RL 后训练
TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models
摘要
视觉-语言-动作 (VLA) 模型通常通过监督 微调 (SFT) 或在线强化学习 (RL) 后训练 适应下游操作任务。 SFT 很容易出现分布不匹配,而现有的 RL 方法通常对所有模型组件应用单一、统一的更新策略,而忽略它们不同的功能角色。我们提出了 TEMPO,一种用于 VLA 模型的语义-动作解耦、双时间尺度 RL 后训练 框架。 TEMPO 冻结预训练的视觉语言主干以保留一般语义表示,并限制对具有专用 RL 优化循环的两个组件的适应:语义投影层和底层动作专家。我们以不同的速率更新它们——语义投影层不频繁更新,以保持潜在动作稳定,而动作专家则频繁更新,以快速合并来自在线交互的控制反馈。这种解耦 RL 微调 策略可以防止快速策略更新破坏高级语义表示的稳定性,同时仍然允许行动专家从在线反馈中高效学习。 CALVIN 基准和现实世界操作任务的实验表明,TEMPO 始终优于预训练的最先进的 VLA 模型和 RL 后训练 基线,同时在两项现实世界任务上达到并保持更高的评估奖励。