论文
ProAct:世界校准的VLA提议-动作流
World-Calibrated Proposal-to-Action Flow for Vision-Language-Action Models
摘要
基于流的视觉-语言-动作(VLA)策略通过从任务无关的各向同性高斯源传输样本生成动作块。由于该源既不以近期执行为条件也不以预测的未来演化为条件:(i)它丢弃了最近执行动作建立的局部连续性;(ii)即便引入预测性世界表示,通常也只条件化传输动力学,而不决定生成起点、允许偏差与动作扩展方向。基于此,我们提出ProAct——一个让生成源本身可预测的世界校准提议-动作框架:轻量提议专家经一步运动锚定的端点流匹配把近期动作转为场景感知假设,使生成初始化于演示动作流形附近;前瞻世界专家以该假设为软运动先验,同时预测任务一致的潜在未来;由两者的兼容性,模型校准以提议为中心的各向异性源,其中有界的每步幅宽控制允许偏差,迹归一化的低秩几何在条件数预算下把细化分配到耦合的平移、旋转与夹爪方向。与π0.5相比,ProAct在仿真与真实任务上均提升性能,同时减少50%去噪步、推理延迟最多降25.8%、吞吐最多升34.8%。