论文
BICPO-VLA:行为识别的连续偏好优化,用于平滑异步视觉-语言-动作控制
BICPO-VLA: Behavior-Identified Continuation Preference Optimization for Smooth Asynchronous Vision-Language-Action Control
摘要
请求与切换之间的差距具有三个耦合源:请求时预期行为的模糊性、操作生成过程中累积的物理状态漂移以及新操作最终取得控制权时残留的不兼容性。 BICPO-VLA 按顺序处理它们。首先,指令感知因果历史编码器识别命令支持的行为和当前任务进度。其次,顺序 Haar 子空间生成将每个动作块分解为互补的成对支架和残差系数,从而实现两个专门的生成阶段,然后进行精确重建。通过减少原始动作空间中的迭代细化,它缩短了机器人在新块可用之前继续移动的时间间隔。最后,BICPO 将已知的传出操作滚动到实际的切换状态,并在行为匹配的候选者之间应用参考相关的 Flow-DPO,使生成的块适应剩余的请求切换不匹配,而不改变其预期行为。