论文
及时检索,频率正确
Retrieve in Time, Correct in Frequency
摘要
冻结的视觉-语言-动作(VLA)策略会生成暂时扩展的动作块,但长期操作仍然容易受到任务阶段累积执行错误和视觉混淆的影响。成功执行轨迹提供了有用的纠正证据,但当前帧检索可能会返回进度不一致的操作,而直接重播或时域融合可能会覆盖政策提案的反应结构。我们引入了及时检索、频率校正 (RTCF),这是一种 无需训练 测试时间校正框架,可以以较低的模型端开销提高冻结的 VLA 性能。RTCF 将要检索的体验与其要传输的操作的哪一部分分开。渐进记忆对齐(PMA)通过增量更新的单调边界,将不断增长的视觉执行历史与完整的成功轨迹因果对齐,共同识别相关记忆和当前对齐的记忆位置,而无需阶段标签。 RTCF 从对齐的动作块中传输运动通道上的系数剪切低频残差。高频组件和夹具决策仍然继承自冻结策略。在四个 LIBERO 套件和每个条件 2,000 个情节中,RTCF 将总体成功率从 86.4% 提高到 88.4%,并将 LIBERO-Long 从 61.6% 提高到 68.6%。这些收益不需要参数更新、重复 VLA 推理或额外的 GPU 资源:可以在单次策略调用后在客户端 CPU 上执行校正,每个操作的中位延迟总计仅为 10.99 毫秒块