论文
Reflex:通过流推理进行实时 VLA 控制
Reflex: Real-Time VLA Control through Streaming Inference
摘要
流匹配视觉-语言-动作 (VLA) 模型承诺精确的连续控制,但其迭代去噪性质引入了与实时机器人技术的根本不兼容性:全局时间步注入使 KV 缓存失效,迫使在缓慢的 $O(N^2)$ 重新计算或数学上不正确的缓存重用之间做出选择。我们提出了 \textbf{Reflex},一个框架,它通过利用 \textit{时间步长不变性} 实现流匹配策略的 \textit{实时流推理} - 感知编码器在功能上独立于去噪循环。 Reflex 将注意力上下文划分为静态、滑动和动态区域,从而实现 $O(1)$ 增量缓存更新,同时保留固定输入的全批次等效注意力输出。为了确保连续高频推理下的稳定性,我们引入了 \textit{AdaRMSNorm},这是一个自适应归一化层,可通过对流相位进行选通来防止 BFloat16 数值崩溃。我们通过将视觉编码与动作生成分离的 \textit{async pipeline} 进一步最大化吞吐量,并结合 \textit{operator fusion} 减少内核开销。在 LIBERO 和 Kinetix 基准测试中,Reflex 实现了 2.58$\times$ 的推理加速和 50Hz 稳定流传输,将反应延迟减少高达 54\%,并在不降低性能的情况下实现高效部署。