论文
UniFS:视觉-语言-动作模型的统一快到慢分层架构
UniFS: Unified Fast-to-Slow Hierarchical Architecture for Vision-Language-Action Models
摘要
主流的快慢双系统视觉语言动作模型将高频动作专家与低频视觉语言模型解耦以提高效率,但它们面临着基本的频率困境:较大的更新间隙会导致陈旧上下文的语义漂移,而较小的间隙会侵蚀预期的计算节省。此外,由于动作专家仅以单个固定频率接收 VLM 的最终层表示,因此丰富的中间特征被丢弃,从而限制了信息耦合和操作精度。受人脑多时间尺度神经处理的启发,我们推出了 UniFS,这是一种统一的从快到慢的架构,通过三个关键设计解决了这些挑战。首先,我们将 VLM 层分层为更新频率逐渐降低的组,使浅层能够捕获快速变化的动态,而更深的层则缓存稳定的语义上下文。其次,潜在向量反转机制重新路由多尺度 VLM 特征和动作专家之间的交互顺序,将快速变化的表示与细粒度的动作解码对齐,将慢速变化的表示与粗略规划对齐。第三,多级监督策略在时间尺度上强制执行从粗到细的学习层次结构。这些设计共同实现了在单个主干内更丰富的跨频率信息传输,而低频路径还保留了跨步骤的时间上下文。 LIBERO 上的实验表明,UniFS 实现了最先进的性能(平均成功率为 98.3%,比 VLA-Adapter 基线提高了 2.5%),同时将平均推理延迟从 36.5~ms 降低到 17.8~ms(加速了 2.1$\times$)。 Franka平台上的真实机器人实验进一步验证了其实际适用性。代码在 https://github.com/linsun449/UniFS 上开源。