论文
FASA:针对基于扩散的高效 VLA 模型的反馈感知采样自适应
FASA: Feedback-Aware Sampling Adaptation for Efficient Diffusion-Based VLA Models
摘要
基于扩散的视觉-语言-动作(VLA)模型在具体任务中实现了强大的性能,但其迭代采样会带来大量的计算和内存访问成本,阻碍了边缘平台上的实时部署。现有的加速方法要么需要昂贵的训练(例如蒸馏、流量匹配),要么通过静态调度的修剪和缓存来降低感知,忽略机器人交互的动态工作负载变化。本文提出了 FASA(反馈感知采样适应),这是一种免训练的运行时框架,将实时多模态反馈视为去噪管道的控制信号:交互驱动的范围适配器根据视觉和抓手力反馈调节全局采样步骤预算,本体感知感知步骤适配器精确定位适应范围内的优化步骤。这种共同设计的框架允许底层硬件架构自适应地匹配不同执行阶段的工作负载需求。多个基准的比较评估表明,推理速度可提高高达 1.45$\times$,同时保持有竞争力的成功率,为将繁重的生成式嵌入 AI 工作负载部署到资源受限的计算平台上提供了一种新颖的动态运行时架构范例。