论文

ActTune:动作感知量化与 GPU 运行点自适应

ActTune: Action-Aware Precision and GPU Operating-Point Adaptation for Energy-Efficient Vision-Language-Action Inference

摘要

视觉-语言-动作 (VLA) 策略反复调用推理来控制机器人,使图形处理单元 (GPU) 能源成为任务执行的经常性成本。然而,如果数值错误增加失败或较慢的推理会延长执行时间,则减少每次推理调用的能量可能不会减少每次成功任务的能量。因此,我们将每个成功任务的 GPU 能量作为目标,同时保留 任务成功率 并将推理延迟增加保持在 10% 以内。我们的方法建立在两个观察的基础上:量化灵敏度随动作类别、模型层以及权重与激活的变化而变化;数值 精度 会改变工作负载,从而改变有利的 GPU 操作点。我们引入了 ActTune,这是一个动作感知框架,它将分层 精度 分配与根据请求的频率-功率上限对进行的工作负载相关的 GPU 操作点选择连接起来。轻量级决策树直接从配置操作错误中学习其分割和叶子 精度 配置,然后在每次策略调用之前选择 精度。控制器预测下一个工作负载,并使用在延迟预算下校准的查找表异步应用所选的 GPU 操作点。共享驻留量化权重库可实现配置切换,无需权重重建或额外的策略评估。在 LIBERO(机器人终身学习基准)上,ActTune 相对于现有技术将平均 任务成功率 提高了 2.3%。相对于原始 BF16 实现,它可提供高达 $2.02\times$ 的更快推理速度,并且通过 GPU 操作点自适应,将每个成功任务的能耗降低高达 76.8\%。

ActTune:动作感知量化与 GPU 运行点自适应:论文原图
图 2:操作分组和 精度 灵敏度。 PC1和PC2表示第一和第二主成分。 W$n$A$m$ 表示 $n$ 位权重和 $m$ 位激活。十字标记簇质心;成功率是所有四个套件的平均成功率,所有操作和图层 精度 批次均已完成。