论文
ActTune:动作感知量化与 GPU 运行点自适应
ActTune: Action-Aware Precision and GPU Operating-Point Adaptation for Energy-Efficient Vision-Language-Action Inference
摘要
视觉-语言-动作 (VLA) 策略反复调用推理来控制机器人,使图形处理单元 (GPU) 能源成为任务执行的经常性成本。然而,如果数值错误增加失败或较慢的推理会延长执行时间,则减少每次推理调用的能量可能不会减少每次成功任务的能量。因此,我们将每个成功任务的 GPU 能量作为目标,同时保留 任务成功率 并将推理延迟增加保持在 10% 以内。我们的方法建立在两个观察的基础上:量化灵敏度随动作类别、模型层以及权重与激活的变化而变化;数值 精度 会改变工作负载,从而改变有利的 GPU 操作点。我们引入了 ActTune,这是一个动作感知框架,它将分层 精度 分配与根据请求的频率-功率上限对进行的工作负载相关的 GPU 操作点选择连接起来。轻量级决策树直接从配置操作错误中学习其分割和叶子 精度 配置,然后在每次策略调用之前选择 精度。控制器预测下一个工作负载,并使用在延迟预算下校准的查找表异步应用所选的 GPU 操作点。共享驻留量化权重库可实现配置切换,无需权重重建或额外的策略评估。在 LIBERO(机器人终身学习基准)上,ActTune 相对于现有技术将平均 任务成功率 提高了 2.3%。相对于原始 BF16 实现,它可提供高达 $2.02\times$ 的更快推理速度,并且通过 GPU 操作点自适应,将每个成功任务的能耗降低高达 76.8\%。
