论文

Parc Fermé 之前:RL 时间剪枝在自动驾驶中高效体现 LLM

Before Parc Fermé: RL-Time Pruning for Efficient Embodied LLMs in Autonomous Driving

摘要

嵌入式 大语言模型 (LLM) 越来越多地用作机器人控制管道中的推理模块,以改善人机交互,但它们的内存和生成延迟使得实时部署变得困难。修剪可以降低这些成本,但对于经历多个预阶段和 后训练 阶段的控制器来说,关键问题不仅在于修剪多少,还在于何时进行修剪。在这项工作中,我们提出了 Before Parc Fermé (BPF),这是一种在 RL 期间执行的修剪策略,可压缩具体的 LLM 控制器,同时它们仍在针对闭环行为进行优化。这使得修剪决策能够考虑特定于任务的监督和形成最终控制器的闭环反馈。我们提出了两种变体:BPF-RL,它在 RL 期间通过在预定义的训练间隔删除部分模型来执行迭代剪枝;BPF-SFT/RL,它首先在 SFT 期间剪枝部分模型结构,然后在 RL 期间使用与 BPF-RL 相同的迭代策略进一步压缩它,直到达到目标剪枝率。我们使用已建立的 LLM 剪枝框架(LLM-Pruner)在基于 LLM 的自动驾驶控制管道 RobotxR1 上评估 BPF,并将其与 后训练 剪枝、具有 RL 恢复的 后训练 剪枝、SFT 阶段剪枝以及来自同一系列的较小密集模型进行比较。我们的结果表明,在所考虑的修剪策略中,BPF 提供了最佳的任务性能与内存和吞吐量的权衡。当压缩较大的 RobotxR1 模型时,BPF-SFT/RL 比直接从同一系列中选择较小的密集模型实现了 1.69 倍更好的尺寸端到端性能权衡(按控制适应性损失的百分比来衡量删除的参数)。在目标机器人平台上安装的 Jetson AGX Orin 上,紧凑型模型将解码吞吐量提高了高达 27\%$。