论文
LoRA 微调 在工业机器人操作中视觉-语言-动作模型的效率
On the Efficiency of LoRA Fine-Tuning for Vision-Language-Action Models in Industrial Robotic Manipulation
摘要
在工业硬件上部署十亿参数的视觉-语言-动作 (VLA) 模型需要 微调 来弥补实施差距。完整的 微调 (FFT) 提供最大的可塑性,但需要数据中心级 GPU。我们提出了针对 $π_0$(一种流量匹配 VLA)的低秩自适应 (LoRA) 的系统研究,并使用 UR5e 机器人操纵器对四项精密装配任务进行了评估。在一系列 LoRA 等级(r=8 到 256)、分配策略和组件冻结消融中,我们发现 FFT 相对于某些 LoRA 配置没有统计上显着的优势。性能在 r=32 时饱和,并且跨视觉语言模型 (VLM) 主干和行动专家的统一分配证明足够了。冻结 VLM 或将视觉编码器限制为 LoRA 会显着降低性能,这表明实施例适应需要语义和视觉可塑性。这些结果表明,采用全视觉编码器 微调 的 LoRA at r=32 是一种实用方法,可将静态峰值 VRAM 从 36.2 GiB 减少至 10.8 GiB(参数和优化器状态,不包括激活内存),而不会造成可检测到的性能损失。