论文
PolicyTrim:提高愿景-语言-行动模型的内在政策效率
PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models
摘要
视觉-语言-动作(VLA)模型为机器人操作提供了统一的范例,但它们在现实世界中的部署往往受到执行效率的瓶颈。虽然现有的努力主要集中在以计算为中心的效率上,以减少每步推理延迟,但这些模型的内在\textbf{策略效率}在很大程度上仍未被探索。策略效率从根本上受到两个因素的影响,即预测动作块的有效可执行长度和完成任务所需的总物理步骤。这两个因素共同决定了执行过程中前向推理调用的总数。我们观察到,当前的 VLA 策略与计划不可靠性和操作冗余作斗争,在操作块尾部遭受严重的预测退化,并倾向于生成不必要的冗余物理步骤。为了解决这个问题,我们提出了 \textbf{PolicyTrim},一个基于强化学习的 后训练 框架,它扩展了可靠动作块的长度并减少了冗余的物理步骤。为了可靠的块扩展,我们采用动态探索策略,明确奖励成功完成较长的可执行长度,逐步将可信的预测范围推向其经验极限。为了提高步骤效率,我们设计了一种冗余感知奖励,直接支持以更少的步骤成功完成任务,同时惩罚不可重复的捷径,有效消除冗余的物理动作。跨三个基准测试和三个 VLA 模型的广泛实验表明,PolicyTrim 将操作块利用率提高了 3$\times$,并将物理执行步骤减少了 51.4\%。最终,我们的框架在不影响任务成功率的情况下提供高达 5.83$\times$ 的端到端部署加速。