论文

DiMaS:转向视觉-语言-动作模型的分布匹配

DiMaS: Distribution Matching for Steering Vision-Language-Action Models

模型推理解码与生成控制

摘要

基于流程匹配的视觉-语言-动作(VLA)模型已成为机器人操作的强大策略,但一项关键功能仍未得到充分探索:细粒度的行为控制,即通过干预机器人内部表征来控制机器人如何执行任务的能力。表示引导是一种成熟的语言和视觉语言模型的可解释性工具,其中行为特征通常被编码为线性方向,但我们表明这些经典方法在 VLA 中存在不足。我们提出了 DiMaS,这是一种针对流量匹配 VLA 量身定制的分布匹配转向策略,它在表示分布之间传输,而不是沿着固定方向移动,并表明它可以有效地控制两个最先进的 VLA 之间的行为。我们进一步研究了该策略的普遍性,因为它所学习和评估的任务变得越来越不同,描述了行为控制转移的地方和削弱的地方。最后,通过对动作专家的表示结构的分析,我们解释了为什么经典线性转向在视觉运动设置中存在不足:行为特征是线性可解码的,但不是线性可操纵的,这激发了 DiMaS 的分布匹配设计。我们的代码可在 https://github.com/pegah-kh/dimas 上公开获取,其他结果和视频可在 https://pegah-kh.github.io/dimas/ 上获取