论文
视觉-语言-动作模型应该如何使用本体感受状态?
How Should Vision-Language-Action Models Use Proprioceptive State?
摘要
最近的视觉-语言-动作(VLA)模型几乎普遍采用机器人本体感受状态作为输入,但以不兼容的方式连接它——序列化为文本提示,投影到视觉语言前缀,或直接馈送到动作专家——并且几乎总是作为单个当前帧。三个问题仍然悬而未决:(1)当前状态是否以及在哪些任务上实际上改善了闭环控制; (2)国家历史有多大帮助,以及其益处是否反映了真正的时间变化而不是额外的调节能力; (3) 状态应该进入模型的位置——视觉语言主干或动作生成模块。我们通过对流量匹配 VLA 进行受控实验来回答这些问题,并始终修复骨干网、训练数据、动作表示和评估协议。我们在匹配的实现细节下实现了五个代表性接口——离散状态提示、VLM前缀、动作前缀、状态专家和特征调制,并在跨越三个任务族的45个原子任务和20个复合任务上对它们进行评估;然后,我们将状态历史长度从 1 帧扫描到 96 帧,以检查历史状态信息如何影响模型性能。这些实验为所有三个问题提供了系统的答案,并提炼为状态感知 VLA 的可测试设计原则。