论文
使用增强 EMG 和视觉任务描述符连续调节 VLA
Continuous Conditioning of VLAs with Augmenting EMG and Visual Task Descriptors
摘要
尽管具有多模态输入,但视觉-语言-动作(VLA)模型强烈依赖语言来描述任务信息。我们假设状态空间中的其他模式可能提供补充任务调节的机会,这在杂乱或其他模糊的场景中可能特别相关。我们引入了两个调谐模型来检验这一假设:(1) 电生理条件 VLA (EC-VLA),它将 8 通道肌电图包络作为连续调节输入与本体感受向量连接起来;(2) 视觉注释 VLA (VA-VLA),它将视觉分割注释合并到图像输入中。在三名参与者评估的立方体选择任务中,EC-VLA 在整洁、分布内的条件下与语言提示的基线相匹配,并且在混乱、分布外的场景中远远优于它。同样,VA-VLA 在分布内场景中比语言提示基线显示出适度的改进,而在混乱的分布外试验中则有显着改善。总之,这些结果为任务调节在语言之外的潜在益处提供了有力的证据。