论文
EATR-Stereo:用于人形视觉-语言-动作控制的配对立体证据的实施例感知词元路由
EATR-Stereo: Embodiment-Aware Token Routing of Paired Stereo Evidence for Humanoid Vision-Language-Action Control
摘要
使用头戴式立体摄像头的长视界人形视觉-语言-动作 (VLA) 控制需要视觉界面,该界面可以利用互补视图,同时保持与预训练表示的兼容性。现有的界面通常会丢弃补充的立体证据或融合额外的观察结果,而不保留本地主视图路径并使辅助信息适应机器人实施例。我们提出了 EATR-Stereo,一种实施例感知的词元路由框架,它保留主视图词元并通过查询同步的辅助视图词元序列来构造主对齐的跨视图辅助词元(CVAT)。身体分段的本体感受编码器进一步调节机器人配置历史上的标记辅助使用,从而在动作生成过程中选择性地合并立体证据。路由的辅助流增强了预训练 VLA 的语言和主要视觉上下文,同时保持其视觉语言模型冻结。在具有 37 维本体感觉状态的 33 自由度物理人形机器人上,我们评估了超过 100 秒的搜索-接近-抓取-放置-返回任务中的九种配置。 EATR-Stereo 实现了 60.0% 的全任务成功率、100.0% 的抓取成功率和 80.0% 的舞台成功率。在严重不对称咬合的情况下,与单独使用 CVAT 的 30% 相比,它可将恢复率提高至 80%。消融研究进一步表明了保留主要标记并将跨视图辅助特征与结构化本体感受路由相结合的重要性。这些结果表明,选择性路由的配对立体证据可改善可靠的长视界人形 VLA 控制的空间基础。