论文
运动学路线,观察行动:MoE 增强 VLA 中的运动学监督专家路线
Route by Kinematics, Act by Observation: Kinematics-Supervised Expert Routing in MoE-Augmented VLA
摘要
虽然 MoE 通过专家专业化增强了 VLA,但由于操作任务之间的运动学异质性,以及更糟糕的是,在推理时运动学信号不可用,路由器会遭受无效的专家路由。在这项工作中,我们首先观察到大多数语义上不同的操作任务都简化为多个运动学原型。受这一发现的启发,我们提出了运动学监督显式路由(KinRT),这是一种从隐式、观察驱动的专家路由转向显式、运动学引导的专家调度的新范式。具体来说,我们对动作轨迹进行运动学聚类,形成多个运动学一致的组,其 ID 为 真值 来监督路由器的训练;在推理时,路由器仅使用视觉语言观察来派遣专家,而不依赖于动作运动学。 KinRT 实际上引入了一种不对称桥接机制,该机制将任务运动学从训练中的动作空间提取到推理时的观察空间中。此外,为了评估 KinRT 的跨平台通用性,我们使用 3D 打印技术($<2,000 美元)从头开始构建一个经济的自助机器人 (DIYRobot) 平台。大量实验表明,KinRT 比密集和具有 MoE 功能的 VLA 在 RoboTwin 基准测试上优于 23.26%,在我们推出的 DIYRobot 平台上优于 20.27%。我们的代码和 DIYRobot 平台将开源。