论文
sensVLA:将空间感知与语言推理分离的自主轮式装载机模型
sensVLA: Spatially-Grounded Vision-Language-Action Model for Autonomous Wheel Loader
摘要
自主轮式装载机控制需要对任务语义、自我中心视觉、本体感觉和 3D 场景几何进行联合推理。我们提出了 sensVLA,这是一种视觉语言动作 (VLA) 架构,它将 Qwen3-2B 视觉语言模型 (VLM) 与经过流量匹配速度回归训练的完全可训练的Transformer动作专家相结合。 sensVLA 将从融合的前后激光雷达中提取的鸟瞰图 (BEV) 特征通过专用的交叉注意力路径直接传送给动作专家,而 VLM 则使用前后 RGB 视图来提供任务条件语义上下文。这种设计将空间基础与语言推理分离,同时在决策时保留两个流之间的交互。专家预测了六个动作维度:纵向速度、转向、车身位移、斗杆速率和铲斗速率。在轮式装载机的真实数据集上,sensVLA 通过强大的仅摄像头基线达到了每步聚合奇偶校验,并在以装载为中心的场景中将纵向速度 RMSE 降低了 28%,位移误差降低了 9%。当摄像机流被损坏或删除时,它的性能下降也减少了 29%,这证明显式空间感知对齐可以提高重型设备自主的准确性和容错能力。