论文

RhinoVLA 技术报告

RhinoVLA Technical Report

模型优化端侧模型

摘要

视觉-语言-动作 (VLA) 模型在机器人操作方面显示出强大的潜力,但在边缘硬件上的实时部署仍然具有挑战性。在这项工作中,我们将 VLM 视觉和上下文标记确定为部署延迟的主要来源:对于 GEMM 主导的投影算子,当模型维度固定时,计算量随着输入标记的数量线性增长。受这一观察的启发,我们提出了RhinoVLA,这是一种与汇熙R1边缘SoC共同设计的面向部署的VLA模型。 RhinoVLA 采用词元高效的 Qwen3-VL 主干和连续操作专家,减少了 VLM 端词元和计算负担,同时保留了预训练的多模式能力。为了支持跨机器人学习,RhinoVLA进一步引入了一个统一的接口,结合了ViewRegistry、72D物理状态动作槽空间和机器人实例LoRA,允许异构机器人观察和动作模式在共享策略下对齐。在部署方面,RhinoVLA 通过硬件感知编译、混合精度执行和并行视觉编码进行了优化。实验表明,RhinoVLA在相似的参数尺度下实现了与π0.5相当的下游性能,同时在慧喜R1上达到了11.69 Hz的端到端推理,满足10 Hz实时闭环控制目标。该项目将在 https://github.com/HuixiAI/RhinoVLA 开源。