CoTinyVLA:面向亚十亿参数视觉-语言-动作模型的思维链蒸馏
CoTinyVLA: Chain-of-Thought Distillation for a Sub-Billion-Parameter Vision-Language-Action Model
摘要
视觉-语言-动作(VLA)模型将自然语言指令转换为机器人动作序列,但LIBERO-Plus鲁棒性基准上的领先系统使用30亿至70亿参数的骨干网络,其内存需求可能超出嵌入式机器人预算。我们提出CoTinyVLA,一个基于Qwen3.5-0.8B骨干的0.9B参数动作模型,它通过结构化监督而非扩大模型来获得同等鲁棒性。三个组件分别针对问题的不同轴:每步16帧历史帧的双视角时序输入,附带文本化的相机与时间标记;来自35B教师模型的层级思维链(CoT)蒸馏,生成回合级Plan与块级Think片段,覆盖任务阶段、夹爪状态与下一子动作;以及将40条基础指令扩展为800个变体的释义增强。在覆盖七个扰动维度、10,030个扰动任务的LIBERO-Plus上,CoTinyVLA在Spatial达到90.8%、Object达到87.3%、Goal达到86.6%、Long达到80.7%,在全部四个套件上分别领先最强7B基线4.7、2.8、15.9与3.0个百分点,且每个差距区间都不包含零。增益集中在基准最难的轴上:在十一个已发表基线中,没有任何一个在任何套件的Robot Initial States上超过53.2%,而CoTinyVLA在Goal上达到73.6%,最强基线仅为39.9%。消融实验表明三个组件可按扰动轴分离,且在匹配图像预算下,帧在两个相机与时间维度上的划分方式本身即可贡献8.6个百分点。闭环推理的GPU内存分配峰值仅为2.25 GiB,成对干预显示回合级Plan起承重作用:将其替换为空片段或矛盾片段会使成功率损失40至45个百分点。结构化监督由此使0.9B骨干超越上述所有系统。代码:https://github.com/BrainJellyPie/CoTinyVLA
