论文

每组误差,而非总 MSE:11-DoF 移动操纵的 微调 视觉-语言-动作模型

Per-Group Error, Not Total MSE: Fine-Tuning Vision-Language-Action Models for 11-DoF Mobile Manipulation

模型评测评测方法与指标

摘要

用于具有异构关节空间的移动机械手的 微调 视觉-语言-动作 (VLA) 模型可能会产生违反直觉的结果:具有最低聚合 MSE 的检查点并不是在真实机器人上表现最好的检查点。我们认为,这是将异构关节组(手臂、夹具、头部、轮式底座)折叠成单个度量的可预测结果,其中易于预测的关节可以掩盖仍然失败的关节。我们在 11-DoF Toyota HSR 上微调 SmolVLA(450M,仅限动作专家),并将其与更强的预训练基线 $π_{0.5}$ (3.3B) 进行比较。每组分析揭示了两种模式:在 SmolVLA 中,移动基础收敛最慢并限制整体性能。在 $π_{0.5}$ 的仅限专家 微调 中(仅训练动作头,骨干冻结),总 MSE 降至基线以下,但手臂准确性下降。在 60 个真实机器人试验中(每个模型 20 个),$π_{0.5}$ 80k (4.0/4) 显着优于两种微调变体(仅专家 3k:3.75/4;HSR-SmolVLA:3.5/4;Mann-Whitney $p \leq 0.010$),尽管仅专家 3k 的总 MSE 最低。这种分离与离线臂组误差最一致,而不是总 MSE 或基组误差。我们得出的结论是,对于具有异构动作空间的机器人的检查点选择,每组误差是比总 MSE 更可靠的信号。代码:https://github.com/paumontagut/per-group-mse-vla