论文

StaKe:用阶段和关键帧监督改善VLA微调

Improving Vision-Language-Action Model Fine-Tuning with Structured Stage and Keyframe Supervision

模型训练监督微调与指令调优

摘要

视觉语言动作模型具有机器人操作泛化潜力,但微调时各时间步接受相同动作监督,缺少对当前操作阶段及下一次夹爪事件目标的结构化监督,使失败集中在困难的夹爪状态转换处。StaKe自动从示范中的夹爪状态提取两类信号,无需人工标注:阶段分类器识别当前操作阶段,关键帧预测器估计下一次夹爪状态转换时的目标关节动作。两者作为轻量辅助头在训练中丰富表示,不改变原VLA架构与推理循环。双臂模拟与单臂Franka真实机器人实验中,成功率分别相对提高14%和56%,涉及更多夹爪转换的长程任务改善更大。消融及定性分析支持各设计及操作阶段跟踪能力。项目:https://hi-yuanxu.github.io/StaKe-Web/。