论文

三思而后行:将树搜索提炼为冻结 VLA 模型的动作评估

Look Before You Leap: Distilling Tree Search into Action Evaluation for Frozen VLA Models

模型推理推理搜索与路径规划

摘要

视觉-语言-动作(VLA)模型通过大规模预训练获得了广泛的体现能力,但其泛化能力仍然比 LLM 和 VLM 脆弱得多。流行的补救措施是通过有监督的 微调 或强化学习来提高 后训练 的性能,但会缩小使预训练变得有价值的通才能力。我们确定了一个关键瓶颈:VLA 失败不仅源于动作生成,还源于动作评估。一项诊断 pass@k 研究证实,冻结的 VLA 已在其输出分布中包含有效行为,总体成功率从 pass@1 时的 33% 上升到 pass@32 时的 92%。受此启发,我们提出了 SVA(搜索、价值和行动),这是一个简单的框架,为冻结的 VLA 政策提供长期后果意识。 SVA首先在模拟中使用蒙特卡罗树搜索来充分探索VLA的输出分布并收集带有经验回报注释的多样化轨迹;然后,这些知识被提炼成一个轻量级的 Q 值模型,该模型可以预测候选动作的预期结果;在部署时,冻结的 VLA 会提出多个候选者,评估者会选择具有最高不确定性正则化 Q 值的候选者,无需访问模拟器。通过将行动建议与结果评估分离,SVA 保留了 VLA 主干的泛化能力,同时大幅提高了任务成功率。跨具体基准的实验表明,SVA 持续改进了未见过的任务的泛化能力,并表现出强大的测试时间扩展行为。引人注目的是,SVA 使 9B VLA 的性能比 27B VLA 提高了 7 个百分点,推理延迟降低了 27%,这表明扩展测试时间评估比扩展模型大小更具成本效益。