论文
高斯就足够了:流量匹配先验在微调大型行为模型时没有帮助
The Gaussian Is Enough: Flow-Matching Priors Do Not Help When Fine-Tuning Large Behavior Models
摘要
现代机器人模仿学习越来越依赖于基于扩散或流程匹配模型的生成策略,这些模型通过转换先验分布的样本来生成动作。一个关键问题是先验的选择是否重要。事实证明,从头开始训练时,用更接近目标的非高斯先验替换标准高斯可以显着提高性能。自然的下一步是询问这些收益是否会转移到微调预训练的大型行为模型 (LBM),例如 LBM 1.0、$\pi_{0.5}$ 和 GR00T~N1.5,人们可能会期望获得更大的收益。令人惊讶的是,我们发现情况并非如此,除非微调数据分数可能非常低。在两个模拟平台上的 40 多个任务上跨越所有三个上述 LBM 的超过 100K 次模拟展示,以及在五个双手操作任务上的 1250 次硬件展示中,与标准高斯先验相比,非高斯先验明显更接近目标,产生的统计性能无法区分或更差的微调性能。诊断分析揭示了原因:尽管微调的编码器嵌入与预训练的嵌入以及彼此之间存在很大差异,但微调的模仿学习策略会收敛于先验中的类似动作预测。学习率消融进一步证实编码器训练是微调性能的主导因素,大大超过了先前选择的影响。最后,我们给出了未来研究的具体方向,即学习先验何时以及为何在微调中仍然很重要。项目页面:此 https URL