论文
BayesFP:通过 Feynman-Kac 采样进行基于流的策略的后验估计
BayesFP: Posterior Estimation for Flow-Based Policies via Feynman-Kac Sampling
摘要
机器人必须生成忠实于所学专家行为的轨迹,同时满足安全约束和仅在推理时指定的特定任务目标。我们将预训练扩散和流量匹配策略的约束轨迹生成制定为贝叶斯后验采样,以学习到的示范分布作为先验,并以推理时间、成本导出的可能性将其向可行的最优轨迹倾斜。为了在不对基本策略进行任何重新训练的情况下从后验中进行采样,我们利用最初为扩散模型制定的 Feynman-Kac 校正器框架,并将其扩展到确定性流匹配策略。结果是一个用于扩散和流量策略的统一的、推理时间的、无需再训练的采样器。我们在模拟和现实操作任务中验证了预训练扩散策略、GR00T-N1.6 和 $π_{0.5}$ 检查点的方法,包括围绕推理时引入的非凸障碍进行规划,并在零样本任务上展示了相对于基础 $π_{0.5}$ 的改进。