论文

LAFP:通过流匹配保留潜在策略学习中的潜在动作结构

LAFP: Preserving Latent Action Structure in Latent Policy Learning via Flow Matching

模型训练监督微调与指令调优

摘要

从大规模未标记视频中学习高质量的潜在动作,再加上用于训练动作解码器的有限的现实世界交互数据,已成为可扩展潜在策略学习的有前途的范例。然而,现有的方法通常依赖于行为克隆,这往往会将固有的多模态动作分布折叠成单模态分布,从而降低预先训练的潜在动作结构。虽然流匹配提供了一种潜在的替代方案,但由于学习策略的随机性,直接应用它会导致动作解码器训练期间潜在动作和物理动作之间的不一致。为了解决这些问题,我们提出了潜在动作流策略(LAFP),它利用流匹配进行潜在策略学习,并引入推理时间插值机制来减轻随机性引起的错位。实验结果表明,LAFP 在下游模仿学习任务上始终优于现有方法,成功率提高了 10-15%,同时产生的额外推理开销不到 1 倍。