论文
微调 多模式生成策略的行为模式发现
Behavioral Mode Discovery for Fine-tuning Multimodal Generative Policies
摘要
我们通过强化学习(RL)解决了 微调 预训练生成策略的问题,同时保留了其动作分布的多模态性。生成策略(例如扩散策略)的 RL 微调 的现有方法可以提高任务性能,但经常将不同的行为分解为单一的奖励最大化模式。为了缓解这个问题,我们提出了一种无监督模式发现框架,该框架可以揭示生成策略中的潜在行为模式。所发现的模式能够使用互信息作为内在奖励,规范 RL 微调 以提高任务成功率,同时保持行为多样性。机器人操作任务的实验表明,我们的方法始终优于传统的 微调 方法,实现了更高的成功率并保留了更丰富的多模式动作分布。