论文
用于组合泛化的因素感知专家混合与预训练编码器
Factor-Aware Mixture-of-Experts with Pretrained Encoder for Combinatorial Generalization
摘要
预训练编码器与扩散策略的集成已成为视觉机器人操作的主导范例。然而,它仍然难以在具有不同因素(例如光照和表面纹理)的复杂环境中进行推广。为了解决这个问题,我们提出了 FAME,这是一个将因子感知专家混合 (MoE) 与预训练编码器集成在一起的框架,以增强对环境变化的泛化。 FAME 遵循三个阶段的训练过程:(1)策略预热,其中使用冻结编码器在标准环境数据上训练扩散策略; (2)特定因素的适配器训练,其中插入冻结编码器和暂时冻结策略之间的轻量级适配器在定制数据集上进行训练,每个数据集针对不同的环境变化; (3)联合微调,其中中央路由器和预热策略接受混合数据的训练以联合处理多个因素。 FAME 是“因素感知”的,因为中央路由器将冻结的特定因素适配器作为密集的 MoE 进行软加权,从而实现跨多个因素的组合泛化。对 Meta-World 基准的评估表明,FAME 比扩散政策基准高出 34%。我们使用在新收集的数据上训练的紧凑模型,在现实世界的拾放任务中进一步验证 FAME,其中 FAME 在现实世界变化下的泛化能力提高了 35%。