论文

Regularized Latent Dynamics Prediction 是行为基础模型的强基线

Regularized Latent Dynamics Prediction is a Strong Baseline For Behavioral Foundation Models

模型训练预训练

摘要

行为基础模型(Behavioral Foundation Models,BFM)能够产生可适应任意未知奖励或任务的智能体。然而,这些方法只能为处于某些既有状态特征张成空间之内的奖励函数产生近优策略,这使得状态特征的选择对BFM的表达能力至关重要。因此,BFM需要用多种复杂目标进行训练,并要求足够的数据集覆盖,以训练出对任务有用的张成特征。在本工作中,我们探讨这样一个问题:这些复杂的表征学习目标对零样本强化学习(zero-shot RL)是否必要?具体而言,我们重新审视了用于状态特征学习的潜空间自监督下一状态预测目标,但观察到该目标单独使用时容易增大状态特征之间的相似度,进而缩减张成空间。我们提出一种名为Regularized Latent Dynamics Prediction(RLDP)的方法,它增加了一个简单的正交性正则化来维持特征多样性,在零样本强化学习上能够达到乃至超越最先进的复杂表征学习方法。此外,我们通过实验表明,在先前方法表现不佳的低覆盖场景中,RLDP仍能取得成功。

Regularized Latent Dynamics Prediction 是行为基础模型的强基线:论文配图
图 1:从训练数据集中均匀采样的状态表示之间的平均余弦相似度。特征相似度随着训练过程的增加而增加;一旦添加正交正则化器(λ=1\lambda=1),我们就获得了更多样化的表示。阴影区域显示 4 个种子的标准偏差。