论文

经行为基础模型的探索与在线迁移

Exploration and Online Transfer with Behavioral Foundation Models

智能体系统Agent 环境交互

摘要

强化学习(RL)中的零样本迁移旨在训练一个代理,该代理可以为任何奖励函数生成最佳策略,而无需在迁移时进行额外的学习,同时仅在无奖励轨迹上进行训练。由于其任务的通用性,此类模型有时被称为“行为基础模型”(BFM)。尽管近年来它们表现出了强劲的性能和改进,但当前的框架和算法仍然假设,在传输阶段,代理通过状态奖励对数据集离线获知奖励(要解决的任务),并使用该数据集来选择要部署的最佳策略。然而,在实践中,如果奖励是黑盒(例如直接用户反馈),则不可能生成这样的数据集:有必要通过与环境的交互来观察奖励。换句话说,当前的离线迁移框架与通过试错进行在线学习的传统强化学习设置并不相符,后者需要探索才能找到奖励。本文提出在零样本强化学习中解决这种新的在线传输问题,其关键见解是 BFM 本身可用于生成探索策略。我们证明,可以用类似强盗的探索-利用问题来构建这个在线学习问题。更准确地说,强盗算法在每一步都会推荐一个策略,BFM 在环境中执行它,从而产生奖励和新状态;我们重复这个过程,直到收敛到最优策略。在线性奖励近似的流行背景下,我们得出了受上置信界启发的公式,并表明可以通过最小化不确定性矩阵的特征值来实现探索。我们在一个简单的环境中定性和定量地评估我们的框架,以验证我们方法的概念。