论文
TabQL:使用表格基础模型进行上下文 Q 学习
TabQL: In-Context Q-Learning with Tabular Foundation Models
摘要
我们提出了表格 Q-学习 (TabQL),这是一种强化学习框架,它用具有上下文学习功能的表格基础模型取代了深度 Q 学习 (DQN) 中的传统参数 Q 网络。关键思想是通过序列到序列基础模型来表示 Q 值,该模型在状态 - 动作 - Q 值元组的表格表示上运行,从而可以通过根据最近的经验来快速适应有限的在线交互。 TabQL 与经典 DQN 不同,它利用 (i) 通过上下文更新进行零次或几次 Q 值推理,以及 (ii) 使用标准 DQN 引导高质量上下文的预热阶段。特别是,为了增强上下文质量,通过使用来自 DQN 的预测 Q 值执行 TabQL 输出的操作来生成新的转换。我们将 TabQL 形式化,在温和的假设下分析其收敛性和样本复杂性,并表明 TabQL 在普通 Q 学习和具有上下文学习的 DQN 之间进行插值。我们的分析表明,与 DQN 相比,TabQL 通过上下文学习分摊 Bellman 更新,从而提高了效率。使用多个基准进行的广泛数值实验展示了所提出的 TabQL 的有效性和功效。