论文
Vintix II:决策预训练 Transformer 是一个可扩展的上下文强化学习器
Vintix II: Decision Pre-Trained Transformer is a Scalable In-Context Reinforcement Learner
摘要
上下文强化学习(ICRL)的最新进展证明了其训练通才智能体的潜力,这些智能体可以直接在推理中获取新任务。算法 蒸馏 (AD) 开创了这种范例,并随后扩展到多域设置,尽管其泛化到未见过的任务的能力仍然有限。引入了决策预训练 Transformer (DPT) 作为替代方案,在简化领域中显示出更强的上下文强化学习能力,但其可扩展性尚未建立。在这项工作中,我们将 DPT 扩展到不同的多域环境,将流匹配作为一种自然的训练选择,保留其对贝叶斯后验采样的解释。结果,我们获得了一个经过数百个不同任务训练的代理,该代理在对保留的测试集的泛化方面取得了明显的成果。该代理在之前的 AD 扩展的基础上进行了改进,并在在线和离线推理方面表现出更强的性能,从而增强了 ICRL 作为专家 蒸馏 训练通才代理的可行替代方案。