论文
世界模型的可识别词元对应
Identifiable Token Correspondence for World Models
摘要
基于词元的 Transformer 世界模型在视觉强化学习中表现出了强大的性能,但在长期部署中经常遇到时间不一致的问题,包括对象复制、消失和嬗变。一个关键原因是大多数现有方法将下一帧预测纯粹视为词元生成问题,而没有考虑词元随时间的持久性。我们引入了可识别词元对应(ITC),这是基于词元的 Transformer 世界模型的解码步骤,它将下一帧预测制定为具有潜在词元对应变量的结构化分配问题:每个下一帧词元都通过从前一帧复制词元或生成新词元来解释。 ITC 保持 Transformer 架构和训练程序不变,并且可以添加到现有主干网之上。我们的实验在 4 个具有挑战性的基准测试中展示了最先进的性能。该方法在 Craftax-classic 基准上实现了 72.5% 的回报率和 35.6% 的得分,显着超过了之前的最佳成绩 67.4% 和 27.9%。我们在 https://github.com/snu-mllab/Identifying-Token-Correspondence 上发布了源代码。