论文
探讨规模对 Atari 数据高效、通才 Transformer 世界模型的影响
Probing the Impact of Scale on Data-Efficient, Generalist Transformer World Models for Atari
摘要
开发保持类人数据效率的通用系统是一个核心挑战。虽然世界模型(WM)提供了一条有希望的道路,但现有的研究经常将架构机制与模型 \emph{scale} 的独立影响混为一谈。在这项工作中,我们使用极简主义的 Transformer 世界模型来分析 Atari 100k 基准上的扩展行为,并使用从预设的专家策略派生的固定离线数据集。我们的结果表明,即使受到相同的离线数据预算和模型容量的限制,环境从根本上属于不同的扩展机制。对于单个任务,某些环境自然允许模型通过插值阈值,从而在过度参数化的情况下产生单调改进,而其他环境则仍然陷入经典状态,其中较大的世界模型会降低保真度。在统一设置中,即在一组 26 个 Atari 环境上训练单个 Transformer 时,我们发现联合训练可以稳定扩展动态,确保所有环境的单调增益,无论其固有的扩展机制如何。最后,我们证明了保真度的提高可以直接转化为下游控制,完全在模拟动态中学习的策略达到了 0.770 的专家随机归一化中值分数。我们的研究结果表明,未来的进步取决于精确的扩展策略和架构创新。