论文
规模化行为克隆改进因果推理:一个用于实时电子游戏对局的开源模型
Scaling Behavior Cloning Improves Causal Reasoning: An Open Model for Real-Time Video Game Playing
摘要
行为克隆正在重新流行,因为事实证明,扩展模型和数据大小可以为许多感兴趣的任务提供一个强有力的起点。在这项工作中,我们介绍了一种用于训练视频游戏基础模型的开放方法,该模型专为在消费级 GPU 上进行实时推理而设计。我们在开放许可下发布所有数据(8300 多个小时的高质量人类游戏)、训练和推理代码以及预训练的检查点。我们证明,我们最好的模型能够玩各种 3D 视频游戏,其水平可与人类游戏相媲美。我们使用这个方法来系统地检查行为克隆的尺度规律,以了解模型的性能和因果推理如何随模型和数据规模而变化。我们首先在一个简单的玩具问题中展示,对于某些类型的因果推理,增加训练数据量和网络深度会导致模型学习更具因果性的策略。然后,我们系统地研究了在多达 12 亿个参数的缩放模型中,因果关系如何随参数数量(和深度)和训练步骤的变化而变化,并且我们发现了与我们在玩具问题中观察到的类似的缩放结果。
