论文

规模化行为克隆改进因果推理:一个用于实时电子游戏对局的开源模型

Scaling Behavior Cloning Improves Causal Reasoning: An Open Model for Real-Time Video Game Playing

模型训练预训练

摘要

行为克隆正在重新流行,因为事实证明,扩展模型和数据大小可以为许多感兴趣的任务提供一个强有力的起点。在这项工作中,我们介绍了一种用于训练视频游戏基础模型的开放方法,该模型专为在消费级 GPU 上进行实时推理而设计。我们在开放许可下发布所有数据(8300 多个小时的高质量人类游戏)、训练和推理代码以及预训练的检查点。我们证明,我们最好的模型能够玩各种 3D 视频游戏,其水平可与人类游戏相媲美。我们使用这个方法来系统地检查行为克隆的尺度规律,以了解模型的性能和因果推理如何随模型和数据规模而变化。我们首先在一个简单的玩具问题中展示,对于某些类型的因果推理,增加训练数据量和网络深度会导致模型学习更具因果性的策略。然后,我们系统地研究了在多达 12 亿个参数的缩放模型中,因果关系如何随参数数量(和深度)和训练步骤的变化而变化,并且我们发现了与我们在玩具问题中观察到的类似的缩放结果。

规模化行为克隆改进因果推理:一个用于实时电子游戏对局的开源模型 配图
图 2:(2(a)) P2P 架构。核心策略 transformer 与动作解码器均为 decoder-only transformer。每个时间步以文本 token t_i 开始。由于许多帧不包含文本标注,这些帧使用默认文本 token t_null。随后是来自视频帧 o_i 的图像 token,再接一个可学习的“推理”token k_i,为模型提供额外计算。策略 transformer 随后输出单个动作预测 token a_in。接着,一个更小的 transformer——动作解码器——将单个动作预测 token 自回归地变换并采样到完整动作空间。然后输入真实的动作 token a_i,使得时间步 i+1 处的 a_in 能够关注来自时间步 i 的真实动作 token。(2(b)) 我们 transformer 策略中使用的注意力掩码(绿色表示 1,灰色表示 0)。这一自定义掩码确保时间步 i 处的动作预测 token a_in 无法关注时间步 i 的真值动作。注意,为稳定训练过程,其他 token 均不关注 a_in。