论文
语义物理现实的 4 张量注意力模型
4-Tensor Attention Model for Semantic Physical Reality
摘要
我们描述了一个 4 张量注意力模型,用于预测场景的下一个语义状态,用于视频生成和机器人规划。状态窗口具有位置 (x, t) 和两个纤维,一个语义纤维和一个时间上下文纤维,并且一个 softmax 联合规范化窗口上的注意力。框架和代理的情况被写为这些状态;编码器、渲染器和规划器保留在更新之外。为了测试更新本身,我们在 ROCStories 上进行训练,其中每个窗口在语义层提出相同的下一句任务。在验证分割中,每个设置一个种子,4 张量模型的三个匹配设置的最后一句交叉熵比自由运行的一维变换器低 5.3%(H=2、L=2 时)、2.6%(H=4、L=2 时)和 2.4%(H=4、L=3 时)。当 H=4、L=2 时,参数计数几乎相同,分别为 172.5M 和 175.9M。在相同的两个 GPU 上,4 张量运行需要 2.4 小时,基线运行需要 45.2 小时;基线通过自由运行解码进行训练,每个目标标记进行一次顺序前向传递。