论文
好奇心批评家:累积预测误差改进作为世界的易处理的内在奖励 模型训练
Curiosity-Critic: Cumulative Prediction Error Improvement as a Tractable Intrinsic Reward for World Model Training
摘要
基于局部预测误差的好奇心奖励关注当前的转变,而不考虑世界模型在所有访问过的转变中的累积预测误差。我们引入了 Curiosity-Critic,它将其内在奖励建立在累积目标的改进上,并表明它承认一个易于处理的每步替代项:当前预测误差与当前状态转换的渐近误差基线之间的差异。我们与一位与世界模型共同训练的博学批评家在线估计这个误差基线;由于批评者只需要了解预测转变的难度,因此它对不可约噪声基底的估计在世界模型饱和之前就收敛了,从而将探索转向可学习的转变。对于可学习的转换,奖励较高,而对于随机转换,奖励则趋近于零,从而将认知(可简化)与任意(不可简化)在线预测误差分开。先前的预测误差好奇心公式,从 Schmidhuber (1991) 到学习特征空间变体,都是作为与该误差基线的特定近似相对应的特殊情况出现的。在随机网格世界上的实验表明,Curiosity-Critic 在训练速度和最终世界模型准确性方面优于预测误差、访问计数和随机网络 蒸馏 方法。