论文
情境学习能否支持内在的好奇心?
Can In-Context Learning Support Intrinsic Curiosity?
摘要
有效的机器学习不仅取决于我们如何建模数据,还取决于我们选择收集哪些数据。虽然大型序列模型彻底改变了数据建模,但自动数据选择或“内在好奇心”的问题仍然是一个重大挑战。经典方法通过根据“学习进度”奖励代理来激励探索,“学习进度”衡量新获得的观察对世界模型预测能力的提高程度。然而,传统上评估这些奖励需要在每个轨迹内进行昂贵的梯度下降更新内循环,这使得它们在大规模计算上不切实际。在这项工作中,我们研究了序列模型的新兴上下文学习(ICL)功能是否可以通过充当即时、免更新的世界模型来消除这一瓶颈。具体来说,我们评估是否可以仅使用上下文学习者的预测误差和反事实上下文操作来训练探索策略以最大化学习进度。我们首先证明,在一般的马尔可夫决策过程中,这实际上以一种公正的方式是不可能的:由此产生的内在奖励要么受到干扰项的影响,这些项会影响他们对真实学习进度的估计,要么无法使用上下文学习者的预测错误来实现。相反,我们证明了非时间设置的广泛子类的积极结果,包括主动学习和贝叶斯实验设计:在这里,ICL 派生的奖励成功绑定并渐近收敛于真实的学习进度。我们通过连续和符号环境中的受控实验证实了我们的理论,证明我们的 ICL 驱动框架成功地训练了可优化探索的好奇数据收集策略。