论文

使用大语言模型预测课程决策的后果

Anticipating the Consequences of Curriculum Decisions with Large Language Models

模型训练强化学习

摘要

自动课程学习可以通过选择随时间呈现给智能体的训练体验来提高强化学习的有效性。然而,预测此类决定的后果可能很困难。我们将自动课程学习分析为一个顺序决策问题,强调了决定课程决策价值的数量与通常用于指导课程决策的局部学习信号捕获的信息之间的差距。然后,我们研究大语言模型 (LLM) 是否可以利用有关学习问题的更丰富的信息来更好地预测课程决策的后果。我们引入了一种方法,该方法将在线学习进度估计与由LLM提供的估计相结合,对(i)每个任务学习的潜在下游收益以及(ii)当前任务上的直接训练是否可能产生进展进行估计。我们根据不同课程目标下 Craftax 中 256 个文本目标的自定义基准来评估该方法。我们观察到在针对单个目标任务进行优化时获得了最强的收益。在整个任务集上进行优化时,具有不同跨任务迁移机制的学习者所获得的好处各不相同,从学习速度的适度提高到在训练结束时持续的更大收益。