论文
流形强盗:贝叶斯课程学习 大语言模型 的潜在几何
Manifold Bandits: Bayesian Curriculum Learning over the Latent Geometry of Large Language Models
摘要
强化学习 (RL) 是提高 大语言模型 (LLM) 推理能力的核心方法,其中训练效率主要取决于优化过程中如何对问题进行采样。现有的适应性课程学习方法通常优先考虑中等难度的提示,将问题选择视为具有独立臂的标准强盗问题,并忽视任务空间的结构化、异构性质。在这项工作中,我们将问题采样构建为具有内生非平稳性的流形结构强盗问题:问题通过模型的潜在表示空间相关,采样决策可以引导学习信号如何在该空间中演化。为了实现这一观点,我们引入了贝叶斯流形课程(BMC),这是一种结构感知框架,它将问题组织成分层任务树,并应用贝叶斯学习来指导采样。根据经验,我们发现不同的采样策略会导致生产力(学习信号)、多样性(任务流形的覆盖范围)和效用(评估相关性)之间的重要权衡。这些结果表明,仅对难度进行优先级排序不足以实现强大的下游性能,这凸显了将结构和类型意识纳入问题采样的重要性。