论文

通过结果级别优化进行成分泛化的强化学习

Reinforcement Learning for Compositional Generalization with Outcome-Level Optimization

模型训练强化学习

摘要

组合概括是指正确解释已知基元的新组合,这仍然是一个重大挑战。现有方法通常依赖于监督 微调,这鼓励模型模仿目标输出。这种 词元级 训练范例无法捕获泛化到未见过的组合所需的全局组合结构。在这项工作中,我们研究是否可以通过结果级强化学习来改进成分泛化。我们采用组相对策略优化来根据最终输出的反馈来优化模型。在此框架内,我们探索了简单的二元结果奖励和提供额外组合反馈的复合奖励。多个构图基准的实验表明,与监督 微调 相比,强化学习提高了构图泛化能力。进一步的分析表明,监督模型往往会过度拟合频繁的训练构图,而强化学习通过重塑输出分布来改善构图泛化,特别是对于更复杂的构图类型。