论文
GrammarRL:通过强化学习进行有效的语法约束解码
GrammarRL: Effective Grammar-Constrained Decoding via Reinforcement Learning
摘要
语法约束的生成保证了语法有效性,但当模型的首选输出与强加的语法不一致时,可能会大大降低语义质量。当提示未指定或模型的指令遵循能力有限时,这种权衡尤其严重。波束搜索可以通过探索多个有效序列来部分缓解这些失败,但其计算成本随着波束宽度的增加而增加,而序列级概率只是语义质量的不完美代表。我们引入了 GrammarRL,这是一种无标签强化学习方法,可以使语言模型适应语法约束,而不需要注释数据。 GrammarRL 使用源自其自身可能性的两种互补的自我监督奖励来优化模型:直接奖励,测量给定输入的约束输出的可能性,以及反向奖励,测量从生成的输出重构输入的程度。我们通过对语法约束的部署组使用强化留一法(RLOO)目标来优化这些奖励,并通过 top-1 波束搜索假设进行增强,并针对冻结的基本模型进行正则化。我们使用参数范围从 1B 到 8B 的 Llama 模型在手语注释翻译、分层文本分类和命名实体识别方面评估 GrammarRL。 GrammarRL 始终优于约束贪婪解码,平均提高 9.8 个点,并且增益高达 22.8 BLEU。它在三个任务中的两个上匹配或优于波束搜索,同时保留贪婪解码推理成本。消融进一步表明,这两种奖励是互补的:单独的奖励可能会低于未经训练的基线,而它们的组合会持续改进。