论文

LSRIF:用于指令跟踪的逻辑结构强化学习

LSRIF: Logic-Structured Reinforcement Learning for Instruction Following

模型训练强化学习

摘要

指令跟踪对于大语言模型至关重要,但现实世界的指令通常包含逻辑结构,例如顺序依赖和条件分支。现有方法通常构建具有并行约束的数据集并优化平均奖励,忽略逻辑依赖性并产生噪声信号。我们提出了一种逻辑结构的训练框架 LSRIF,它显式地模拟指令逻辑。我们首先构建具有并行、顺序和条件类型等约束结构的数据集LSRInstruct,然后设计结构感知奖励方法LSRIF,包括并行结构的平均聚合、顺序结构的失败惩罚传播和条件分支的选择性奖励。实验表明,LSRIF 在指令遵循(域内和域外)和一般推理方面带来了显着改进。分析表明,使用显式逻辑结构进行学习会带来注意力层中的参数更新,并增强对约束和逻辑运算符的标记级注意力。

LsrIF:增强大语言模型的逻辑结构化指令遵循 配图
图 2:我们的框架 LsrIF 由两部分组成:(LsrInstruct) 逻辑结构化数据集构建,以及 (LsRM) 结构感知奖励建模,并配有相应方法。