论文
LSRIF:用于指令跟踪的逻辑结构强化学习
LSRIF: Logic-Structured Reinforcement Learning for Instruction Following
摘要
指令跟踪对于大语言模型至关重要,但现实世界的指令通常包含逻辑结构,例如顺序依赖和条件分支。现有方法通常构建具有并行约束的数据集并优化平均奖励,忽略逻辑依赖性并产生噪声信号。我们提出了一种逻辑结构的训练框架 LSRIF,它显式地模拟指令逻辑。我们首先构建具有并行、顺序和条件类型等约束结构的数据集LSRInstruct,然后设计结构感知奖励方法LSRIF,包括并行结构的平均聚合、顺序结构的失败惩罚传播和条件分支的选择性奖励。实验表明,LSRIF 在指令遵循(域内和域外)和一般推理方面带来了显着改进。分析表明,使用显式逻辑结构进行学习会带来注意力层中的参数更新,并增强对约束和逻辑运算符的标记级注意力。
