论文

通过跨关系偏好学习改善大语言模型的指令遵循

Cross-Relational Preference Learning for Better LLM Instruction Following

模型训练偏好优化

摘要

大语言模型 (LLM) 在遵循复杂指令方面仍然表现出有限的能力。虽然现有的方法通常依赖于偏好学习来增强这种能力,但它们通常忽略了不同指令的允许响应空间之间的关系,这限制了模型与微妙和多样化的约束变化保持一致。为了解决这个问题,我们提出了跨关系偏好学习(CRPL),这是一种用于构建偏好数据的新颖框架,它通过两种关键技术显式地建模指令间关系:跨关系扰动和跨区域对采样。这使得能够生成更多样化的偏好数据,捕获广泛的约束变化。此外,我们引入了基于原子约束的验证机制来严格评估响应满意度,确保高质量的偏好对构建。跨多种偏好学习方法(例如 DPO、KTO)、LLM 主干和四个指令遵循基准的广泛实验表明,我们的方法比之前的基线实现了实质性改进,并表现出很强的泛化性。

通过跨关系偏好学习改善大语言模型的指令遵循:论文配图
图2:我们相互关系优先学习(CRPL)框架概览。(1) 交叉关系扰动:我们将原指令分解为原子约束,并产生受干扰的指示,显示与原指令的具体反应空间关系(封闭、部分重叠或脱节)。(2) 跨区域对等抽样:在以原子限制为基础的核查机制的保护下,我们从不同次区域取样了综合反应空间的正面和负面反应,以构建多样化、优质的优惠配对。