论文
通过跨关系偏好学习改善大语言模型的指令遵循
Cross-Relational Preference Learning for Better LLM Instruction Following
摘要
大语言模型 (LLM) 在遵循复杂指令方面仍然表现出有限的能力。虽然现有的方法通常依赖于偏好学习来增强这种能力,但它们通常忽略了不同指令的允许响应空间之间的关系,这限制了模型与微妙和多样化的约束变化保持一致。为了解决这个问题,我们提出了跨关系偏好学习(CRPL),这是一种用于构建偏好数据的新颖框架,它通过两种关键技术显式地建模指令间关系:跨关系扰动和跨区域对采样。这使得能够生成更多样化的偏好数据,捕获广泛的约束变化。此外,我们引入了基于原子约束的验证机制来严格评估响应满意度,确保高质量的偏好对构建。跨多种偏好学习方法(例如 DPO、KTO)、LLM 主干和四个指令遵循基准的广泛实验表明,我们的方法比之前的基线实现了实质性改进,并表现出很强的泛化性。
