论文
DGPO:通过方向一致的分组优化超越成对偏好
DGPO: Beyond Pairwise Preferences with Directional Consistent Groupwise Optimization
摘要
尽管 大语言模型 (LLM) 取得了显着的进步,但当前的偏好优化方法仍然难以在保持推理多样性的同时保持方向一致性。为了解决这个限制,我们提出了方向分组偏好优化(DGPO),这是一个轻量级框架,可以在组级别聚合监督信号,并通过多候选比较显式地建模方向感知对齐。 DGPO 将正向和反向问答实例组织成结构化集合,并优化基于边际的似然目标,将连贯的推理路径与不一致的替代方案分开。这种分组表述比成对目标捕获更丰富的相关信息,并增强了不同推理路径的一致性。实证结果表明,我们构建的反向数据在五个基准测试中平均提高了 3.2%,而 DGPO 进一步在多个数据集和模型系列中提供了一致的增益,实现了高达 3.6% 的平均精度提高。