论文

迈向订单公平:通过双组优势优化降低 LLM 订单敏感性

Towards Order Fairness: Mitigating LLMs Order Sensitivity through Dual Group Advantage Optimization

模型训练强化学习

摘要

大语言模型 (LLM) 存在顺序偏差,其性能受到输入元素排列顺序的影响。这种不公平性限制了模型在上下文学习和检索增强生成(RAG)等场景中的应用。最近的研究试图根据统计结果或使用基于数据集的搜索来获得最优或次优的排列,但这些方法增加了推理开销,同时使模型固有的顺序偏差未能解决。其他研究通过使用具有多个顺序变体的增强训练集的监督 微调 来减轻顺序敏感性,但通常以准确性为代价,使模型陷入一致但不正确的幻觉中。在本文中,我们提出\textbf{D}ual \textbf{G}roup \textbf{A}dvantage \textbf{O}优化(\textbf{DGAO}),旨在同时提高模型精度和阶次稳定性。 DGAO 计算并平衡组内相对准确性优势和组间相对稳定性优势,奖励生成订单稳定且正确输出的策略模型,同时惩罚订单敏感或不正确的响应。这标志着强化学习首次用于减轻 LLM 的顺序敏感性。我们还提出了两个新的指标:一致性率和过度自信率,以揭示先前方法的伪稳定性并指导更全面的评估。大量实验表明,DGAO 实现了卓越的顺序公平性,同时提高了 RAG、数学推理和分类任务的性能。我们的代码位于:https://github.com/Hyalinesky/DGAO。