论文

RIMS:通过平滑多对聚合进行偏好优化,实现小规模 LLM 检索增强生成

RIMS: Preference Optimization via Smoothed Multi-pair Aggregation for Small-Scale LLM Retrieval-Augmented Generation

模型训练偏好优化

摘要

小规模语言模型 (SLM) 对于资源受限环境中的检索增强生成 (RAG) 很有吸引力,但其有限的容量使它们对噪声或虚假的检索证据高度敏感。现有的基于偏好的方法(例如 RoseRAG)通过硬 argmin/argmax 只选择最难的单个偏好对,丢弃剩余的信号;其他人将多个对视为独立的二进制比较,导致数据利用率低。我们提出了RIMS,一个三阶段偏好优化框架,包括(1)使用目标SLM本身通过拒绝采样生成综合思想链偏好数据,而不依赖于专有模型,(2)一种可微的软聚合机制,用平滑算子取代硬选择,保留来自所有偏好对的梯度信号,同时保留边缘感知选择的判别结构,以及(3)将平滑目标应用于多种对齐算法的偏好优化。我们从理论上证明,平滑近似允许可控误差范围,并且平滑聚合可证明比硬选择更紧密地与预言机目标进行梯度对齐。对四个多跳问答基准的实验表明,我们的方法在多个 SLM 主干上优于最先进的基线,在嘈杂的检索条件下在精确匹配和 F1 方面实现了一致的增益。我们的实现可在 https://github.com/tptrix29/RIMS 上找到。