论文

风格消除 DPO:利用事实感知综合偏好数据更新 LLM 知识

Style-Debiased DPO: Updating LLM Knowledge with Factuality-Aware Synthetic Preference Data

模型训练偏好优化

摘要

带有数据增强(例如释义)的持续预训练(CPT)可以将小型源语料库的知识存储在大型语言模型(LLM)中。然而,存储的知识并不总是能够正确检索。我们研究引出方而不是存储方:我们使用偏好优化,它从首选(选择)和不首选(拒绝)响应对中学习,以便模型更准确地引出其存储的知识。提出的一种方法将模型自身的错误响应视为拒绝,并选择最佳答案,以抑制错误。然而,当目标知识部分已知时,大多数被拒绝的回答实际上都是正确的。然后,使用直接偏好优化 (DPO) 来降低包含正确知识且仅在风格(例如长度和措辞)上与所选答案不同的被拒绝的答案。我们提出了风格消除 DPO (SD-DPO),它对每对被拒绝的响应是否实际上正确进行评分,反转这些对的偏好,并对它们进行加权,以便从整体上抵消由于风格差异而产生的学习信号。我们首先测试,在 EntiGraph(一种对从语料库合成的文本上运行 CPT 的代表性存​​储端方法)之上,我们的方法是否有效地提高了准确性。在 QuALITY(评估 EntiGraph 的阅读理解 QA 基准)上,SD-DPO 超过了我们对来自相同基础模型的 EntiGraph 合成数据进行 CPT 的基线,并使用相同的程序进行评估。这所需的训练词元比获得相同增益所需的额外 CPT 少了几十倍。对于知识更新(这项工作的主要目标),我们使用 AToKE,这是一个针对随时间变化的事实的知识编辑基准。在那里,SD-DPO 的总体准确度达到 0.982,并根据查询的时间段回答新的或旧的事实。