论文

通过选择性上下文偏好优化学习何时信任

Learning When to Trust via Selective Context Preference Optimization

模型训练偏好优化

摘要

语言模型越来越多地根据外部信号来决定其答案,而一个误导性的答案就可能使正确答案变成错误的。显而易见的补救措施,即训练模型来抵抗此类信号,隐藏了一种失败模式:忽略所有上下文的模型看起来很稳健,但当上下文值得信任时却毫无用处。我们将问题重新定义为选择性信任,并引入了 MIST(一种人工注释的基准),它在四种匹配条件(干净、误导、正确上下文和不相关上下文)下呈现每个推理项,以及 SC2W,这是一个配对指标,用于计算误导性信号将干净正确答案翻转为错误答案的频率。通过一项全面的基准研究,我们观察到这种敏感性是普遍存在的。然后,我们提出 SCOPE,它挖掘干净正确/误导错误的失败,并在所有四个条件下均衡平衡的匹配偏好对上优化标准直接偏好优化(DPO)目标,而不是单独优化误导性项目。我们的方法大大减少了流行开源模型上的 SC2W,同时在添加的上下文干净、正确或不相关时保持准确性。通过这项工作,我们认为应该根据选择性信任来判断模型,而不仅仅是根据抵制。