论文

TD-DPO:差异感知偏好优化,以减轻临床自闭症干预对话中的阿谀奉承

TD-DPO: Difference-Aware Preference Optimization for Mitigating Sycophancy in Clinical Autism Intervention Dialogue

模型训练偏好优化

摘要

大语言模型的阿谀奉承会增加自闭症儿童干预对话的安全风险。受监督的 微调 可以在一定程度上减少阿谀奉承,但仅依靠正面例子通常不足以识别和纠正故障模式。我们观察到,阿谀奉承行为通常可以局限于模型响应的有限范围内。在这种情况下,序列级偏好优化可能会过度更新与偏好无关的标记并降低干预能力。为了解决这个问题,我们提出了 \textbf{M}inimal \textbf{E}dit \textbf{D}ata \textbf{A}ugmentation (MEDA) 策略来构造受控的、稳定的、最小的编辑偏好对和 \textbf{T}oken-level \textbf{D}ifference \textbf{D}irect \textbf{P}reference \textbf{O}ptimization (TD-DPO),其中增加所选响应和拒绝响应之间的差异标记的权重,同时降低共享标记的权重以抑制背景漂移。跨多个骨干网和评估者的广泛实验表明,TD-DPO 在我们的离线环境中实现了减轻阿谀奉承和保留干预能力之间的更好权衡,凸显了其作为自闭症干预的实用调整方法的潜力。