论文

阻力滚动:偏好优化的 LLM 咨询师可以在动机访谈中用目标坚持来换取关系协调

Rolling With Resistance: Preference-Optimized LLM Counselors Can Trade Goal Persistence for Relational Attunement in Motivational Interviewing

模型评测模型行为与机制分析

摘要

在动机访谈(MI)中,来访者的维持谈话(对现状的争论)要求咨询师进行抵抗,这一举动可能会以两种相反的方式失败:投降(放弃变革议程以保持融洽关系)或对抗(争论或指导,凌驾于来访者的自主权之上)。我们引入了对咨询师反应的双轴评估,以动机访谈治疗完整性(MITI)准则、目标持久性(GP)和关系调和(RA)为基础,产生一个四象限框架,其中阻力滚动在两者上都很高,并且我们询问通过偏好优化惩罚一个失败是否会教导阻力滚动或引发相反的结果。从专家注释的 AnnoMI 语料库中,我们使用 同策略 否定构建主题不相交的直接偏好优化数据,其偏好集仅在拒绝失败方面有所不同。一个自动判断器,根据 AnnoMI 的专家标签进行验证,并由训练有素的人类编码员重新检查,在防火墙下对每个基地进行盲目的成对胜率评分,在防火墙中,不相交的模型系列生成、标记和判断。在 Qwen 和 Llama 家族的三个一致的教学模型中,惩罚性对抗可靠地将目标持久性降低到同等水平以下,在每个垒和每次种子运行中,这是一个巨大的成本,而协调增益是依赖于垒的,存在于三个垒中的两个垒上,但在第三个垒上不存在。惩罚投降是惰性的,因为这些模型很少投降 同策略,因此交易受到每个基地的失败情况的限制。仅提示控制可以在没有目标持久成本的情况下提高协调,将成本定位在优化而不是协调本身。