论文

量表锚定 LLM 评审的咨询沟通质量迁移

Language Carries the Expert's Impression: Instrument-Anchored LLM Judges Transfer Counseling-Quality Assessment and Beat In-Domain Training

模型评测评测方法与指标

摘要

对二元咨询对话中沟通质量的自动评估受到数据的瓶颈:专家评级的语料库规模较小且增长成本昂贵。我们研究了专家整体印象预测在三个德国语料库模拟咨询中的跨领域转移(两个全科医疗,一个与学校相关的家长—教师;$n=195$ 专家评级会议,一个量表等同后的语料库)。其他域上的训练击败域内的训练:留一域外传输到达目标域内的嵌套 Spearman $ρ= 0.54$ 与 $\le 0.48$,当训练集大小匹配时,$+0.15$ 的成对会话级间隙保持在 $+0.12$,因此它不仅仅是数据量。决定性的特征是小 开放权重 LLM 阅读两个说话者成绩单的会话级构建分数,这些构建很大程度上源自专家的评分工具:工具衍生的电池将单个评委从 $0.32$ 提升到 $0.41$ 超过通用对话质量,来自三个模型系列的评委合奏为仅语言 $0.51$,非语言二元块增加了 $+0.03$ 更多,在此样本量下无法与噪声分开。我们还对录音设置进行了定价:一台语料库丢失了每个扬声器的音频,其 16% 的日志片段携带了错误的扬声器,并且那里的修复价值为 $+0.07$。在实际可达到的语料库大小下,专家的总体印象更多的是由所说的内容以及其他通信程序的数据而不是自己的数据所承载。

量表锚定 LLM 评审的咨询沟通质量迁移:论文原图
图 2:195 个会话的分数分布。行块是按源仪器构建的组(库存如表4);通用电池出现两次,每个型号一次,并且省略了跨系列 BGR+OSCE 运行。大多数结构占据 3-4 个频带,但判别信号可以通过每个域的校准。