论文

MIS-Bench:心理治疗人际技能的多模态语言模型评测

MIS-Bench: Benchmarking Multimodal LLMs for Psychotherapeutic Interpersonal Skills Assessment

模型训练监督微调与指令调优

摘要

多模态大语言模型(MLLM)越来越多地被用作评估器,但它们在需要专家判断的专业评估任务中的可靠性仍不清楚。我们在评估心理治疗人际技能的背景下研究这一挑战,并引入 MIS-Bench,这是一种多模式人际技能 (MIS) 基准,包含 996 个心理治疗反应视频,在促进性人际技能的 8 个维度上进行注释。在具有多种模式和提示设置的 9 个 MLLM 中,我们发现当前模型仅与人类专家表现出适度的一致性,多模式输入的收益不一致,并且基于推理的提示的收益有限。为了缩小这一差距,我们提出了 MIS-RAFT,这是一种受 RAFT 启发的回归感知微调方法,专为以一位小数精度进行细粒度的人际技能评分而定制。 MIS-RAFT 解决了自回归标记预测与标量值专家评估之间的不匹配问题,显着提高了与人类评分的一致性。总体而言,MIS-Bench 揭示了一般多模式能力与专家级人际判断之间的明显差距,而 MIS-RAFT 则为更可靠的基于模型的评估提供了一条有前途的道路。