论文

临床行为编码评测:比较LLM的转录与音频输入

Towards Automated Clinical Behavioral Coding with Large Language Models: A Case study Using BOSCC recordings of Children

模型评测应用与实践模型能力评测行业应用

摘要

自闭症谱系障碍(ASD)是一种神经发育状况,表现为社会沟通差异、受限兴趣和重复行为。治疗干预常针对社会沟通能力,因此需要可靠的行为变化测量。社会沟通变化简短观察(BOSCC)是一项经过验证的治疗反应测量,基于儿童与受训评估者之间短暂的游戏和社会沟通互动。BOSCC编码耗费人力且需要专业人员,因此自动编码有望改善规模化和可获得性。本文评估通用大语言模型(LLM)从不同输入表示预测与语音有关的BOSCC编码的能力。在163段内部录制材料上,我们比较普通转录、区分说话人的转录和定向音频输入。LLM能较好地评估言语交流,但对非典型语音模式的识别较差。不同评分决策的表现差异很大,各诊断群体之间也没有一致规律。预测审计表明,应用BOSCC编码规则及解释含糊的语音证据仍是挑战。