论文

使用音频语言模型进行临床精神病学语音录音中角色引导的说话人删除验证

Role-guided Speaker Deletion Verification in Clinical Psychiatry Speech Recordings with Audio Language Models

模型评测评测方法与指标

摘要

精神病学的临床研究越来越依赖于大规模收集口语数据来识别声音和语言生物标志物。然而,不断变化的同意和协议要求可能会迫使调查人员从多发言者录音中删除指定的发言者,并以手动审查整个语料库无法实现的规模来验证上述删除。我们研究了精神病学中角色驱动的二元临床对话的验证问题,并通过两个平行、对称的流程进行研究:确认临床医生的语音已从精神病学访谈录音中删除,并确认患者的语音已从相同的录音中删除。每个管道都会针对其目标角色编辑原始音频,然后使用音频语言和大语言模型扫描幸存的输出,以识别丢失的删除。我们在从精神病学环境中提取的 48 个二元录音的语料库上评估了这种方法,并在仅推理环境中测试了四个开放权重模型:Gemma-4-12B、Gemma-4-31B、Nemotron-3-Nano 和 Nemotron-3-Nano-Omni。超过 14 种模型视图配置的析取 OR 集成的组合 F1 为 0.478(精度 0.330,召回率 0.870),比召回增益驱动的单个模型估计有所改进,这表明模型和上下文视图之间存在实质性互补性。