论文
DiaWhisper-DPO:通过故障挖掘偏好优化进行临床访谈的角色归因转录
DiaWhisper-DPO: Role-Attributed Transcription of Clinical Interviews via Failure-Mined Preference Optimization
摘要
通过临床访谈进行自动抑郁症筛查需要将话语归因于临床医生或患者。我们评估两个数据集:DAIC-WOZ,其中仅限参与者的录音需要重新合成双方以进行受控的双方评估;PDCH-HAMD,包括用于跨语言验证的语音转换的真实中文访谈。级联系统将说话者分类与角色分配启发法相结合,因此错误可以跨阶段传播。我们提出了一个端到端模型,我们将其命名为 DiaWhisper,该模型使用 LoRA 和用于转录和归因的辅助帧级角色头对 Whisper-large-v3 进行微调,并与 DiaWhisper-DPO 一起进行微调,DiaWhisper-DPO 是一种失败挖掘的改进,它使用真正的解码失败,因为 DPO 在没有人类偏好注释的情况下拒绝了完成。在 29 个 DAIC-WOZ 测试会话中,DiaWhisper-DPO 实现了 0.973 的角色准确度和 0.119 DER,比最强级联基线低 72%,并将种子变异从 σ = .205 降低到 0.002。在 PDCH-HAMD 上重新训练后,它达到了 0.757 的角色准确度,并改进了所有 78 个会话种子对。