论文

从长时医患对话直接生成SOAP临床记录的端到端研究

Bridging the Modality Gap in Long-Form Clinical Audio: A Comparative Study of Lightweight and Heavyweight End-to-End SOAP Generation

模型训练监督微调与指令调优

摘要

对于现代音频语言模型来说,从长篇医患对话中自动化临床记录仍然是一个挑战。虽然级联 ASR 系统表现良好,但端到端 (E2E) 模型经常面临信息丢失和扩展音频幻觉的问题。对于 BeTraC 2026 挑战,ASLP 团队提出了一个完整的 E2E 多模式系统,该系统直接从音频生成结构化 SOAP 注释,绕过中间记录。我们构建了 141 万样本的多任务语料库,并应用了多阶段流程:领域预训练、监督微调和奖励优化。在轻量级 (3B) 和重量级 (30B) 约束下评估架构表明,每个训练阶段都会逐步提高性能。此外,扩展到 30B 参数可显着提高概念提取和摘要质量。最终,我们的 E2E 系统始终优于代表性级联 ASR+LLM 基线,证明了直接多模式优化临床记录的有效性。