论文
从声音到症状:对话式医疗人员的实时呼吸信号理解
From Sound to Symptom: Real-Time Respiratory Signal Understanding for Conversational Healthcare Agents
摘要
现场口语对话期间的咳嗽事件携带有临床价值的呼吸信号,但现有的对话系统将其视为需要丢弃的声学噪声。我们提出了 HealthCUES(体现声音的临床理解),这是一种用于实时对话代理中的副语言呼吸监测的流式管道,据我们所知,所有现有系统都没有这种功能。 HealthCUES 通过与对话轮次边界对齐的滚动缓冲区处理音频,从而在不中断对话流的情况下实现亚秒级事件检测。除了二元咳嗽检测之外,该系统还提供细粒度分析:(i) 咳嗽和清喉咙之间的区分,(ii) 咳嗽亚型分类(干咳、湿咳、吠叫、百日咳)和置信度评分,以及 (iii) 持续时间估计和开始结束边界。为了防止警报疲劳,HealthCUES 引入了对话感知门控机制,可根据对话上下文调节触发。该系统利用 Qwen3Omni,一种多模式 大语言模型 (MLLM),具有受限的结构化输出,将咳嗽分析分解为并行预测任务,以实现独立提示优化。对 847 个内部对话音频片段的评估表明,咳嗽检测的 F1 为 93%,湿/干亚型分类的加权 F1 为 0.75,平均端到端延迟为 340 毫秒; AMI 会议语料库的外部验证证实了在存在语音的情况下的强烈咳嗽、清喉咙和语音分离(0.91 宏 F1)。与有执照的医疗保健专业人员进行的用户研究证实了亚型信息的临床相关性以及系统在远程医疗工作流程中的实用性。