论文
Symphony for Speech-to-Text:支持实时医疗语音接口
Symphony for Speech-to-Text: Supporting Real-Time Medical Voice Interfaces
摘要
经过几十年的听写和最近的环境文档使用,语音正在成为医疗保健领域与技术和人工智能交互的主要方式。然而,医学语音识别仍然很困难:系统必须捕获专业术语,解决上下文歧义,并准确地呈现测量值、缩写和临床速记。现有的解决方案通常针对通用转录或狭窄的听写工作流程进行优化,限制了它们在安全关键环境中的可靠性以及它们在更广泛的临床工作流程中的有用性。我们推出 Symphony for Speech-to-Text,这是一种医疗级语音识别系统,适用于实时流和基于批处理文件的临床使用。 Symphony 将转录过程分解为专门的组件,用于识别、格式化和上下文校正,以优化医学术语回忆,同时实时生成临床结构化文本并适应跨用例。对公共基准和医学语音数据集的评估表明,Symphony 在临床环境中大大优于最先进的系统,同时在一般领域设置中匹配或超过它们,这表明具有强大的泛化能力而不是过度拟合。我们发布了临床基准数据集,以支持医学语音识别的可靠验证和进一步进展。 Symphony 可通过生产级 API 进行实时听写、对话转录和批量音频文件处理。