论文

MedMosaic:多样化医疗音频的具有挑战性的大规模基准

MedMosaic: A Challenging Large Scale Benchmark of Diverse Medical Audio

模型评测基准与评测资源

摘要

由于隐私法规和领域专业知识产生的高注释成本,医疗音频数据很难收集。因此,现有的基准往往不足以代表复杂的医疗音频场景。为了应对这一挑战,我们推出了 MedMosaic,这是一个医学音频问答数据集,旨在在现实临床约束下对语言和音频推理模型进行基准测试。 MedMosaic 具有多种医疗音频类型,包括与病情相关的生理声音、精心构建的合成声音来模仿带有伪影的语音,以及真实的短和长临床对话来模拟不同的上下文长度。该数据集还包含总共 46,701 个问答对,涵盖多项选择、顺序多轮和开放式问答等类别,可以系统地评估多跳推理和答案生成能力。对 13 个音频和多模态推理模型进行基准测试表明,对于所有评估的系统来说,推理仍然具有挑战性,不同问题类型的性能差异很大。特别是,即使像 Gemini-2.5-pro 这样最先进的模型也只能达到约 68.1% 的准确率。这些发现强调了医学推理中持续存在的局限性,并强调需要更强大、针对特定领域的多模态推理模型。此处提供了基准数据示例:https://shorturl.at/Lyp33