论文

MMTClinic:临床领域的多模式、多语言时间序列问答和推理基准

MMTClinic: Multimodal, Multilingual Time Series Question Answering and Reasoning Benchmark for Clinical Domain

模型评测基准与评测资源

摘要

临床环境中的时间序列数据对于捕获患者健康状况随时间的动态变化至关重要,从而能够及时诊断、个性化治疗和及早发现关键事件。然而,开发临床可靠且语言包容的医疗人工智能系统仍然是一个重大挑战,主要是由于缺乏反映现实世界临床场景复杂性的多模式、多语言和基于时间序列的基准。为了填补这一空白,我们推出了 MMTClinic,这是一个旨在评估 大语言模型 (LLM) 涉及临床时间序列的复杂推理和问答任务的基准。 MMTClinic 结合了文本、医学图像和多变量生理信号,包括 30,000 个问答对(15,000 个多项选择题 (MCQ) 和 15,000 个开放式问题),涵盖五种语言:英语、印地语、孟加拉语、马拉地语和泰米尔语。这些问题涵盖了三个重要的临床任务——死亡率预测、心率预测和 SOFA 评分估计。我们在零样本、少样本和思维链设置中评估了 13 个最先进的 LLM。我们的评估揭示了跨任务、语言和模式的模型性能的显着差异,凸显了当前临床推理能力的局限性。 MMTClinic 为推进多语言、多模式和时间序列感知的医疗人工智能研究提供了宝贵的资源。该数据集将在工作成功接受后公开发布。