论文
CLIR-Bench:对不规则临床时间序列的多模式问答进行基准测试
CLIR-Bench: Benchmarking Multimodal Question Answering over Irregular Clinical Time Series
摘要
临床时间序列对于患者监测、风险评估和临床决策支持至关重要。然而,它们通常是稀疏的、不规则采样且异步的,使得模型难以识别临床问答(QA)所需的时间证据。现有的基准主要关注静态数据上的定期采样的时间序列 QA 或医学 QA,因此很少评估模型是否能够在不规则的时间观察中忠实地得出答案。为了填补这一空白,我们引入了 CLIR-Bench,这是一个不规则临床时间序列 QA 的基准,由去识别化的 ICU 记录通过原则性的四阶段管道构建而成。 CLIR-Bench 包含 6,600 个 QA 实例,涵盖 11 个临床变量,分为四个功能维度和 11 个任务。每个问题都与明确的时间证据和特定于任务的答案推导规则相关联,从而能够评估答案的准确性和证据的使用。实验表明,现有的通才模型很难检索和推理稀疏的临床证据,这凸显了对更强的不规则时间序列推理方法的需求。我们的代码和数据可在 https://huggingface.co/datasets/winall/CLIR-Bench 获取。