论文
EpiCurveBench:评估流行曲线数字化上的 VLM
EpiCurveBench: Evaluating VLMs on Epidemic Curve Digitization
摘要
使用视觉语言模型 (VLM) 的图表到数据提取越来越多地在显示不断减少的余量的基准上进行评估(ChartQA 上的前沿 VLM 超过 89%),并使用将提取的点视为无序键值对的指标,忽略时间序列的时间结构,并将小的对齐变化视为灾难性故障。我们通过 EpiCurveBench 和 EpiCurveSimilarity (ECS) 来解决这两个差距。 EpiCurveBench 是从不同公共卫生来源策划的 1,000 个真实世界流行病曲线图像的基准,而 EpiCurveSimilarity (ECS) 是一种评估指标,通过动态编程将预测和 真值 系列对齐,容忍局部时间变化和间隙,同时按比例对其进行惩罚。通过评估六种方法(三种前沿封闭式 VLM、一种开放式 VLM 和两种专门的图表提取系统),我们发现最强的模型仅达到 52.3% ECS,并且 ECS 将四种通用 VLM 分布在 25 点范围内,其中键值指标(RMS、SCRM)将它们压缩为 5 点带。我们进一步根据四个下游流行病学汇总统计数据验证 ECS,发现较高的 ECS 预测总计数、峰值时间和峰值幅度的误差较小,并且增长率保真度较高;在这四种预测中,ECS 的相关性比动态时间规整强 1.5--3.6 倍,动态时间规整缺乏间隙惩罚,因此无法区分截断的预测和时间上忠实的预测。 EpiCurveBench 的目标是一个具有高影响力的公共卫生应用程序——解锁已发布数据中数十年的疫情数据——但基准和指标直接适用于任何结构化时间序列图表提取设置。