论文
DementiaCare-Bench:经过模态验证的视频基准
DementiaCare-Bench: A Modality-Validated Video Benchmark
摘要
据估计,全球有 5700 万人患有痴呆症,对于大多数家庭来说,护理中最困难的部分不是记忆丧失,而是痴呆症的行为和心理症状 (BPSD):烦躁、徘徊、抗拒护理、日落。了解这些症状需要的不仅仅是认识行为本身;还需要了解这些症状。它还需要知道事先发生了什么。相同的行为可能需要不同的响应,具体取决于其触发因素。视频语言模型 (VLM) 可能会为护理人员提供支持,但现有的基准还没有评估这种功能。为了填补这一空白,我们推出了 DementiaCare-Bench:56 个专业制作的护理人员训练视频,分为 9 个 BPSD 类别的 94 个剪辑,其中包含由多智能体管道生成的 2023 个问题,该管道将每项临床声明都记录在逐字记录中。然后,每个问题都会在四种视觉条件下进行探讨,并按其所需的最少内容进行标记,因此其视觉需求是经过测量的,而不是假设的。测量与意图相矛盾:我们编写的 77.7% 的问题需要有序框架,而 34.8% 确实如此。当前 12 个 VLM 中的模式是一致的。总体上最好的达到 85%,但这个平均值是由语言模型仅通过临床知识就能回答的问题来实现的;在需要有序剪辑的问题上,准确度平均下降 17 分,而领先的开放模型在判断看护者的反应是否恰当时会随机得分。轻量级 LoRA 微调 DemCare-VLM 将视频依赖性从 -3.3 点移动到 +4.5 点,因此基准测试暴露的内容可以修复,而不仅仅是测量。