论文
GazeVaLM:用于评估人工智能生成的 X 射线临床真实性的多观察者眼动追踪基准
GazeVaLM: A Multi-Observer Eye-Tracking Benchmark for Evaluating Clinical Realism in AI-Generated X-Rays
摘要
我们介绍 GazeVaLM,这是一个公共眼动追踪数据集,用于研究胸片真实性评估过程中的临床感知。该数据集包含 16 名放射专家专家的 960 个注视记录,在诊断评估和真假分类(视觉图灵测试)两种条件下解释 30 个真实的和 30 个合成的胸部 X 射线(由基于扩散的生成人工智能生成)。对于每个图像观察者对,我们提供原始凝视样本、注视图、扫描路径、显着性密度图、结构化诊断标签和真实性判断。我们将协议扩展到 6 个最先进的多模式 LLM,在匹配条件下发布它们的预测诊断、真实性标签和置信度分数 - 实现在决策和不确定性级别上进行直接的人类人工智能比较。我们进一步提供凝视一致性、观察者间一致性以及放射科医生与 LLM 在诊断准确性和真实性检测方面的基准分析。 GazeVaLM 支持注视建模、临床决策、人类与人工智能比较、生成图像真实性评估和不确定性量化方面的研究。通过联合发布视觉注意力数据、临床标签和模型预测,我们的目标是促进专家和人工智能系统如何感知、解释和评估医学图像的可重复研究。该数据集可从 https://huggingface.co/datasets/davidcwong/GazeVaLM 获取。