论文
RxScribe Bench:用于评估印度门诊处方视觉语言模型的多轴基准
RxScribe Bench: A Multi-Axis Benchmark for Evaluating Vision-Language Models on Indian Outpatient Prescriptions
摘要
处方转录错误不可互换。制造药物的模型和误读清晰剂量的模型会带来截然不同的临床风险,但处方转录准确性通常被报告为单个混合数字,将两者视为等效。我们推出了 RxScribe Bench,这是一个用于评估手写处方数字化视觉语言模型的基准,它将性能分解为与临床严重程度相关的四个轴,而不是将所有内容都折叠到一个聚合分数中。仅给定处方图像和输出模式,模型就会生成结构化记录,然后将其与人类创作的相同形状的基本事实逐个字段进行比较,每个字段还标记可见性和易读性。四个轴隔离不同的故障模式,即正确性、幻觉、参与度和稳健性。当支持样本低于最低证据阈值时,稳健性轴会保留其硬场结果,而不是报告结果。我们根据每个图像的独立冷运行的真实处方来评估前沿视觉语言模型,发现没有一个模型能够在所有四个轴上获胜。