论文

审核多模式 LLM 评分者:临床序数评分中的集中趋势偏差

Auditing Multimodal LLM Raters: Central Tendency Bias in Clinical Ordinal Scoring

模型评测鲁棒性、公平性与可信度评测

摘要

多模态 大语言模型 (LLM) 作为临床环境中的自动评估器越来越多地被探索,但它们在普通临床量表上的评分行为仍然知之甚少。我们对三个前沿 LLM 系列与监督深度学习模型进行基准测试,以使用 Shulman 评分标准对两个公共数据集上的时钟绘图测试 (CDT) 图像进行评分。虽然完全微调的 Vision Transformer 实现了最佳校准(MAE 0.52,1 以内精度 91%),但零样本 LLM 在基于公差的协议(GPT-5 MAE 0.67,1 以内精度 92%)方面仍然具有竞争力,尽管绝对误差较高。然而,按分数分析表明,所有三个 LLM 系列都表现出明显的集中趋势效应(系统端点压缩):预测被系统地压缩到量表的中间,在低端(得分 0 到 1)过度预测,在高端(得分 5 到 4)预测不足。这种效应不成比例地影响临床关键极端情况,其中准确评分对认知障碍的筛查决策影响最大。有针对性的消融表明,无论是跨越整个分数范围的几次样本,还是从提示中删除临床术语,都不会消除这种影响。我们的研究结果将 LLM 作为法官的偏见文献从 NLP 评估扩展到临床评估,并强调在高风险筛选工作流程中部署基于 LLM 的评估者之前需要进行校准感知评估和事后校准。