论文

使用 Human-LLM 分歧来改进基于检查表的质量评估

Using Human-LLM Disagreement to Improve Checklist-Based Quality Appraisal

模型评测模型能力评测

摘要

系统评价依赖于纳入研究的质量评估,这一过程非常耗时,而且对清单标准的模糊性很敏感。尽管 大语言模型 (LLM) 提供了支持这些任务的机会,但评估清单通常被视为固定输入,并且尚不清楚其设计如何影响与专家判断的一致性。因此,我们研究(1)LLM 是否可以在基于检查表的评估中近似人类的判断,以及(2)人类与 LLM 不一致的模式是否可以用于识别和改进不明确的检查表项目。使用潜在轨迹研究报告指南 (GRoLTS) 检查表,我们将 LLM 生成的评估与三个研究主题和两个检查表版本的专家注释进行比较。使用项目级准确性、机会校正一致性和研究级排序的保留来评估一致性。我们发现,检查清单项目之间的绩效差异很大,模糊的条件性标准会产生最大的分歧。修改这些项目可以提高原始一致性和机会校正一致性。尽管项目级别的错误分类仍然存在,但当保留高一致性项目时,LLM 生成的分数通常会保留研究的相对排名。这些结果表明,可靠的 LLM 辅助评估不仅取决于模型选择,还取决于检查表设计。研究结果表明,分析人类-LLM 分歧可以帮助识别有问题的清单项目并支持研究综合工作流程的迭代改进。