LLM 作为法官的解释性回应评级的可信度如何?对定性研究工作流程的影响
How Trustworthy Are LLM-as-Judge Ratings for Interpretive Responses? Implications for Qualitative Research Workflows
摘要
随着定性研究人员对使用自动化工具支持解释性分析越来越感兴趣,大语言模型 (LLM) 通常被按原样引入分析工作流程,而没有对解释质量进行系统评估或跨模型进行比较。尽管这种做法对解释结果有潜在影响,但模型选择在很大程度上未经审查。为了解决这一差距,本研究检验了 LLM 作为法官的评估是否与人类对解释质量的判断有意义地一致,并可以为模型级决策提供信息。我们使用 K-12 数学教师半结构化访谈中的 712 个对话摘录,使用五种广泛采用的推理模型生成一句话解释性响应:Command R+ (Cohere)、Gemini 2.5 Pro (Google)、GPT-5.1 (OpenAI)、Llama 4 Scout-17B Instruct (Meta) 和 Qwen 3-32B Dense (Alibaba)。使用 AWS Bedrock 的 LLM-as-judge 框架跨五个指标进行自动评估,并且由训练有素的人类评估员对解释准确性、细微差别保留和解释连贯性独立评估分层的响应子集。结果表明,LLM 作为评委的分数捕捉了模型级别人类评估的广泛方向趋势,但分数大小存在很大差异。在自动化指标中,一致性与人类综合评分表现出最强的一致性,而 忠实性 和正确性则揭示了摘录级别的系统性偏差,特别是对于非字面意义和细微差别的解释。与安全相关的指标在很大程度上与解释质量无关。这些研究结果表明,LLM 作为判断方法更适合筛选或消除表现不佳的模型,而不是取代人类判断,为定性研究工作流程中系统比较和选择 LLM 提供实用指导。