论文

通过答案合理性评分评估 大语言模型 的问题难度

Question Difficulty Estimation for Large Language Models via Answer Plausibility Scoring

模型评测评测方法与指标

摘要

估计问题难度是评估和改进问答 (QA) 的 大语言模型 (LLM) 的关键组成部分。现有的方法通常依赖于可读性公式、基于检索的信号或流行度统计,这可能无法完全捕捉现代 LLM 所面临的推理挑战。在本文中,我们介绍了 Q-DAPS(基于答案合理性分数的问题难度)方法,这是一种通过计算候选答案合理性分数的熵来估计问题难度的新颖方法。我们在四个著名的 QA 数据集(TriviaQA、NQ、MuSiQue 和 QASC)上系统地评估了 Q-DAPS,证明它始终优于基线。此外,Q-DAPS 在超参数变化和问题类型方面表现出很强的鲁棒性。广泛的消融研究进一步表明,Q-DAPS 在不同的合理性估计范式、模型大小和现实设置中仍然保持稳健。人类评估进一步证实了 Q-DAPS 的难度估计和人类对问题难度的判断之间的紧密一致性。总体而言,Q-DAPS 提供了一种可解释、可扩展且抗偏差的方法来估计现代 QA 系统中的问题难度。