论文
是什么让事情变得困难(呃)?用自然语言解释问题难度
What Makes Something Hard(er)? Explaining Question Difficulty in Natural Language
摘要
难度是问题最基本的属性之一:它决定问题是否能够有意义地区分不同能力的模型。尽管现在有多种方法可以自动估计或预测难度,但它们只能产生一个描述性数字,而没有考虑到最初使问题变得困难的潜在因素。在这项工作中,我们提出了一种数据驱动的方法,可以自动生成并验证自然语言假设,解释是什么使一个问题比另一个问题更难。我们首先使用项目响应理论从大量大语言模型的回答中估计每个项目的难度。然后,我们对简单问题和困难问题进行对比,并提示大语言模型提出差异的候选解释,随后根据保留的问题进行验证和选择。跨越数学、逻辑和常识推理的三个数据集的实验结果表明,我们的方法产生了可解释和预测的假设。就其本身而言,它们可以与高级黑盒难度回归器竞争或更好地预测未见过的问题的难度;作为附加功能,它们进一步改进了这些回归量,这意味着它们发现了现有模型无法捕获的困难信号。此外,我们证明根据假设编辑问题可以将其测量的难度转向预期的方向,这表明发现的假设是因果有效的难度因素,而不是事后描述。因此,我们的方法将纯粹的描述性难度分数转变为可操作的陈述。