ReasonLab:多项选择 QA 提示技术的受控且可审核的评估
ReasonLab: A Controlled and Auditable Evaluation of Prompting Techniques for Multiple-Choice QA
摘要
探索 大语言模型 (LLM) 的功能并为多项选择题回答 (MCQA) 构建强大的解决方案仍然是自然语言理解的核心挑战。此外,LLM 的快速扩散已经产生了一个隐含的假设:更复杂的提示技术会产生更好的性能。一些研究声称有这样的收益,但在不同的模型、提示措辞和答案提取规则下报告它们,因此这些收益不能仅仅归因于该技术。我们通过 ReasonLab 解决了这一差距,这是一个评估框架,其中提示技术与模型和数据集一起是一流的实验变量,并且保留每一代进行检查。使用 ReasonLab,我们对 10 个 MCQA 数据集、27 种模型配置和 0 温度下的 480,927 次评估中的 8 种提示技术进行了对照研究。我们发现提示技术是准确性的次要决定因素:在没有推理预算的配置上,推理触发器仅比直接提示提高了 3.92 到 4.69 pp,并且彼此之间无法区分,而在启用推理的配置上,没有任何技术存在差异超过 0.51 个百分点。自生成是唯一具有一致效果的技术,减少了 2.95 个百分点。我们进一步研究了三种现象:(1) 在一组通用数据集上比较模型,其中模型大小不能预测准确性,(2) 思维预算之间的权衡,其中支持推理的价值高达 12.74 个百分点,而八倍的预算增加仅增加 0.48 到 2.10 个百分点,以及 (3)数据集难度的变化,60% 的基准测试准确度低于 70%,从最简单到最难的差距为 43.9 个百分点。这些结果表明,对于 MCQA 来说,与启用模型推理相比,提示技术是一个次要的杠杆,并且仍然存在很大的空间。