论文
候选项增多时,LLM为何更难作出正确选择
Overwhelmed by Choice: Studying LLM Decision Making at Scale
摘要
多项选择和候选人选择评估广泛用于评估LLM推理和决策,但大多数基准包含相对较小的候选人集。目前尚不清楚从这些设置中得出的结论在候选空间尺度上是否仍然有效。随着竞争候选人数量的增加,我们系统地评估LLM,发现任务、提示策略和模型规模的准确性大幅下降。对照分析表明,标准的长上下文检索解释不能完全解释这种退化。相反,我们确定了两种系统性故障模式。首先,黄金利润崩溃:正确答案和最强干扰因素之间的分数差距逐渐缩小,这主要是由于对正确答案的信心减弱所致。其次,较早的候选人偏好变得越来越难以推翻,而较晚的候选人对最终预测的影响逐渐减弱。受这些发现的启发,我们评估了分层分区和基于排列的推理,在 $N=160$ 的情况下,HotpotQA 和 MIMIC 的准确性提高了大约 20 个百分点。总的来说,我们的结果将候选集规模确定为一个重要的评估协议变量,并表明强大的小选项性能并不一定意味着强大的大规模候选比较。