论文
论大语言模型评测中提示排序的稳定性
On the Stability of Prompt Ranking in Large Language Model Evaluation
摘要
基于提示的交互已成为使用 大语言模型 (LLM) 的主要范例,其中评估多个候选提示,并选择排名靠前的提示供下游使用。该工作流程隐含地假设提示排名在评估条件的微小变化下是稳定的。在本文中,我们系统地研究了常见变异源(包括随机种子和有限的评估子集)下的提示排名稳定性。在三个开放权重 LLM 和两个基准任务中,我们发现虽然总体排名相关性通常为中等到高,但表现最好的提示的身份经常发生变化,从而导致不可靠的选择决策。为了解决这个问题,我们提出了一种基于置信下限的简单的稳定性感知选择策略,该策略同时考虑了性能和方差。我们的结果表明,这种方法提高了不稳定环境中的鲁棒性,同时在更稳定的情况下保持竞争力。这些发现强调了在即时选择和 LLM 基准测试中考虑评估不确定性的重要性。