论文
可能性排名不像大语言模型中的提示那样可扩展
Likelihood Ranking doesn't Scale Like Prompting in LLMs
摘要
LLM 评估通常通过提示模型产生答案或使用基于可能性的指标对候选输出进行评分来进行。然而,在多项选择 QA 中,标准的基于可能性的评分仍然以问题和答案集为条件,因此可以利用提示中使用的相同任务条件答案选择界面。我们研究了一种基于从相同的问题-答案对构建的声明性陈述的可能性排名的补充协议。在 95 个仅解码器模型(参数范围从 0.1B 到 104B)和 10 个 MCQA 数据集中,我们发现陈述性陈述似然排序和提示回答之间存在系统性差异。陈述似然准确性在整个规模上保持相对稳定,而提示回答则随着规模和指令调整而急剧提高。这些结果表明,对受控陈述性替代方案和任务条件答案选择的可能性偏好探讨了模型行为的不同方面,并且不应被视为可以互换。