论文
一个提示是不够的:指令敏感性破坏嵌入模型评估
One prompt is not enough: Instruction Sensitivity Undermines Embedding Model Evaluation
摘要
指令嵌入模型在最先进的模型中已经很常见,但是每个任务使用单个提示进行评估。单点评估忽略了基于指令的方法的一个主要问题,即:对指令措辞的敏感性。我们对 6 个嵌入模型和 11 个数据集的即时敏感性进行了实证研究。我们表明,报告的分数歪曲了分数相对于合理提示的分布。默认提示可能会系统地低估或夸大性能。此外,我们表明排行榜排名对于提示选择并不稳健:开发人员通过有利地选择提示来提高其排名,并且在对抗性提示选择下任何模型都可以晋升到第一名。我们的研究结果表明,单提示评估对于指令调整的嵌入模型来说是不够的,基准应该包含提示稳健性,要么通过评估多个提示,要么通过报告敏感性和点估计。