论文

了解提示灵敏度

Understanding the Prompt Sensitivity

模型评测模型行为与机制分析

摘要

提示灵敏度是指 大语言模型 (LLM) 的输出对其输入提示的确切措辞的依赖程度,引起了用户对 LLM 稳定性和可靠性的担忧。在这项工作中,我们将 LLM 视为多元函数并执行一阶泰勒展开,从而分析意义保留提示、其梯度和模型下一个标记的对数概率之间的关系。我们使用柯西-施瓦茨不等式得出对数概率之差的上限。我们表明,LLM 不会像较小的神经网络那样在内部聚集相似的输入,而是分散它们。这种分散行为导致两个意义保留提示之间的对数概率差异上限过高,很难有效地降低到0。在我们的分析中,我们还展示了哪些类型的意义保留提示变体更有可能在LLM中引入提示敏感性风险。此外,我们证明上限与现有的提示敏感度指标 PromptSensiScore 密切相关。此外,通过分析 logits 方差,我们发现提示模板通常对 logits 的影响比问题本身更大。总体而言,我们的结果为为什么当前的 LLM 对相同含义的提示高度敏感提供了一般解释,为理解 LLM 的提示敏感性提供了重要证据。实验代码可在 https://github.com/ku-nlp/Understanding_the_Prompt_Sensitivity 获取。