论文
鸽居:糟糕的提示如何损害模型,导致崩溃和错误
Pigeonholing: how bad prompts hurt models, causing collapse and mistakes
摘要
虽然上下文学习在 大语言模型 (LLM) 中通常被证明是有效的,但糟糕的上下文可能会导致性能下降和模式崩溃,这种现象我们称为“鸽子效应”。 **无意的不良**上下文可能会在没有恶意越狱意图的情况下发生:例如,用户要求模型证明不正确的数学定理或未能纠正模型的错误代码。具体来说,我们在两种情况下研究“鸽子效应”:(1) 当用户提出解决方案时,(2) 当对话上下文包括助手之前的(错误)响应时。我们对 10 个可验证的开放式任务和 10 个不同模型进行的实验表明,鸽子效应表现在多种方面:(1) 重复上下文中的错误答案(导致 38-40% 的性能下降),(2) 在编码和文本生成中集中于一组狭窄的答案(3) 在有争议的话题上翻转立场以与用户或助手之前的主张保持一致。我们发现,随着对话轮数的增加,对标几乎单调恶化(随着重复错误从 1 增加到 5,性能会额外下降 14% 以上),并且即使提供的示例正确,也可能会发生对标引起的模式崩溃,作为缓解这一问题的一步,我们提出了具有合成错误的 RLVR,与糟糕的环境相比,它可以将模型提高 43-60%。普通 RLVR 基线。