论文

虚假提示:不相关的提示可以引导 大语言模型 吗?

Spurious Prompts: Can Irrelevant Prompts Steer Large Language Models?

模型评测模型行为与机制分析

摘要

大语言模型 对提示高度敏感,但这种敏感性通常是通过与任务相关的指令、演示或推理提示来研究的。在本文中,我们研究了一种不同形式的提示敏感性:与任务语义无关的提示是否仍然可以引导模型行为。我们称它们为虚假提示,并显示出它们令人惊讶的功效。我们还提出了一个简单的黑盒搜索程序来发现它们。在推理和问答基准测试中,使用从 0.8B 到 27B 参数范围的模型并跨越三个模型系列,我们表明虚假提示可以提高性能,通常匹配或优于标准提示基线和任务感知提示优化。我们进一步表明,它们可以引导模型做出意想不到的行为,例如重复选择第一个答案选项、产生不正确的答案、返回偶数、素数或小数,而无需明确指示模型这样做。这些发现揭示了一种新的提示敏感性:LLM 可以通过与他们要解决的任务无关的提示来系统地引导。我们的代码可在 https://github.com/Batorskq/spurious 获取