论文
镜子,墙上的镜子:小指令语言模型中的提示回声
Mirror, Mirror on the Wall: Prompt Echoing in Small Instruct Language Models
摘要
提示回显是指令语言模型的一种公认的故障模式,其中模型不会生成响应,而是镜像所提供的提示,即使它没有收到这样做的特定指令。这种现象是模型泄漏其训练数据集内容的标志,还是由内部归纳/复制机制的失调行为引起的?我们研究了来自不同家族(Gemma、Llama、Qwen、SmolLM 和 OLMo)的提示回显小语言模型,并表明回显提示可能与训练数据集部分重叠,但这种现象主要是由模型的归纳头驱动的。