论文
LLM能否将粘贴的产物与用户话语分开?未标记提示边界处的误吸收
Can LLMs Separate Pasted Artifacts from User Speech? Absorption at Unmarked Prompt Seams
摘要
大语言模型 (LLM) 以纯文本形式接收每条用户消息,即使它组合了来自不同来源的文本。例如,用户可以将文本粘贴到提示中,并继续在其正下方键入评论。我们研究吸收:一种现象,模型将尾随的用户评论视为粘贴文本的一部分,并将其返回到编辑的文本中。即使用户不希望评论成为该文本的一部分,也会发生这种情况。现有的指令数据分离基准告诉模型哪些文本是指令,哪些文本是数据,然后测试它是否遵循这种分离。他们不会在未标记的粘贴后测试无害的用户话语。我们引入 SEAM,这是一个包含 300 个编辑示例的受控基准。每个示例都在六个匹配条件下进行测试,这些条件改变了粘贴文本和后来用户话语之间的边界的表达方式。在 20 个模型中,裸换行的吸收率在 7.7% 到 66.7% 之间。在任何模型中添加空行都不会显着减少吸收,而边界标记会在 20 个模型中的 19 个模型中减少吸收。适合粘贴文本的注释(例如在代码后键入的代码注释)在 20 个模型中的 17 个模型中被吸收的频率明显更高。模型通常无法将粘贴的材料与后来的用户话语分开,并且明确的边界可以减少但不能消除这种失败。