论文
非特定:用于打破 LLM 指令中的复制粘贴快捷方式的通用约束综合
UNSPECIFIC: General Constraint Synthesis for Breaking Copy-and-Paste Shortcut in LLM Instruction Following
摘要
人们越来越期望 大语言模型 (LLM) 能够遵循复杂指令中的一长串约束,并且从参考文档合成指令(即反向翻译)是一种广泛使用的方法来衡量/增强 LLM 遵循复杂指令的能力。然而,这种方法引入了一个严重的漏洞:约束综合模型从参考中复制文本作为非常具体的约束,并且评估的 LLM 通过在响应中复制其文本来简单地满足约束。为了解决这些问题,我们提出了 UNSPECIFIC,一种新颖的框架,它综合了两篇类似参考文章所共有的约束,以减少复制粘贴,有选择地强化仅简单满足的约束以平衡难度和自然性,并评估生成的文章及其摘要的满意度以惩罚肤浅的指令遵循。因此,我们在新闻、故事和博客领域构建了 UNSPECIFIC 基准来分析 LLM 的复制粘贴行为。我们的结果表明,从人类的角度来看,我们合成的约束不仅更具挑战性(例如,GPT-5 Mini 的满意度从 90% 下降到 78%)而且更自然(LLM 获胜率差距提高了 30%),而且还减少了复制粘贴。我们还发现很大一部分约束在表面上得到了满足(即在文章的核心叙述中没有得到满足)。代码和数据集发布于 https://github.com/JeetDSharma/UNSPECIFIC。