大规模提示设计:格式、指令计数和上下文长度如何影响 大语言模型 中的指令依从性和幻觉
Prompt Design at Scale: How Format, Instruction Count, and Context Length Shape Instruction Adherence and Hallucination in Large Language Models
摘要
从业者在几乎没有受控证据的情况下做出三个提示设计决策:如何格式化指令和上下文(markdown、纯文本、散文或表格)、系统提示在合规性下降之前可以携带多少同步指令,以及模型在回忆和诚实性下降之前可以容纳多少上下文。我们报告了两项对照实验,在一个无污染的合成语料库(“Veyra 之书”,8,780 个独特命名的实体,可从固定种子中确定性地再生)上跨越所有三个因素,并在五个模型中进行评估。实验 1(960 次调用/模型)测量随着规则计数 N 从 10 增长到 160 的指令跟随衰减,并与四种格式以及系统提示与用户轮流放置进行交叉。对于每种模型、格式和布局,完美响应率都会因 N=80 而降至零。在大多数模型中,放置产生的效果至少与 N=160 时的格式一样大,但方向是特定于模型的。没有模型显示出可靠的降价优势;一种 35B 型号更喜欢纯文本。实验 2(5,520 个调用/模型)以相同的四种格式测量 2k 到 512k 词元上下文阶梯的召回准确性、错误前提阿谀奉承和缺席事实捏造。召回率在 64-128k 个词元的范围内保持在上限附近,然后急剧下降并且与格式相关:一个模型的准确度分布在 128k 个词元时达到 48 点。捏造行为永远不会发生(0/5,760 次探测),并且阿谀奉承的情况可以忽略不计(<=8.3%)。在每个模型的背景上限附近急剧上升的是完全拒绝回答(0% 到 79-90%),这与阿谀奉承或捏造不同。预先注册的格式排序均不成立,并且词元开销(比纯文本+22%至+37%)进一步改变了在准确度分布真实的情况下哪种格式更可取。我们发布了完整的工具、语料库生成器和原始结果 (VeyraBench):https://github.com/iNetanel/veyrabench