论文

提示模型交互达到固定点:确定性、无任务结构读出——以及失败的分解

Prompt-Model Interaction Reaches the Fixed Points: A deterministic, task-free structural readout -- and the factorizations of it that failed

模型评测模型行为与机制分析

摘要

提示的效果不是提示的属性:针对一种模型优化的提示在另一种模型上会降级,并且在中性重新格式化下排名重新排序。该证据是关于任务准确性的,它不能说明交互是关于任务机制的事实还是关于条件分布本身的事实。我们询问其中没有任务的读数:短窗 argmax 映射 x_{t+1} = argmax_x p(x | x_{t-1}, x_t) 的定点结构,从 96 开始进行统计。它是确定性的,所以没有任何帮助或伤害,并且它只存在于短窗口中——六个模型中有四个在窗口 16 时完全失去了它——所以这里的一切都与模型如何读取片段有关。两个结果。首先,交互达到这个完整的读数:九个调节标记将定点分数移动到其大部分范围,更改四向结构类别,并对模型重新排序,而价值 60.5 IFEval 点的指令调整将类别移动为零。其次,我们提出的任何建议都没有实现这一点。前缀长度失败:效果不单调。四个现象学因素——散文与标记、普遍方向、双向性、指令阻力——每一个都在被提出后的一轮内被撤回,并通过扩大样本而溶解。最接近的机械解释,早期标记的注意力集中优势,预测了 5 个模型中的 2 个模型的转变迹象——机会——而长度与内容的交叉显示它坚持真实文本,并且在我们的探针的统一随机输入上失败,所以我们在它的政权之外,而不是反对它。一个固定的九词元前缀驱动四个模型趋向0,两个模型趋向1;双向性在分布开始时仍然存在。在此读数中,解释单位是提示模型对。它在我们身上发现的反复出现的错误有一个名字:一个标准,其形状应用于没有变化的空间的数量。