论文
在哪里进行查询?通过解码动力学揭示和减轻扩散 LLM 上下文学习中的位置偏差
Where to Place the Query? Unveiling and Mitigating Positional Bias in In-Context Learning for Diffusion LLMs via Decoding Dynamics
摘要
虽然上下文学习 (ICL) 在自回归 (AR) LLM 中得到了广泛研究,但其在扩散 大语言模型 (dLLM) 中的机制仍然很大程度上未被探索。与受单向因果屏蔽限制的 AR 模型不同,dLLM 本质上利用双向注意力,为查询放置提供广泛的空间灵活性。不幸的是,当前的实践通常继承 AR 风格的尾随查询模板,常常忽视结构范式的转变。本文进行了全面的分析,揭示了查询位置实际上是 dLLM 中的一阶变量。通过经验解耦,我们证明位置方差对生成质量的影响与示例语义质量相当。在内部,这种位置敏感性源于注意力流中的空间“近因效应”和解码轨迹中任务相关的转变。为了在没有 真值 标签的情况下减轻这种不稳定性,我们发现传统的单步置信度 ($C_{decoded}$) 在 dLLM 中失败。相反,我们提出平均置信度($\overline{C}$),这是一种跟踪迭代解码过程的新颖指标。通过建立基础空间 ICL 基线,我们引入了 Auto-ICL,这是一种 无需训练 自适应路由策略,可动态优化查询放置,在异构推理和感知任务中稳健地接近预言机性能。