论文
TVS:用去噪轨迹差异检测扩散语言模型的RAG知识冲突
The Temporal Tug-of-War: Visualizing and Detecting RAG Conflicts in Diffusion Models via Trajectory Variance
摘要
检索增强生成(RAG)在离散扩散语言模型中引入了一种特定的失败模式:当检索到的上下文与参数知识相矛盾时,迭代去噪过程成为竞争知识源之间的可见战场。我们将时间语义分歧确定为检测这些冲突的可观察值,并引入轨迹方差分数(TVS),这是一种简单且可解释的分歧衡量标准。 TVS 计算独立随机去噪轨迹上答案嵌入的平均成对余弦距离,捕获参数吸引子和上下文吸引子之间的时间拉锯战。 TVS 只需要两次并行推理运行,计算量轻。在四个不同的数据集(Synthetic、SciQ、PopQA 和 CounterFact)中,使用 TVS 的简单逻辑回归分类器在 LLaDA 上实现了 70.10\%$ 的准确度和 0.7647$ AUROC。在 Dream 7B 上,将轨迹数量从 2 个增加到 5 个,精度从 $63.91\%$ 提高到 $69.62\%$。更复杂的顺序模型仅比线性分类器提供微小的改进。对 LLaDA 和 Dream 7B 的评估表明,冲突引起的轨迹动力学及其关键属性在不同的扩散架构中转移。