论文

检索增强模型的来源依赖盲点:逐层轨迹诊断

The Attribution Blind Spot: Layerwise Trajectory Diagnostics for Source Reliance in Retrieval-Augmented Language Models

模型评测上下文与知识检索增强模型行为与机制分析

摘要

检索增强模型可以在不依赖文档的情况下匹配文档。受控的知识冲突使源选择变得可观察,让我们问第二个问题,仅靠预测无法回答:哪些内部状态属性定义了有用的干预方向?我们研究配对隐藏状态变化与潜在轨迹偏移(LTS),即训练拟合的第一主成分(PC1)上的符号投影,并将经过验证的训练暴露与行为源选择分开。在评估的冲突中,状态变化幅度通常是更强的预测因子,而带符号的 PC1 是更强的选择性控制器:等范干预改变源偏好,同时更好地保留非目标行为,并且冻结方向在测试数据集和对齐模型对之间转移。同一系统 OLMo 研究进一步将积极的选择和控制结果与所达到的功率下不确定的暴露检测结合起来。核心结果是分离:诊断模型将选择什么的表示不一定是最好控制该选择的表示。