论文
重新馈送不是重放:在反事实词元信用估计中测量重放噪声
Re-feeding Is Not Replaying: Measuring Replay Noise in Counterfactual Token-Credit Estimation
摘要
每个标记的反事实信用评估询问语言模型采样轨迹中的哪个标记导致最终答案是正确或错误的:在枢轴处剪切记录,替换替代标记,重播延续并比较结果。已发布的方法将重新输入转录本前缀作为新的提示,假设这会重现模型在生成过程中所经历的状态。我们通过三遍设计测量了该假设在库存推理引擎上的成本:从经过验证的解码时间 KV 状态恢复的延续、相同的第二个精确遍(复制本底噪声)和重新馈送遍。在六种配置和三种模型(包括 GRPO 训练的检查点)中,在低间隔决策词元下,重新喂养以比复制底线高出 14-28 个百分点的速率改变信用估计(在独立于治疗的条件下为 7-21 个百分点;问题聚类 t = 2.9-6.4)。大多数变化是量化估计器的零边界交叉而不是极性反转,并且扰动与均值零一致,因此平均量在很大程度上是安全的;但选择不是:通过重新馈送下的阈值 $|\hat{A}_t|$ 选择的关键词元集与 Jaccard 0.34-0.90 处的精确恢复选择重叠,而不是 0.63-0.96 副本上限。因果确认关闭了循环:在 vLLM 的批量不变内核下,所有三个通道在每个测量通道上都是相同的,两个不一致率恰好为零。副本传递本身不同意 9-23% 的合格估计:决策词元的单样本信用测量在任何重放下都是不可靠的。设置是预先确定的;检测了第二个活动中的精确传递缓存命中(100% 命中率,3,434 个枢轴);总计算费用低于 10 美元。我们建议反事实信用研究恢复解码器状态或使用批量不变内核,并报告副本楼层。