论文
偏好不是干预:读者特定证据效用的结构和稳定性边界
Preference Is Not Intervention: The Structure and Stability Boundaries of Reader-Specific Evidence Utility
摘要
机器学习系统越来越多地根据下游模型身份来决定决策,但这只有在特定于模型的差异形成可重用结构而不是输入本地交互时才有用。我们在检索增强生成(RAG)中对此进行了测试,可以在受控干预下测量证据效用。在固定查询、证据、任务、评分和干预的情况下,9 名读者对 33% 共同受影响的细胞中的效果标志存在分歧; reader$\times$查询交互解释了 29.8\% 的效用方差与 8.4\% 的排列空值;自选证据将 F1 提高了 $+0.031$ ($t=3.39$)。然后我们提出更尖锐的问题:\emph{这种异质性的哪些组成部分在查询中是稳定的读者属性?}分离三个可测量的对象——证据\emph{活动}、\emph{序数偏好}和\emph{条件符号方向}——我们发现序数读者几何在四个独立设置(分半$ρ=0.60$-$0.83$)中稳定:留一干预、PRISM偏好、 RAMDocs 和 RAGuard。有符号几何是受任务限制的:在开放式 QA 中较弱(0.14,0.35),特别是对于误导性和不相关的证据,但在二元事实检查中较强(0.75),没有显着的序数差距,尽管仍低于其稀疏性匹配上限。稀疏性、解码噪声和度量伪影无法解释主要的序号间隙。最后,稳定的序数相似性无法预测跨读者干预转移(oracle-distance $ρ=-0.27$;遗憾可靠性$-0.28$)。读者特定的效用存在,但偏好不是干预:稳定的排名相似性并不许可帮助/伤害决策的转移。