设计使然的纠缠:表格上下文学习器中的变量内虚假信号路由
Entangled by Design: Spurious Intra-Variable Signal Routing in Tabular In-Context Learners
摘要
设想一个在单家医院训练、用于预测患者康复的模型,其中测量特征 $X$ 将患者真实健康信号($C$)与该医院设备产生的系统性伪影($S$)捆绑在一起。在该院内部,伪影通过患者人口统计学等未测量混杂因素与结果相关;上下文学习器会“理性地”让预测经由 $S$ 而非 $C$,在部署到设备不同的新医院时静默失效。我们将其形式化为“复合表示中的虚假路由”:当特征 $X = [C;\,αS;\,η]$ 在不同子空间编码因果信号 $C$ 与虚假信号 $S$ 时,ICL无法判定是哪一个在驱动预测。我们证明,在ridge ICL(线性上下文学习器)下,无论上下文规模如何,这种路由都不可避免;最先进的预训练表格ICL模型TabPFN在实证中表现出定性一致的行为。我们推导出闭式刻画 $\mathrm{CSR} \propto ρ_S/ρ_C$,在线性ICL上以 $r = 0.997$、在TabPFN上以 $r = 0.979$ 得到验证。与直觉相反,更大的上下文会强化对主导上下文信号的投入,将虚假路由最多放大 $1.74\times$;在高虚假区域,表达力更强的模型在实证中表现出更大脆弱性(高纠缠下CSR差距 $+2.22$)。我们提出两种轻量缓解措施:环境分层上下文构造与S-swap增强,它们只需弱环境标签,且无需知道因果划分。S-swap将线性ICL的虚假路由降低 $74\%$、将TabPFN降低 $98.8\%$,同时TabPFN的因果敏感度提升 $8.4\times$:模型并非变得不加区分,而是改为经由因果信号路由。