论文
推理的测度论分析:结构泛化和近似极限
A Measure-Theoretic Analysis of Reasoning: Structural Generalization and Approximation Limits
摘要
虽然 LLM 推理的经验标度定律有详细记录,但控制分布外 (OOD) 泛化的理论机制仍然难以捉摸。我们通过最优传输将推理形式化,将离散轨迹投影到连续度量空间中,以使用 Wasserstein-1 距离量化域移位。借助 Kantorovich 对偶性,我们通过建筑 Lipschitz 连续性和函数逼近限制来约束 OOD 泛化。这暴露了两个主要限制。首先,位置相关的注意力(例如,绝对位置编码)无法保持平移不变性,产生 $Ω(1)$ Lipschitz 常数和预期风险,而平移不变机制(例如,旋转嵌入)则保持等方差并限制误差。其次,通过将顺序回溯映射到 Dyck-$k$ 语言,我们为 $\text{TC}^0$ Transformer 建立严格的电路深度下界。缩放物理层深度对于避免表示崩溃是必要的——由于巴伦空间中不可约的近似界限,缩放表示宽度无法绕过这一限制。对组合搜索的 54 个 Transformer 配置的评估证实了这些界限,表明泛化风险随着 Wasserstein 域的变化单调降低。