论文
自回归序列的矩阵解耦浓度:稀疏长上下文奖励的无维保证
Matrix-Decoupled Concentration for Autoregressive Sequences: Dimension-Free Guarantees for Sparse Long-Context Rewards
摘要
自回归 大语言模型 (LLM) 中的序列级评估依赖于高度依赖的标记生成。由于现有框架中的两个基本瓶颈,为这些过程建立严格的集中界限仍然是一个挑战:(i)经典的不等式通常将依赖结构与目标敏感性分开,导致标量崩溃,将方差代理膨胀到稀疏终端奖励的次优 $\mathcal{O}(N)$ ; (ii)相反,虽然某些空间方法实现了更严格的界限,但它们缺乏顺序生成所需的严格因果过滤,导致它们不适用于自回归设置。为了解决这两个瓶颈,我们为依赖序列建立了尖锐的 McDiarmid 型不等式,严格受因果依赖解析和目标敏感性向量的精确矩阵向量乘法控制。该矩阵解耦集中 (MDC) 框架本身可以恢复马尔可夫链的最佳常数,并利用定向 $d$ 分离来生成因果树的顺序最佳边界。至关重要的是,通过在严格的因果框架内精确保留奖励的坐标稀疏性,MDC 在数学上防止标量崩溃,保证无维 $\mathcal{O}(1)$ 方差代理,并为长上下文推理的稳定性提供严格的数学论证。