论文
结果优化的悖论:LLM 中推理捷径的因果信息理论界限
The Paradox of Outcome Optimization: A Causal Information-Theoretic Bound on Reasoning Shortcuts in LLMs
摘要
通过基于结果的强化学习 (RL) 进行调整的 大语言模型 (LLM) 经常表现出一种关键的故障模式:它们在分布内基准测试中实现高性能,同时在分布外 (OOD) 任务上表现出脆弱的推理能力。我们将这种现象称为奖励引起的流形崩溃。我们建立了一个连接结构因果模型(SCM)和信息瓶颈(IB)原理的理论框架来解释这个悖论。我们将推理定义为高复杂性的因果过程,将捷径学习定义为对低复杂性虚假相关性的利用。在随机梯度下降(SGD)的隐式归纳偏差下,只要训练分布允许对真实因果机制进行“马尔可夫筛选”,针对结果奖励优化的模型就会偏向捷径解决方案。我们基于语义覆盖度量($η$)而不是样本大小得出了一个新的泛化界限,这表明了为什么在同质分布上进行数据缩放可能无法纠正推理缺陷。我们还表明,过程奖励模型(PRM)起到拓扑过滤器的作用,强制执行逐步的互信息约束,使低复杂性的捷径流形不可接受。这些结果为过程监督的作用提供了数学基础,超越了简单的贡献分配。