论文
推理如何进行?在 LLM 中跟踪目标 RL 的注意力诱导信息流
How Does Reasoning Flow? Tracing Attention-Induced Information Flow for Targeted RL in LLMs
摘要
词元级 学分分配仍然是 大语言模型 (LLM) 中强化学习 (RL) 的一个关键障碍,其中 RL 配方通常平等地对待所有标记,无法区分决定性推理步骤与常规格式或流畅填充符。最近的尝试利用模型内部信号来分配更细粒度的信用,但这些通常是逐点启发式的,忽略了信息传播的全局结构。我们提出了 FlowTracer,这是一个 RL 框架,它在注意力诱导的有向无环图上跟踪以答案为目标的推理流,其中节点对应于词元,边缘容量来自聚合的注意力权重,并从该全局结构中导出词元信用。边缘容量被重新加权,以仅保留可以到达答案区域的影响,同时强制执行局部流守恒,因此中间词元既不会因路径长度或不相关分支而损失也不会获得有效质量。在此图中,FlowTracer 提取连接问题与答案的信息流主干,并根据流吞吐量对标记进行评分,从而揭示调解远程依赖关系的高影响力中心和聚合检查点。这些派生的重要性用于形成 词元级 奖励,使学习信号能够精确地集中在将信息路由到(或远离)正确答案的标记上,并在一系列推理任务中提供一致的性能增益。