论文

InjectRBP:通过模式注入引导大语言模型推理行为

InjectRBP: Steering Large Language Model Reasoning Behavior via Pattern Injection

模型推理推理策略与问题分解

摘要

推理能显著提升大型语言模型的性能。尽管近期研究利用与行为相关的提示调整来增强推理,这些设计在很大程度上仍是直觉性的,缺乏对底层行为模式的系统分析。受此启发,我们从行为模式的视角研究模型的推理行为如何塑造推理。我们观察到,模型在回答特定类型问题时会表现出自适应的推理行为分布,且结构性注入这些模式能实质性地影响模型推理过程与结果的质量。基于这些发现,我们提出两种无需参数更新的优化方法:InjectCorrect和InjectRLOpt。InjectCorrect通过模仿从模型自身过往正确答案中提取的行为模式来引导模型。InjectRLOpt从历史行为模式数据中学习价值函数,并通过我们提出的可靠性感知Softmax策略在推理时生成行为注入物以引导推理过程。我们的实验表明,两种方法均能在无需任何模型参数修改的情况下提升模型在多种推理任务上的表现,分别取得最高5.34%和8.67%的增益。

InjectRBP:通过模式注入引导大语言模型推理行为
图1:推理行为模式的分析过程,包括推理过程如何从推理文本中分解为结构化的“Reasoning Behavior Chain”和“Reasoning DNA”,以及如何裁剪高频 n‑gram 行为模式并将其结构化地注入模型,以增强模型的系统性推理能力。