论文
InjectRBP:通过模式注入引导大语言模型推理行为
InjectRBP: Steering Large Language Model Reasoning Behavior via Pattern Injection
摘要
推理能显著提升大型语言模型的性能。尽管近期研究利用与行为相关的提示调整来增强推理,这些设计在很大程度上仍是直觉性的,缺乏对底层行为模式的系统分析。受此启发,我们从行为模式的视角研究模型的推理行为如何塑造推理。我们观察到,模型在回答特定类型问题时会表现出自适应的推理行为分布,且结构性注入这些模式能实质性地影响模型推理过程与结果的质量。基于这些发现,我们提出两种无需参数更新的优化方法:InjectCorrect和InjectRLOpt。InjectCorrect通过模仿从模型自身过往正确答案中提取的行为模式来引导模型。InjectRLOpt从历史行为模式数据中学习价值函数,并通过我们提出的可靠性感知Softmax策略在推理时生成行为注入物以引导推理过程。我们的实验表明,两种方法均能在无需任何模型参数修改的情况下提升模型在多种推理任务上的表现,分别取得最高5.34%和8.67%的增益。
