论文

Latent Reward Steering:隐式促进推理LLM认知行为的自适应推理时框架

Latent Reward Steering: An Adaptive Inference-Time Framework that Implicitly Promotes Cognitive Behaviors in Reasoning LLMs

模型推理解码与生成控制

摘要

强大的推理不仅取决于模型知识,还取决于认知行为在生成过程中部署的有效程度。现有方法往往依赖显式的行为级控制,当失败情形与所需修正随推理状态、任务和模型而变化时,其自适应性不足。为此,我们提出Latent Reward Steering(LRS),一种自适应的推理时框架,通过优化隐式承载认知行为的稀疏自编码器(SAE)潜在状态来促进认知行为。LRS不依赖预定义的认知行为或由其导出的引导方向,而是以最终答案正确性为监督,在推理轨迹上训练一个潜在奖励模型来估计中间潜在状态的质量。在推理过程中,奖励梯度为脆弱的潜在状态提供针对特定状态的修正方向,同时奖励与置信度门控将干预限制在奖励信号标记为脆弱的状态上。在多个推理LLM骨干和基准上的实验表明,LRS相对各种基线持续提升性能,事后分析进一步表明LRS隐式促进了能够修正原始推理错误的良好认知行为。代码已发布于:https://github.com/jiakanglee/Latent-Reward-Steering。

Latent Reward Steering:隐式促进推理LLM认知行为的自适应推理时框架:论文配图
图 1:动机。脆弱的推理状态可能会使推理脱轨,而明确的行为级别控制可能会受到固定标签和方向的影响。相反,Lrs 通过学习到的奖励信号来优化脆弱的潜在状态,并隐式地促进有用的认知行为。