论文

用于引导知识密集型推理的过程奖励智能体

Process Reward Agents for Steering Knowledge-Intensive Reasoning

模型推理推理搜索与路径规划

摘要

知识密集型领域中的推理仍然充满挑战,因为中间步骤往往无法在局部验证:与数学或代码不同,评估某一步的正确性可能需要综合来自大型外部知识源的线索。其结果是,细微的错误可能在推理轨迹中传播,甚至可能永远不会被发现。先前工作提出了过程奖励模型(Process Reward Models, PRMs),包括检索增强变体,但这些方法是事后(post hoc)运行的,对已完成的轨迹打分,因而无法整合进动态推理流程。本文提出过程奖励智能体(Process Reward Agents, PRA),一种在推理时为冻结策略提供基于领域、在线、逐步奖励的方法。与先前的检索增强PRM不同,PRA使基于搜索的解码能够在每个生成步骤对候选轨迹进行排序与剪枝。在多个医学推理基准上的实验表明,PRA持续超越强基线:配合Qwen3-4B在MedQA上达到81.9%的准确率,创下4B规模上的新最优纪录。重要的是,PRA可泛化到从0.5B到8B参数的未见过的冻结策略模型,在不做任何策略模型更新的情况下将其准确率最多提升25.7%。更广泛地看,PRA提示了一种范式:将冻结的推理器与领域特定奖励模块解耦,从而无需再训练即可在复杂领域部署新的骨干模型。

用于引导知识密集型推理的过程奖励智能体
图 1:我们的方法概述。过程奖励代理(PRA)观察冻结策略模型(推理器)生成的推理轨迹,决定何时搜索外部证据,并分配步骤级奖励。这种交互可以在推理时引导策略,从而实现更稳健和可控的推理,特别是在医学等知识密集型领域。